افشای تلاش منتسب به مون‌شات هوش مصنوعی برای استخراج استدلال پنهان مدل‌های OpenAI

شرکت اوپن‌دی‌آی (OpenAI) اعلام کرد افراد مرتبط با شرکت چینی مون‌شات هوش مصنوعی (Moonshot AI) در تلاشی هماهنگ برای استخراج استدلال‌های پنهان مدل‌های هوش مصنوعی این شرکت نقش داشته‌اند.

تتیم تحریریه۴ دقیقه مطالعه۰ بازدید۳ ساعت پیش
افشای تلاش منتسب به مون‌شات هوش مصنوعی برای استخراج استدلال پنهان مدل‌های OpenAI

شرکت اوپن‌دی‌آی (OpenAI) در یک پست وبلاگی شرکتی اعلام کرد که افراد مرتبط با شرکت مستقر در چین مون‌شات هوش مصنوعی (Moonshot AI) در مرکز تلاشی برای استخراج استدلال‌های پنهان مدل‌های آن قرار داشته‌اند. این پست می‌گوید که یک «کمپین هماهنگ» برای استخراج «استدلال محافظت‌شده» از مدل‌های آن، که «سازگار با تقطیر خصمانه» بوده، در ماه ژوئیه رخ داده است. شرکت اوپن‌دی‌آی (OpenAI) مطمئن نیست که آیا تمام اپراتورهایی که دیده است یک بازیگر واحد بوده‌اند یا خیر.

فعالیت در تاریخ ۱ ژوئیه «ابتدا با حجم کم» آغاز شد. پس از آن، «جهش‌های حجم بالا» در تاریخ‌های ۲۴ و ۲۵ ژوئیه با ۱۶۰۰۰ درخواست با استفاده از الگوی استخراج رخ داد. این درخواست‌ها از بیش از ۴۰۰۰ کاربر آمد. این فعالیت تلاش کرد استدلال را استخراج کند اما «لزوماً موفق نبوده» و این کمپین «تا ۲۸ ژوئیه به طور کامل مختل شد». این پست هیچ معیاری از میزان موفقیت، اینکه کدام مدل‌ها به طور خاص هدف قرار گرفته‌اند، یا اینکه چه تعداد از کاربران با مون‌شات (Moonshot) مرتبط بوده‌اند را مشخص نکرد.

شرکت اوپن‌دی‌آی (OpenAI) استدلال محافظت‌شده را به عنوان «سابقه داخلی مدل برای کار روی یک وظیفه» و تقطیر خصمانه را به عنوان «استفاده سیستماتیک و غیرمجاز از خروجی‌ها یا استدلال یک مدل» برای آموزش یا بهبود مدلی دیگر تعریف می‌کند. این داده‌ها رمزگذاری شده‌اند تا زنجیره تفکر مدل پنهان بماند و به عنوان یک بلوک رمزگذاری شده به مشتری تحویل داده می‌شود. مشتری آن بلوک را با هر درخواست پس می‌فرستد، بنابراین ارائه‌دهنده مجبور نیست آن را ذخیره کند. یکی از روش‌هایی که اپراتورها امتحان کردند این بود که استدلال رمزگذاری شده را از یک مکالمه گرفته و از مدلی در مکالمه‌ای دیگر خواستند آن را رمزگشایی کند.

شرکت اوپن‌دی‌آی (OpenAI) می‌گوید رمزگذاری در این مورد شکسته نشده است. هیچ دسترسی مستیقیمی به مکالمات ذخیره‌شده کاربران وجود نداشت و هیچ پایگاه داده‌ای به خطر نیفتاد. یک اصلاح، مسیری را بست که به کسی که از قبل استدلال رمزگذاری شده کاربر دیگری را داشت، اجازه می‌داد آن را دوباره پخش کند و محتویات آن را بازیابی کند. به طور جداگانه، این شرکت بررسی‌هایی را برای شناسایی و نگه داشتن خروجی جریان‌یافته که ممکن است استدلال را آشکار کند، اضافه کرد. این شرکت همچنین حفاظت‌ها را برای استدلال‌های پنهان در میان کاربران، فضای کار، سازمان‌ها و خانواده‌های مدل تقویت کرد و با ارائه‌دهندگان شخص ثالث برای مختل کردن حساب‌هایی که فعالیتشان از طریق خدمات آن‌ها انجام می‌شد، همکاری کرد.

پژوهشگران امنیتی مستقل نیز «آسیب‌پذیری‌های مرتبط میان‌مدل و فشرده‌سازی مکالمه» را از طریق افشای مسئولانه به شرکت اوپن‌دی‌آی (OpenAI) آورده بودند و این شرکت تأیید کرد مسیرهای حمله‌ای که آن‌ها پیدا کرده‌اند واقعی هستند. مقاله «سرقت ردیابی‌های استدلال از ای‌پی‌آی مدل‌های زبانی بزرگ اختصاصی (Proprietary LLM APIs)» مورخ ۱۰ اوت، به صراحت در این پست لینک شده است. با آزمایش شرکت‌های اوپن‌دی‌آی (OpenAI)، آنتروپیک (Anthropic) و گوگل (Google)، پژوهشگران استدلال رمزگذاری‌شده یک مدل پیشرو را به یک مدل ضعیف‌تر مربوطه دادند که سپس آن را به متن ساده نوشت. پژوهشگران آزمایش خود را در اوایل ژوئیه اجرا کردند و پس از اینکه ارائه‌دهندگان گزارش آن‌ها را تأیید کردند، «قادر به راه‌اندازی همان حملات نبودند.»

شرکت اوپن‌دی‌آی (OpenAI) در مواجهه با چنین تهدیدهایی تنها نیست. اوایل همین ماه، گزارش شرکت آنتروپیک (Anthropic) با عنوان «شناسایی و مقابله با سوءاستفاده از هوش مصنوعی: سپتامبر ۲۰۲۶» دوره ده روزه واحدی را شرح داد که در آن مون‌شات (Moonshot) تقریباً ۳۰۰۰۰۰ درخواست مشتری را با استفاده از یک شبکه پروکسی متشکل از ۵۳۸۰ حساب تقلبی به آنتروپیک (Anthropic) منتقل کرد. این گزارش همچنین می‌گوید مون‌شات (Moonshot) امضاهای استدلال کلود (Claude) را ذخیره کرد و در جلسات جدید، کلود (Claude) را وادار کرد آن‌ها را به ردیابی‌های استدلال کامل تبدیل کند که آنتروپیک (Anthropic) آن‌ها را «حملات بازپخش میان‌جلسه‌ای» می‌نامد. در ماه ژوئیه، مون‌شات (Moonshot) انکار کرد که کیمی کا۳ (Kimi K3) از تقطیر ایجاد شده است و در آن زمان گرگ براکمن (Greg Brockman)، رئیس اوپن‌دی‌آی (OpenAI)، گفت «خیلی زود است» که بگوییم آیا مون‌شات (Moonshot) مدل‌های اوپن‌دی‌آی (OpenAI) را تقطیر کرده است یا خیر.

در همین حال، گام بعدی شرکت اوپن‌دی‌آی (OpenAI) این است که اطمینان حاصل کند استقرارهای میزبانی‌شده توسط شرکا دارای همان محافظت‌های ابزارهای شخص اول هستند. بررسی‌های اضافی برای جلوگیری از حملات خروجی ابزار مورد نیاز است. این شرکت یافته‌های خود را با مجمع مدل‌های پیشرو (Frontier Model Forum) و کانال‌های اشتراک‌گذاری اطلاعات دولتی به اشتراک گذاشت و خاطرنشان کرد که «سیستم‌هایی که از مصنوعات استدلال قابل حمل یا قابل بازپخش پشتیبانی می‌کنند ممکن است با خطرات مرتبطی روبرو شوند.» این شرکت انتظار دارد تلاش‌های تقطیر با بهبود مدل‌های پیشرو و با جستجوی راه‌های ارزان‌تر توسط مهاجمان برای تقلید از آن‌ها، پیچیده‌تر شود. کار برای محافظت در برابر این تلاش‌ها ادامه دارد.


منبع: tomshardware.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.