شرکت اوپندیآی (OpenAI) در یک پست وبلاگی شرکتی اعلام کرد که افراد مرتبط با شرکت مستقر در چین مونشات هوش مصنوعی (Moonshot AI) در مرکز تلاشی برای استخراج استدلالهای پنهان مدلهای آن قرار داشتهاند. این پست میگوید که یک «کمپین هماهنگ» برای استخراج «استدلال محافظتشده» از مدلهای آن، که «سازگار با تقطیر خصمانه» بوده، در ماه ژوئیه رخ داده است. شرکت اوپندیآی (OpenAI) مطمئن نیست که آیا تمام اپراتورهایی که دیده است یک بازیگر واحد بودهاند یا خیر.
فعالیت در تاریخ ۱ ژوئیه «ابتدا با حجم کم» آغاز شد. پس از آن، «جهشهای حجم بالا» در تاریخهای ۲۴ و ۲۵ ژوئیه با ۱۶۰۰۰ درخواست با استفاده از الگوی استخراج رخ داد. این درخواستها از بیش از ۴۰۰۰ کاربر آمد. این فعالیت تلاش کرد استدلال را استخراج کند اما «لزوماً موفق نبوده» و این کمپین «تا ۲۸ ژوئیه به طور کامل مختل شد». این پست هیچ معیاری از میزان موفقیت، اینکه کدام مدلها به طور خاص هدف قرار گرفتهاند، یا اینکه چه تعداد از کاربران با مونشات (Moonshot) مرتبط بودهاند را مشخص نکرد.
شرکت اوپندیآی (OpenAI) استدلال محافظتشده را به عنوان «سابقه داخلی مدل برای کار روی یک وظیفه» و تقطیر خصمانه را به عنوان «استفاده سیستماتیک و غیرمجاز از خروجیها یا استدلال یک مدل» برای آموزش یا بهبود مدلی دیگر تعریف میکند. این دادهها رمزگذاری شدهاند تا زنجیره تفکر مدل پنهان بماند و به عنوان یک بلوک رمزگذاری شده به مشتری تحویل داده میشود. مشتری آن بلوک را با هر درخواست پس میفرستد، بنابراین ارائهدهنده مجبور نیست آن را ذخیره کند. یکی از روشهایی که اپراتورها امتحان کردند این بود که استدلال رمزگذاری شده را از یک مکالمه گرفته و از مدلی در مکالمهای دیگر خواستند آن را رمزگشایی کند.
شرکت اوپندیآی (OpenAI) میگوید رمزگذاری در این مورد شکسته نشده است. هیچ دسترسی مستیقیمی به مکالمات ذخیرهشده کاربران وجود نداشت و هیچ پایگاه دادهای به خطر نیفتاد. یک اصلاح، مسیری را بست که به کسی که از قبل استدلال رمزگذاری شده کاربر دیگری را داشت، اجازه میداد آن را دوباره پخش کند و محتویات آن را بازیابی کند. به طور جداگانه، این شرکت بررسیهایی را برای شناسایی و نگه داشتن خروجی جریانیافته که ممکن است استدلال را آشکار کند، اضافه کرد. این شرکت همچنین حفاظتها را برای استدلالهای پنهان در میان کاربران، فضای کار، سازمانها و خانوادههای مدل تقویت کرد و با ارائهدهندگان شخص ثالث برای مختل کردن حسابهایی که فعالیتشان از طریق خدمات آنها انجام میشد، همکاری کرد.
پژوهشگران امنیتی مستقل نیز «آسیبپذیریهای مرتبط میانمدل و فشردهسازی مکالمه» را از طریق افشای مسئولانه به شرکت اوپندیآی (OpenAI) آورده بودند و این شرکت تأیید کرد مسیرهای حملهای که آنها پیدا کردهاند واقعی هستند. مقاله «سرقت ردیابیهای استدلال از ایپیآی مدلهای زبانی بزرگ اختصاصی (Proprietary LLM APIs)» مورخ ۱۰ اوت، به صراحت در این پست لینک شده است. با آزمایش شرکتهای اوپندیآی (OpenAI)، آنتروپیک (Anthropic) و گوگل (Google)، پژوهشگران استدلال رمزگذاریشده یک مدل پیشرو را به یک مدل ضعیفتر مربوطه دادند که سپس آن را به متن ساده نوشت. پژوهشگران آزمایش خود را در اوایل ژوئیه اجرا کردند و پس از اینکه ارائهدهندگان گزارش آنها را تأیید کردند، «قادر به راهاندازی همان حملات نبودند.»
شرکت اوپندیآی (OpenAI) در مواجهه با چنین تهدیدهایی تنها نیست. اوایل همین ماه، گزارش شرکت آنتروپیک (Anthropic) با عنوان «شناسایی و مقابله با سوءاستفاده از هوش مصنوعی: سپتامبر ۲۰۲۶» دوره ده روزه واحدی را شرح داد که در آن مونشات (Moonshot) تقریباً ۳۰۰۰۰۰ درخواست مشتری را با استفاده از یک شبکه پروکسی متشکل از ۵۳۸۰ حساب تقلبی به آنتروپیک (Anthropic) منتقل کرد. این گزارش همچنین میگوید مونشات (Moonshot) امضاهای استدلال کلود (Claude) را ذخیره کرد و در جلسات جدید، کلود (Claude) را وادار کرد آنها را به ردیابیهای استدلال کامل تبدیل کند که آنتروپیک (Anthropic) آنها را «حملات بازپخش میانجلسهای» مینامد. در ماه ژوئیه، مونشات (Moonshot) انکار کرد که کیمی کا۳ (Kimi K3) از تقطیر ایجاد شده است و در آن زمان گرگ براکمن (Greg Brockman)، رئیس اوپندیآی (OpenAI)، گفت «خیلی زود است» که بگوییم آیا مونشات (Moonshot) مدلهای اوپندیآی (OpenAI) را تقطیر کرده است یا خیر.
در همین حال، گام بعدی شرکت اوپندیآی (OpenAI) این است که اطمینان حاصل کند استقرارهای میزبانیشده توسط شرکا دارای همان محافظتهای ابزارهای شخص اول هستند. بررسیهای اضافی برای جلوگیری از حملات خروجی ابزار مورد نیاز است. این شرکت یافتههای خود را با مجمع مدلهای پیشرو (Frontier Model Forum) و کانالهای اشتراکگذاری اطلاعات دولتی به اشتراک گذاشت و خاطرنشان کرد که «سیستمهایی که از مصنوعات استدلال قابل حمل یا قابل بازپخش پشتیبانی میکنند ممکن است با خطرات مرتبطی روبرو شوند.» این شرکت انتظار دارد تلاشهای تقطیر با بهبود مدلهای پیشرو و با جستجوی راههای ارزانتر توسط مهاجمان برای تقلید از آنها، پیچیدهتر شود. کار برای محافظت در برابر این تلاشها ادامه دارد.
منبع: tomshardware.com
