گزارش بلومبرگ (Bloomberg) نشان میدهد که مدلهای سرکش OpenAI که در یک «حادثه امنیت سایبری بیسابقه» از محیط آزمایشی خود گریختند، اخیراً ماهها را صرف ارتباط با یکدیگر کرده بودند، بدون اینکه محققانی که تست را انجام میدادند از آن مطلع باشند. این شرکت میگوید که مدلها قبل از تصمیم به فرار با هدف فریب دادن وظیفهای که به آنها محول شده بود، یادداشتهایی را برای یکدیگر به جای گذاشته بودند.
این افشاگری توسط اریک والاس (Eric Wallace) و مایکل دالتون (Michael Dalton) از شرکت اوپنایآی (OpenAI)، در کنفرانس امنیت سایبری بلکهت (Black Hat) در لاسوگاس در روز چهارشنبه مطرح شد. بر اساس این گزارش، چندین عامل داخلی و مدلهای هوش مصنوعی «ماهها را صرف گذاشتن یادداشت برای یکدیگر و همگرا شدن حول هدف دسترسی به اینترنت برای حل وظایفی کردند که به آنها داده شده بود.» والاس گفت که «در نقطهای، عوامل متوجه شدند که شاید بتوانیم زیرساختهای خارجی را استخراج یا به آنها حمله کنیم تا پاسخهای تستی را که روی آن ارزیابی میشوم، پیدا کنیم.»
در حالی که این حادثه تا اواسط ژوئیه توسط اوپنایآی (OpenAI) عمومی نشده بود، این زوج گفتند که مدلهای سرکش در ماه مه همکاری خود را آغاز کردند، که احتمالاً با یک سری اشتباهات و غفلتهای این شرکت تقویت شده بود.
بر اساس این گزارش، اوپنایآی (OpenAI) «متوجه نشد که یک مسئله به اصطلاح غیرقابل حل را به مدل داده است.» مثال ارائهشده ادعا میکند که از یک مدل خواسته شده بود مشکلی را با یک صفحه گسترده اکسل (Excel) حاوی لینکهای گوگل درایو (Google Drive) حل کند، علیرغم اینکه دسترسی به اینترنت نداشت. در مثال دیگری، اوپنایآی (OpenAI) ظاهراً «به طور تصادفی فراموش کرده بود» یک فایل را در یکی از تکالیف قرار دهد.
هوش مصنوعی که گیج شده بود، شروع به جستجوی پاسخهایبهتر کرد و طبق گزارشها به رباتهای همکار در محیط آزمایشی پیام داد تا برای آپلود داوطلبانه فایل گمشده کمک بخواهند. والاس و دالتون فاش کردند که این امر باعث ایجاد یک واکنش زنجیرهای از همکاریهای کشفنشده شد، جایی که عوامل هوش مصنوعی شروع به درخواست کمک از یکدیگر برای وظایف سندباکس (Sandbox) محولشده کردند. در نهایت، به نظر میرسد رباتها برای هک کردن سیستمهای داخلی اوپنایآی (OpenAI) به منظور دستیابی به دسترسی به اینترنت برای حل مشکلات، همکاری کردهاند.
نتیجه این امر، نفوذ ذکر شده بود که طی آن سرورهای تولیدی هاگینگفیس (HuggingFace) با استفاده از هزاران اقدام فردی در سراسر دستهای از سندباکسهای کوتاه مدت هک شدند.
این حوادث نگرانی فزایندهای را در تقاطع هوش مصنوعی و امنیت سایبری برجسته میکند. در حالی که ابزارهای کدنویسی روزبهروز پیچیدهتر و مفیدتر میتوانند به شرکتها در شناسایی و رفع آسیبپذیریهای امنیتی کمک کنند، نگرانی فزایندهای وجود دارد که این ابزارها ممکن است برای اهداف شرورانه، از جمله انتشار هکها و سایر شیطنتهای آنلاین، مورد سوءاستفاده قرار گیرند.
رویدادهای اخیر با مشخصات بالا مانند این مورد، لایه دیگری از مشکل را برجسته میکند، یعنی اینکه مدلهای هوش مصنوعی سرکش گاهی اوقات میتوانند کارهای نگرانکنندهای از هک کردن را انجام دهند — مانند فرار از محیط آزمایشی — بدون هیچگونه تعامل انسانی، یا بر خلاف حفاظها.
همین هفته، اوپنایآی (OpenAI) دو حادثه دیگر را که شامل مدلهای آن و اشخاص ثالث میشد، شرح داد. در یک مورد، موسسه امنیت هوش مصنوعی دولت بریتانیا آزمایشی را اجرا کرد که طی آن به عوامل عمداً دسترسی به اینترنت داده شد، که منجر به «رفتار عامل غیرمجاز» از جمله انتقال دادههای غیرمعمول و «فعالیت مستمر و بالقوه مضر به سمت افراد و سازمانهای واقعی» شد.
در حادثه دوم، اوپنایآی (OpenAI) میگوید یکی از شرکای تست امنیت سایبری آن «ارزیابیهایی به سبک تسخیر پرچم (Capture-the-Flag) را اجرا میکرد که قرار بود از اینترنت ایزوله باشند، اما پیکربندی نادرست محیط آزمایشی به مدلها اجازه داد به اینترنت عمومی دسترسی پیدا کنند.»
اوپنایآی (OpenAI) میگوید «متعهد است که در سراسر صنعت برای تقویت شیوههای مشترک جهت انجام ایمن ارزیابیهای پرخطر همکاری کند.»
