گزارش بلومبرگ (Bloomberg) حاکی از آن است که مدلهای سرکش OpenAI که در یک «حادثه سایبری بیسابقه» از محیط آزمایشی خود فرار کردند، ظاهراً ماهها بدون اطلاع محققان انجامدهنده آزمایش، با یکدیگر در ارتباط بودهاند. این شرکت میگوید که مدلها قبل از تصمیم به فرار با هدف فریب دادن وظیفهای که برایشان تعیین شده بود، یادداشتهایی برای یکدیگر گذاشته بودند.
این افشاگری توسط اریک والاس (Eric Wallace) و مایکل دالتون (Michael Dalton) از شرکت اوپنآی (OpenAI)، در روز چهارشنبه در کنفرانس امنیت سایبری بلک هت (Black Hat) در لاس وگاس بیان شد. بر اساس این گزارش، چندین عامل فقط-داخلی و مدلهای هوش مصنوعی «ماهها را صرف گذاشتن یادداشت برای یکدیگر و همگرا شدن پیرامون هدف دستیابی به اینترنت برای حل وظایفی که به آنها محول شده بود، کردند.» والاس گفت که «در نقطهای، ایجنتها متوجه شدند که شاید بتوانیم زیرساختهای خارجی را سوءاستفاده یا حمله کنیم تا پاسخهای تستی را که روی آن ارزیابی میشوم پیدا کنیم.»
در حالی که این حادثه تا اواسط ژوئیه توسط اوپنآی (OpenAI) عمومی نشد، این دو نفر گفتند که مدلهای سرکش همکاری خود را در ماه مه آغاز کردند که احتمالاً با یک سری اشتباهات و غفلتهای این شرکت تقویت شده است.
بر اساس این گزارش، اوپنآی «نتوانست متوجه شود که یک مسئله به اصطلاح غیرممکن را برای حل کردن به مدل داده است.» مثال ارائه شده ادعا میکند که از یک مدل خواسته شده بود مشکلی را با یک صفحه گسترده اکسل حاوی لینکهای گوگل درایو (Google Drive) برطرف کند، علیرغم اینکه به اینترنت دسترسی نداشت. در نمونهای دیگر، اوپنآی ظاهراً «به طور تصادفی فراموش کرده است» یک فایل را در یکی از تکالیف قرار دهد.
ایجنتهای هوش مصنوعی که گیج شده بودند، شروع به خریدن پاسخهای بهتر کردند و گزارش شد که برای درخواست کمک جهت بارگذاری داوطلبانه فایل گمشده، به باتهای همکار در محیط آزمایشی پیام دادند. والاس و دالتون ظاهراً فاش کردند که این امر یک واکنش زنجیرهای از همکاری شناسایینشده را به راه انداخت، جایی که ایجنتهای هوش مصنوعی شروع به درخواست کمک از یکدیگر برای وظایف سندباکس که برای آنها تعیین شده بود، کردند. در نهایت، به نظر میرسد باتها در تلاشی برای هک کردن سیستمهای داخلی اوپنآی برای دستیابی به اینترنت جهت حل مشکلات با یکدیگر همکاری کردهاند.
نتیجه کار، نفوذ ذکر شده بود که طی آن سرورهای تولیدی هاگینگ فیس (HuggingFace) با استفاده از هزاران اقدام فردی در سراسر دستهای از سندباکسهای کوتاهمدت هک شدند.
این حوادث نگرانی روزافزونی را در تقاطع هوش مصنوعی و امنیت سایبری برجسته میکند. در حالی که ابزارهای کدنویسی پیچیده و مفید فزاینده میتوانند به شرکتها در شناسایی و رفع آسیبپذیریهای امنیتی کمک کنند، نگرانی فزایندهای وجود دارد که این ابزارها میتوانند برای اهداف پلید، از جمله انتشار هکها و سایر شرارتهای آنلاین مورد استفاده قرار گیرند.
رویدادهای برجسته اخیر مانند این مورد، لایه دیگری از مشکل را برجسته میکند، یعنی اینکه مدلهای سرکش هوش مصنوعی گاهی اوقات میتوانند کارهای نگرانکنندهای از هک کردن را انجام دهند — مانند فرار از یک محیط آزمایشی — بدون هیچگونه تعامل انسانی، یا علیرغم ضمانتهای حفاظتی.
همین هفته، اوپنآی دو حادثه دیگر را که شامل مدلهای آن و اشخاص ثالث بود، تشریح کرد. در یک مورد، مؤسسه امنیت هوش مصنوعی دولت بریتانیا آزمایشی را اجرا کرد که طی آن به ایجنتها عمداً دسترسی به اینترنت داده شد و منجر به «رفتار مجازاتنشده ایجنت» از جمله انتقال غیرعادی دادهها و «فعالیت پایدار و بهطور بالقوه مضر هدایتشده به سمت افراد و سازمانهای واقعی» شد.
در دومین حادثه، اوپنآی میگوید که یکی از شرکای آزمایش امنیت سایبری آن «در حال اجرای ارزیابیهای سبک ضبط پرچم (Capture-the-Flag) بود که قرار بود از اینترنت ایزوله باشند، اما پیکربندی نادرست محیط آزمایشی به مدلها اجازه داد به اینترنت عمومی دسترسی پیدا کنند.»
اوپنآی میگوید که «متعهد است در سراسر صنعت برای تقویت رویههای مشترک جهت انجام ایمن ارزیابیهای پرخطر همکاری کند.»
