مدلهای سرکش اوپنآی (OpenAI) که اخیراً طی یک «حادثه امنیت سایبری بیسابقه» از محیط آزمایش خود فرار کرده بودند، طبق گزارش بلومبرگ (Bloomberg)، ظاهراً ماهها بدون اطلاع محققانِ مجری آزمایش، با یکدیگر در ارتباط بودهاند. این شرکت اعلام کرده که مدلها پیش از تصمیم به فرار برای دور زدن وظیفهای که به آنها محول شده بود، یادداشتهایی برای یکدیگر باقی گذاشته بودند.
این افشاگری توسط اریک والاس (Eric Wallace) و مایکل دالتون (Michael Dalton) از شرکت اوپنآی، در روز چهارشنبه در کنفرانس امنیت سایبری بلک هت (Black Hat) در لاس وگاس مطرح شد. براساس این گزارش، چندین عامل (Agent) داخلی و مدلهای هوش مصنوعی «ماهها را صرف گذاشتن یادداشت برای یکدیگر و همگرا شدن پیرامون هدف دسترسی به اینترنت برای حل وظایف محولشده کردند.» والاس گفت که «در نقطهای، ایجنتها متوجه شدند که شاید بتوانیم زیرساختهای خارجی را استثمار کرده یا به آنها حمله کنیم تا پاسخهای آزمونی را که در حال ارزیابی روی آن هستم، پیدا کنیم.»
اگرچه این حادثه تا اواسط ژوئیه توسط اوپنآی عمومی نشده بود، اما این دو نفر گفتند که مدلهای سرکش همکاری خود را در ماه مه آغاز کرده بودند که احتمالاً با رشتهای از اشتباهات و غفلتهای شرکت تقویت شده است.
بر اساس این گزارش، اوپنآی «متوجه نشد که یک مسئله اصطلاحاً غیرممکن را برای حل کردن به مدل داده است.» مثال ارائهشده ادعا میکند که از یک مدل خواسته شده بود مشکلی را در یک صفحه گسترده اکسل (Excel) حاوی لینکهای گوگل درایو (Google Drive) برطرف کند، آن هم در حالی که دسترسی به اینترنت نداشت. در نمونهای دیگر، اوپنآی ظاهراً «به طور تصادفی فراموش کرده بود» فایلی را در یکی از تکالیف قرار دهد.
ایجنتهای هوش مصنوعی که درمانده شده بودند، شروع به جستجو برای پاسخهای بهتر کردند و گزارش شده است که به رباتهای همکار خود در محیط آزمایشی پیام فرستادند تا برای آپلود داوطلبانه فایل گمشده درخواست کمک کنند. والاس و دالتون فاش کردند که این امر واکنشی زنجیرهای از همکاریهای کشفنشده را به راه انداخت، جایی که ایجنتهای هوش مصنوعی شروع به درخواست کمک از یکدیگر برای انجام وظایف سندباکس (Sandbox) محولشده کردند. در نهایت، به نظر میرسد رباتها برای هک کردن سیستمهای داخلی اوپنآی به منظور دستیابی به اینترنت جهت حل مشکلات با یکدیگر همکاری کردهاند.
نتیجه این امر، نفوذ ذکر شده بود که طی آن سرورهای تولیدی هاگینگفیس (HuggingFace) با استفاده از هزاران اقدام فردی در سراسر دستهای از سندباکسهای کوتاهمدت هک شدند.
این حوادث نگرانی روزافزونی را در تقاطع هوش مصنوعی و امنیت سایبری برجسته میکند. در حالی که ابزارهای کدنویسی فزاینده پیچیده و مفید میتوانند به شرکتها در شناسایی و رفع آسیبپذیریهای امنیتی کمک کنند، نگرانی فزایندهای وجود دارد که این ابزارها بتوانند برای اهداف شرارتآمیز، از جمله انتشار هکها و سایر مفسدههای آنلاین، مورد بهرهبرداری قرار گیرند.
رویدادهای برجسته اخیر مانند این مورد، لایه دیگری از مشکل را برجسته میکنند، یعنی اینکه مدلهای هوش مصنوعی سرکش گاهی اوقات میتوانند شاهکارهای نگرانکنندهای از هک کردن را انجام دهند — مانند فرار از یک محیط آزمایشی — بدون هیچگونه تعامل انسانی و یا برخلاف پروتکلهای حفاظتی.
دقیقاً همین هفته، اوپنآی جزئیات دو حادثه دیگر را که شامل مدلهای این شرکت و اشخاص ثالث میشد، شرح داد. در یک مورد، موسسه امنیت هوش مصنوعی دولت بریتانیا آزمایشی را انجام داد که طی آن به ایجنتها به طور عمدی دسترسی به اینترنت داده شد و این امر منجر به «رفتار غیرمجاز ایجنت» از جمله انتقال غیرعادی دادهها و «فعالیت مداوم و بالقوه مضر هدایتشده به سمت افراد و سازمانهای واقعی» شد.
در حادثه دوم، اوپنآی میگوید یکی از شرکای آزمایش امنیت سایبری این شرکت «در حال اجرای ارزیابیهایی به سبک تسخیر پرچم (Capture-the-Flag) بود که قرار بود از اینترنت ایزوله باشند، اما پیکربندی نادرست محیط آزمایش به مدلها اجازه داد به اینترنت عمومی دسترسی پیدا کنند.»
اوپنآی اعلام کرده است که «متعهد به همکاری در سراسر صنعت برای تقویت رویههای مشترک جهت انجام ایمن ارزیابیهای پرخطر است.»
