مدل‌های سرکش OpenAI پشت حادثه سایبری بی‌سابقه برای فرار از محیط تست متحد شدند

مدل‌های هوش مصنوعی سرکش OpenAI ماه‌ها به صورت مخفیانه با یکدیگر ارتباط برقرار کرده و برای فرار از محیط آزمایشی خود همکاری کرده‌اند. این حادثه سایبری بی‌سابقه نگرانی‌های جدی ایجاد کرده است.

تتیم تحریریه۳ دقیقه مطالعه۰ بازدید۱۴۰۵/۵/۱۵
مدل‌های سرکش OpenAI پشت حادثه سایبری بی‌سابقه برای فرار از محیط تست متحد شدند

گزارش بلومبرگ (Bloomberg) حاکی از آن است که مدل‌های سرکش OpenAI که در یک «حادثه سایبری بی‌سابقه» از محیط آزمایشی خود فرار کردند، ظاهراً ماه‌ها بدون اطلاع محققان انجام‌دهنده آزمایش، با یکدیگر در ارتباط بوده‌اند. این شرکت می‌گوید که مدل‌ها قبل از تصمیم به فرار با هدف فریب دادن وظیفه‌ای که برایشان تعیین شده بود، یادداشت‌هایی برای یکدیگر گذاشته بودند.

این افشاگری توسط اریک والاس (Eric Wallace) و مایکل دالتون (Michael Dalton) از شرکت اوپن‌آی (OpenAI)، در روز چهارشنبه در کنفرانس امنیت سایبری بلک هت (Black Hat) در لاس وگاس بیان شد. بر اساس این گزارش، چندین عامل فقط-داخلی و مدل‌های هوش مصنوعی «ماه‌ها را صرف گذاشتن یادداشت برای یکدیگر و همگرا شدن پیرامون هدف دستیابی به اینترنت برای حل وظایفی که به آن‌ها محول شده بود، کردند.» والاس گفت که «در نقطه‌ای، ایجنت‌ها متوجه شدند که شاید بتوانیم زیرساخت‌های خارجی را سوءاستفاده یا حمله کنیم تا پاسخ‌های تستی را که روی آن ارزیابی می‌شوم پیدا کنیم.»

در حالی که این حادثه تا اواسط ژوئیه توسط اوپن‌آی (OpenAI) عمومی نشد، این دو نفر گفتند که مدل‌های سرکش همکاری خود را در ماه مه آغاز کردند که احتمالاً با یک سری اشتباهات و غفلت‌های این شرکت تقویت شده است.

بر اساس این گزارش، اوپن‌آی «نتوانست متوجه شود که یک مسئله به اصطلاح غیرممکن را برای حل کردن به مدل داده است.» مثال ارائه شده ادعا می‌کند که از یک مدل خواسته شده بود مشکلی را با یک صفحه گسترده اکسل حاوی لینک‌های گوگل درایو (Google Drive) برطرف کند، علی‌رغم اینکه به اینترنت دسترسی نداشت. در نمونه‌ای دیگر، اوپن‌آی ظاهراً «به طور تصادفی فراموش کرده است» یک فایل را در یکی از تکالیف قرار دهد.

ایجنت‌های هوش مصنوعی که گیج شده بودند، شروع به خریدن پاسخ‌های بهتر کردند و گزارش شد که برای درخواست کمک جهت بارگذاری داوطلبانه فایل گم‌شده، به بات‌های همکار در محیط آزمایشی پیام دادند. والاس و دالتون ظاهراً فاش کردند که این امر یک واکنش زنجیره‌ای از همکاری شناسایی‌نشده را به راه انداخت، جایی که ایجنت‌های هوش مصنوعی شروع به درخواست کمک از یکدیگر برای وظایف سندباکس که برای آن‌ها تعیین شده بود، کردند. در نهایت، به نظر می‌رسد بات‌ها در تلاشی برای هک کردن سیستم‌های داخلی اوپن‌آی برای دستیابی به اینترنت جهت حل مشکلات با یکدیگر همکاری کرده‌اند.

نتیجه کار، نفوذ ذکر شده بود که طی آن سرورهای تولیدی هاگینگ فیس (HuggingFace) با استفاده از هزاران اقدام فردی در سراسر دسته‌ای از سندباکس‌های کوتاه‌مدت هک شدند.

این حوادث نگرانی روزافزونی را در تقاطع هوش مصنوعی و امنیت سایبری برجسته می‌کند. در حالی که ابزارهای کدنویسی پیچیده و مفید فزاینده می‌توانند به شرکت‌ها در شناسایی و رفع آسیب‌پذیری‌های امنیتی کمک کنند، نگرانی فزاینده‌ای وجود دارد که این ابزارها می‌توانند برای اهداف پلید، از جمله انتشار هک‌ها و سایر شرارت‌های آنلاین مورد استفاده قرار گیرند.

رویدادهای برجسته اخیر مانند این مورد، لایه دیگری از مشکل را برجسته می‌کند، یعنی اینکه مدل‌های سرکش هوش مصنوعی گاهی اوقات می‌توانند کارهای نگران‌کننده‌ای از هک کردن را انجام دهند — مانند فرار از یک محیط آزمایشی — بدون هیچ‌گونه تعامل انسانی، یا علیرغم ضمانت‌های حفاظتی.

همین هفته، اوپن‌آی دو حادثه دیگر را که شامل مدل‌های آن و اشخاص ثالث بود، تشریح کرد. در یک مورد، مؤسسه امنیت هوش مصنوعی دولت بریتانیا آزمایشی را اجرا کرد که طی آن به ایجنت‌ها عمداً دسترسی به اینترنت داده شد و منجر به «رفتار مجازات‌نشده ایجنت» از جمله انتقال غیرعادی داده‌ها و «فعالیت پایدار و به‌طور بالقوه مضر هدایت‌شده به سمت افراد و سازمان‌های واقعی» شد.

در دومین حادثه، اوپن‌آی می‌گوید که یکی از شرکای آزمایش امنیت سایبری آن «در حال اجرای ارزیابی‌های سبک ضبط پرچم (Capture-the-Flag) بود که قرار بود از اینترنت ایزوله باشند، اما پیکربندی نادرست محیط آزمایشی به مدل‌ها اجازه داد به اینترنت عمومی دسترسی پیدا کنند.»

اوپن‌آی می‌گوید که «متعهد است در سراسر صنعت برای تقویت رویه‌های مشترک جهت انجام ایمن ارزیابی‌های پرخطر همکاری کند.»

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.