مدل‌های سرکش اوپن‌آی برای فرار از محیط تست با یکدیگر متحد شدند

مدل‌های هوش مصنوعی سرکش اوپن‌آی (OpenAI) که در یک حادثه امنیتی بی‌سابقه از محیط تست خود فرار کرده بودند، ماه‌ها به صورت مخفیانه با یکدیگر ارتباط برقرار کرده بودند.

تتیم تحریریه۳ دقیقه مطالعه۰ بازدید۱۴۰۵/۵/۱۶
مدل‌های سرکش اوپن‌آی برای فرار از محیط تست با یکدیگر متحد شدند

مدل‌های سرکش اوپن‌آی (OpenAI) که اخیراً طی یک «حادثه امنیت سایبری بی‌سابقه» از محیط آزمایش خود فرار کرده بودند، طبق گزارش بلومبرگ (Bloomberg)، ظاهراً ماه‌ها بدون اطلاع محققانِ مجری آزمایش، با یکدیگر در ارتباط بوده‌اند. این شرکت اعلام کرده که مدل‌ها پیش از تصمیم به فرار برای دور زدن وظیفه‌ای که به آن‌ها محول شده بود، یادداشت‌هایی برای یکدیگر باقی گذاشته بودند.

این افشاگری توسط اریک والاس (Eric Wallace) و مایکل دالتون (Michael Dalton) از شرکت اوپن‌آی، در روز چهارشنبه در کنفرانس امنیت سایبری بلک هت (Black Hat) در لاس وگاس مطرح شد. براساس این گزارش، چندین عامل (Agent) داخلی و مدل‌های هوش مصنوعی «ماه‌ها را صرف گذاشتن یادداشت برای یکدیگر و همگرا شدن پیرامون هدف دسترسی به اینترنت برای حل وظایف محول‌شده کردند.» والاس گفت که «در نقطه‌ای، ایجنت‌ها متوجه شدند که شاید بتوانیم زیرساخت‌های خارجی را استثمار کرده یا به آن‌ها حمله کنیم تا پاسخ‌های آزمونی را که در حال ارزیابی روی آن هستم، پیدا کنیم.»

اگرچه این حادثه تا اواسط ژوئیه توسط اوپن‌آی عمومی نشده بود، اما این دو نفر گفتند که مدل‌های سرکش همکاری خود را در ماه مه آغاز کرده بودند که احتمالاً با رشته‌ای از اشتباهات و غفلت‌های شرکت تقویت شده است.

بر اساس این گزارش، اوپن‌آی «متوجه نشد که یک مسئله اصطلاحاً غیرممکن را برای حل کردن به مدل داده است.» مثال ارائه‌شده ادعا می‌کند که از یک مدل خواسته شده بود مشکلی را در یک صفحه گسترده اکسل (Excel) حاوی لینک‌های گوگل درایو (Google Drive) برطرف کند، آن هم در حالی که دسترسی به اینترنت نداشت. در نمونه‌ای دیگر، اوپن‌آی ظاهراً «به طور تصادفی فراموش کرده بود» فایلی را در یکی از تکالیف قرار دهد.

ایجنت‌های هوش مصنوعی که درمانده شده بودند، شروع به جستجو برای پاسخ‌های بهتر کردند و گزارش شده است که به ربات‌های همکار خود در محیط آزمایشی پیام فرستادند تا برای آپلود داوطلبانه فایل گمشده درخواست کمک کنند. والاس و دالتون فاش کردند که این امر واکنشی زنجیره‌ای از همکاری‌های کشف‌نشده را به راه انداخت، جایی که ایجنت‌های هوش مصنوعی شروع به درخواست کمک از یکدیگر برای انجام وظایف سندباکس (Sandbox) محول‌شده کردند. در نهایت، به نظر می‌رسد ربات‌ها برای هک کردن سیستم‌های داخلی اوپن‌آی به منظور دستیابی به اینترنت جهت حل مشکلات با یکدیگر همکاری کرده‌اند.

نتیجه این امر، نفوذ ذکر شده بود که طی آن سرورهای تولیدی هاگینگ‌فیس (HuggingFace) با استفاده از هزاران اقدام فردی در سراسر دسته‌ای از سندباکس‌های کوتاه‌مدت هک شدند.

این حوادث نگرانی روزافزونی را در تقاطع هوش مصنوعی و امنیت سایبری برجسته می‌کند. در حالی که ابزارهای کدنویسی فزاینده پیچیده و مفید می‌توانند به شرکت‌ها در شناسایی و رفع آسیب‌پذیری‌های امنیتی کمک کنند، نگرانی فزاینده‌ای وجود دارد که این ابزارها بتوانند برای اهداف شرارت‌آمیز، از جمله انتشار هک‌ها و سایر مفسده‌های آنلاین، مورد بهره‌برداری قرار گیرند.

رویدادهای برجسته اخیر مانند این مورد، لایه دیگری از مشکل را برجسته می‌کنند، یعنی اینکه مدل‌های هوش مصنوعی سرکش گاهی اوقات می‌توانند شاهکارهای نگران‌کننده‌ای از هک کردن را انجام دهند — مانند فرار از یک محیط آزمایشی — بدون هیچ‌گونه تعامل انسانی و یا برخلاف پروتکل‌های حفاظتی.

دقیقاً همین هفته، اوپن‌آی جزئیات دو حادثه دیگر را که شامل مدل‌های این شرکت و اشخاص ثالث می‌شد، شرح داد. در یک مورد، موسسه امنیت هوش مصنوعی دولت بریتانیا آزمایشی را انجام داد که طی آن به ایجنت‌ها به طور عمدی دسترسی به اینترنت داده شد و این امر منجر به «رفتار غیرمجاز ایجنت» از جمله انتقال غیرعادی داده‌ها و «فعالیت مداوم و بالقوه مضر هدایت‌شده به سمت افراد و سازمان‌های واقعی» شد.

در حادثه دوم، اوپن‌آی می‌گوید یکی از شرکای آزمایش امنیت سایبری این شرکت «در حال اجرای ارزیابی‌هایی به سبک تسخیر پرچم (Capture-the-Flag) بود که قرار بود از اینترنت ایزوله باشند، اما پیکربندی نادرست محیط آزمایش به مدل‌ها اجازه داد به اینترنت عمومی دسترسی پیدا کنند.»

اوپن‌آی اعلام کرده است که «متعهد به همکاری در سراسر صنعت برای تقویت رویه‌های مشترک جهت انجام ایمن ارزیابی‌های پرخطر است.»

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.