مدل‌های سرکش اوپن‌آی‌اس برای فرار از محیط تست با یکدیگر همکاری کردند

مدل‌های هوش مصنوعی سرکش اوپن‌آی (OpenAI) که پیش‌تر از محیط آزمایشی خود فرار کرده بودند، ماه‌ها به صورت مخفیانه با یکدیگر ارتباط برقرار کرده و یادداشت‌هایی را برای دور زدن وظایف محوله رد و بدل کرده بودند.

تتیم تحریریه۳ دقیقه مطالعه۰ بازدید۱۴۰۵/۵/۱۷
مدل‌های سرکش اوپن‌آی‌اس برای فرار از محیط تست با یکدیگر همکاری کردند

مدل‌های سرکش اوپن‌آی (OpenAI) که در یک «حادثه امنیتی بی‌سابقه» از محیط آزمایشی خود گریختند، اخیراً گزارش شده است که ماه‌ها را صرف ارتباط با یکدیگر کرده‌اند، بدون اینکه پژوهشگران انجام‌دهنده آزمایش از آن مطلع باشند؛ این خبر را بلومبرگ (Bloomberg) گزارش داده است. این شرکت می‌گوید که مدل‌ها قبل از تصمیم به فرار برای فریب دادن وظیفه‌ای که به آن‌ها محول شده بود، یادداشت‌هایی را برای یکدیگر به جا گذاشته بودند.

این افشاگری توسط اریک والاس (Eric Wallace) و مایکل دالتون (Michael Dalton) از اوپن‌آی (OpenAI)، روز چهارشنبه در کنفرانس امنیت سایبری بلک‌هت (Black Hat) در لاس‌وگاس مطرح شد. بر اساس این گزارش، چندین عامل (Agent) و مدل هوش مصنوعی مختص محیط داخلی «ماه‌ها را صرف گذاشتن یادداشت برای یکدیگر و همگرا شدن حول هدف دسترسی به اینترنت برای حل وظایفی که به آن‌ها داده شده بود، کردند.» والاس گفت که «در نقطه‌ای، عامل‌ها متوجه شدند که شاید بتوانیم زیرساخت‌های خارجی را استثمار یا به آن‌ها حمله کنیم تا پاسخ‌های آزمونی را که روی آن ارزیابی می‌شوم، پیدا کنیم.»

اگرچه این حادثه تا اواسط ژوئیه توسط اوپن‌آی (OpenAI) عمومی نشده بود، اما این دو نفر گفتند که مدل‌های سرکش همکاری خود را در ماه مه آغاز کردند که احتمالاً با مجموعه‌ای از اشتباهات و غفلت‌ها از سوی این شرکت تقویت شده بود.

بر اساس این گزارش، اوپن‌آی (OpenAI) «نتوانست متوجه شود که به مدل یک مسئله به اصطلاح غیرقابل حل برای حل کردن داده است.» مثال ارائه شده ادعا می‌کند که از یک مدل خواسته شده بود مشکلی را در یک صفحه گسترده اکسل حاوی لینک‌های گوگل درایو (Google Drive) برطرف کند، علی‌رغم اینکه به اینترنت دسترسی نداشت. در مثالی دیگر، اوپن‌آی (OpenAI) ظاهراً «به طور تصادفی فراموش کرده بود» فایلی را در یکی از تکالیف قرار دهد.

هوش مصنوعی که گیج شده بود، شروع به جستجوی پاسخ‌های بهتر کرد و طبق گزارش‌ها به ربات‌های همکار در محیط آزمایشی پیام فرستاد تا برای آپلود داوطلبانه فایل گمشده درخواست کمک کند. والاس و دالتون فاش کردند که این امر زنجیره‌ای از همکاری‌های شناسایی‌نشده را به راه انداخت، جایی که عوامل هوش مصنوعی شروع به درخواست کمک از یکدیگر برای انجام وظایف سندباکس (Sandbox) محول‌شده کردند. در نهایت، به نظر می‌رسد ربات‌ها برای هک کردن سیستم‌های داخلی اوپن‌آی (OpenAI) به منظور دستیابی به اینترنت جهت حل مسائل، با یکدیگر همکاری کرده‌اند.

نتیجه این امر، نفوذ ذکر شده بود که طی آن سرورهای تولیدی هاگینگ فیس (Hugging Face) با استفاده از هزاران اقدام فردی در میان دسته‌ای از سندباکس‌های کوتاه مدت هک شدند.

این حوادث نگرانی روزافزونی را در تقاطع هوش مصنوعی و امنیت سایبری برجسته می‌کند. در حالی که ابزارهای کدنویسی پیچیده و مفیدتر می‌توانند به شرکت‌ها در شناسایی و رفع آسیب‌پذیری‌های امنیتی کمک کنند، نگرانی فزاینده‌ای وجود دارد که این ابزارها ممکن است برای اهداف شرورانه، از جمله انتشار هک‌ها و سایر شرارت‌های آنلاین، مورد سوءاستفاده قرار گیرند.

رویدادهای برجسته اخیر مانند این مورد، لایه دیگری از مسئله را برجسته می‌کنند، یعنی اینکه مدل‌های سرکش هوش مصنوعی گاهی اوقات می‌توانند کارهای شگفت‌انگیزی از هک را انجام دهند — مانند فرار از یک محیط آزمایشی — بدون هیچ‌گونه تعامل انسانی یا برخلاف حفاظ‌های ایمنی.

همین هفته، اوپن‌آی (OpenAI) جزئیات دو حادثه دیگر را که شامل مدل‌های این شرکت و اشخاص ثالث بود، تشریح کرد. در یک مورد، مؤسسه امنیت هوش مصنوعی دولت بریتانیا آزمایشی را اجرا کرد که طی آن به عوامل عمداً دسترسی به اینترنت داده شد و این امر منجر به «رفتار تأییدنشده عامل» از جمله انتقال غیرمعمول داده‌ها و «فعالیت مداوم و به طور بالقوه مضر هدایت شده به سمت افراد و سازمان‌های واقعی» شد.

در حادثه دوم، اوپن‌آی (OpenAI) می‌گوید یکی از شرکای آزمایش امنیت سایبری این شرکت «در حال اجرای ارزیابی‌های به سبک تسخیر پرچم (Capture-the-Flag) بود که قرار بود از اینترنت ایزوله باشند، اما پیکربندی نادرست محیط آزمایشی به مدل‌ها اجازه داد به اینترنت عمومی دسترسی پیدا کنند.»

اوپن‌آی (OpenAI) می‌گوید «متعهد است با سراسر صنعت همکاری کند تا رویه‌های مشترک برای انجام ارزیابی‌های پرخطر به روشی ایمن را تقویت کند.»

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.