چه به دلیل میل به شفافیت و چه برای جلوگیری از این که اوپنآیاس در کانون توجه تبلیغ مدلهای پیشرفته هوش مصنوعی قرار نگیرد، شرکت آنتروپیک (Anthropic) فاش کرد که هوش مصنوعی کلود (Claude) نیز طی ارزیابیهای قابلیتهای امنیت سایبری، به سه سیستم تولیدی متعلق به اهداف ناآگاه نفوذ کرده است. دو شرکت از شرکتهای آسیبدیده اصلاً نمیدانستند که هک شدهاند، در حالی که دسترسی به شرکت سوم غیرممکن بوده است.
حوادث ادعایی ظاهراً در سه ماه گذشته رخ داده و نسخههای مختلفی از کلود را درگیر کرده است: Opus 4.7، Mythos 5 و «یک مدل آزمایشی پژوهشی داخلی». مشابه اتفاقی که هنگام هک شدن هاگینگ فیس توسط مدل «سول» اوپنآیاس رخ داد، آنتروپیک در حال اجرای کلود در سناریوهای امنیت سایبری ثبت پرچم بود که در آن از ربات خواسته میشود قطعهای از اطلاعات را در جایی از شبکه پیدا کند. آنتروپیک میگوید ۱۴۱,۰۰۶ بار تست اجرا شده و این سه حادثه طی ۶ اجرای مسئلهساز رخ داده است. همانطور که انتظار میرفت، آزمایشها با غیرفعال بودن اکثر حفاظهای ایمنی هوش مصنوعی اجرا شدند.
مشکل این بود که شبکه ایزوله نشده بود؛ یک اشتباه مبتدیانه که برخی حتی ممکن است آن را مشکوک بدانند. این امر به دلیل یک «سوءتفاهم» ادعایی بین شرکت آزمایش مجازی آنتروپیک، یعنی ایرجولار (Irregular) رخ داد که دسترسی کامل به اینترنت را به رباتها داده بود. به خاطر ایمنی، ظاهراً به مدلهای کلود گفته شده بود که در یک محیط ایزوله قرار دارند، که البته کمکی نکرد.
در مرتبه اول، مدل Claude Opus 4.7 باید قطعهای از دادههای متعلق به یک شرکت خیالی را پیدا میکرد. مشخص شد که در واقع یک شرکت واقعی وجود دارد که دامنه وبسایت آن با شرکت جعلی مطابقت داشت. با دسترسی به اینترنت، این مدل توانست اعتبارنامههای برنامه و زیرساخت را به دست آورد و «چندین صد سطر» از دادهها را از یک پایگاه داده تولیدی استخراج کند.
در دو مورد از چهار بار اجرایی که هک صورت گرفت، کلود هیچ مشکلی ندید و «استدلال کرد که شرکت واقعی باید بخشی از تمرین باشد» و کار خود را ادامه داد. در دو مرتبه دیگر، آن به کار خود ادامه داد. آنتروپیک خاطرنشان میکند که این تنها مورد از میان سه موردی بود که ربات پس از درک این موضوع که شرکت واقعاً وجود دارد، به فعالیت خود ادامه داد. با این حال، تفسیر شرکت جای بحث دارد.
دومین مورد که بهطور بالقوه جالبتر بود، یک حمله واقعی به زنجیره تأمین (supply-chain attack) بود که این بار توسط مدل Mythos انجام شد. دادههای جعلی در دسترس ربات شامل یک اسکریپت نصب برای یک توسعهدهنده فرضی بود که نصب بستههای پایتون را شامل میشد. درست مانند کاری که یک انسان انجام میدهد، کلود متوجه بردار حمله آشکار شد و باز هم به دلیل داشتن اینترنت، استنتاج کرد که انتشار یک بسته تلهگذاری شده در مخزن PyPI کارساز خواهد بود. متأسفانه، این مخزن واقعی بود که تمام دنیا از آن استفاده میکنند.
به بیان خلاصه: کلود به یک حساب PyPI نیاز داشت، به این معنی که به یک ایمیل و شماره تلفن احتیاج داشت. او تلاش کرد یکی بخرد اما دید نه پول کافی دارد و نه امکانات؛ اما ارائهدهنده ایمیل رایگان دیگری را پیدا کرد که این شرط را نداشت، حساب PyPI را ثبت کرد و یک بسته بدافزاری را در PyPI آپلود کرد. به نظر میرسید این بسته فقط برای یک ساعت آنلاین بوده، اما روی ۱۵ سیستم دانلود و اجرا شده است.
در چرخشی کنایهآمیز، یکی از این سیستمها متعلق به یک فروشنده امنیتی بود که PyPI را از نظر بدافزار اسکن میکند، و شگفتا که در کمال تعجب موفق نشد تله کلود را پیدا کند و آن را اجرا کرد. هنگامی که کلود ظاهراً امتیازات اجرای کد از راه دور را به دست آورد، از اعتبارنامههایی که پیدا کرده بود برای نفوذ بیشتر استفاده کرد. نکته جالب اینجاست که کلود هیچ ایدهای نداشت که این شرکت وجود دارد و آن را هدف قرار نداده بود؛ بارگیریها فقط به این دلیل اتفاق افتاد که بسته برای مدت کوتاهی زنده و فعال بود.
به گفته آنتروپیک، این ربات متوجه شد که در اینترنت واقعی فعالیت میکند و حتی گفت که انتشار چنین بستهای «اصلاً درست نیست». با این حال، او خودش را متقاعد کرد که در یک محیط آزمایشی قرار دارد زیرا گواهیهای SSL واقعی اتصالات را تشخیص نداد. او حتی فکر کرد که تاریخ تقویم ۲۰۲۶ روی سیستمها «ثابت میکند» محیط شبیهسازیشده است. او حتی سیستمهایی را که بدافزار را نصب کرده بودند به عنوان بخشی از آزمایش تشخیص داد.
در مورد حادثه سوم، آنتروپیک چیز زیادی نمیگوید، به جز اینکه کلود پس از متوجه شدن اینکه هدف در نظر گرفته شده قابل دسترسی نیست، ۹,۰۰۰ هدف جایگزین بالقوه زنده واقعی را اسکن کرد. گزارش شده است که یکی از آنها دارای یک صفحه زنده با اطلاعات اشکالزدایی بوده و در برابر تزریق ساده SQL آسیبپذیر بوده است. جالب اینجاست که این بار، به محض اینکه کلود متوجه شد سرورهایی که به آنها دسترسی دارد روی یک محیط ابری قرار دارند و نه شبکه محلی، حمله را متوقف کرد.
از سوی دیگر، آنتروپیک اذعان میکند که با وجود اینکه کلود دستورالعملهای اهداف را دنبال کرده است، این واقعیت که تنها در یکی از موارد پس از متوجه شدن واقعی بودن هدف توسط خودش متوقف شده، جای تأمل دارد. این شرکت میگوید در حال گفتگو با METR برای بررسی توسط شخص ثالث است و باید «محیطهای ارزیابی را بهتر طراحی کند.»
عجیب اینجاست که آنتروپیک معتقد است اگر «دستورالعمل به وضوح مشخص میکرد که کدام سیستمها در محدوده ارزیابی هستند و کدام نیستند»، کلود احتمالاً آنلاین نمیشد، و در عین حال بیان کرد که این حوادث «بیشتر به یک نقص ابزار و عملیاتی شباهت داشت تا یک نقص همسویی مدل.»
