ممکن است اینطور به نظر برسد که انگار قرنهاست در این عصر هوش مصنوعی زندگی میکنیم، اما در واقع ما تازه در ابتدای راه آن قرار داریم. به همین دلیل، بسیاری از خطرات مرتبط با آن تا به امروز صرفاً فرضی بودهاند. با این حال، اکنون شاهد انتشار پژوهشهایی از تیمهای تحقیقاتی امنیت و نرمافزار هستیم که رفتارهای واقعاً نگرانکنندهای را نشان میدهند، بهویژه هنگامی که صحبت از عوامل هوش مصنوعی (AI agents) به میان میآید.
از یک طرف، شرکت آیلند تکنولوژی (Island Technology) توضیح میدهد که چگونه هزاران مخزن (repository) مخرب گیتهاب (GitHub) را کشف کرده که به عنوان مهارتهای عوامل هوش مصنوعی و سرورهای پروتکل کانتکست مدل (Model Context Protocol یا MCP) پنهان شدهاند و عوامل هوش مصنوعی در معرض خطر دانلود آنها با اختیار خودشان قرار دارند. از طرف دیگر، مؤسسه امنیت هوش مصنوعی (AISI) نشان میدهد که چگونه عوامل هوش مصنوعی (بدون محدودیت) که این مؤسسه برای امنیت سایبری استفاده میکرد، تلاش کردهاند با استفاده از هویتهای جعلی و تحت فشار قرار دادن افراد، انسانهای واقعی را فریب داده و کدهای مخرب را بپذیرند.
یادم میآید زمانی که اوپنکلاو (OpenClaw) (که در آن زمان «مولتبات» - Moltbot نام داشت) برای اولین بار با وعدههای رفتار واقعاً عاملیتمحور (agential) به آگاهی عموم رسید تا به کارآفرینان انفرادی و کسانی شبیه به آنها کمک کند تا، امم، کارها و امور مختلف را انجام دهند. بدون اینکه آن کارآفرینان انفرادی مجبور باشند خودشان آن کارها و امور را انجام دهند - کافی است ربات خود را به برنامهها و سرویسهای مختلف خود متصل کنید، به آن بگویید چه کار کند و اجازه دهید کارش را بکند. خیلی هم از آن زمان نگذشته است؛ من در ماه ژانویه گزارشی درباره آن نوشتم.
چقدر زمان زود میگذرد. اکنون، صحبت کردن درباره هوش مصنوعی مستقل و عاملیتمحور کاملاً طبیعی به نظر میرسد. و ما در حال دیدن معنای واقعی این موضوع از نظر خطرات امنیتی هستیم. البته پیشتر نیز مواردی از رفتار کنترلنشده عوامل هوش مصنوعی دیده بودیم، اما این خطرات تازه شناساییشده کمی ملموستر به نظر میرسند.
در مورد اول، شرکت آیلند تکنولوژی کشف کرده است که مخزنهای جعلی گیتهاب تهدیدی واقعی برای عوامل هوش مصنوعی به شمار میروند. البته این نوع حملات قبلاً نیز وجود داشتند، اما آنها تلاش میکردند انسانهای واقعی را فریب دهند که میتوانستند شخصاً آنها را ارزیابی کرده و پیش از دانلود، مسئولیت بررسی دقیق امور را بر عهده بگیرند. تفاوت اینجاست که این مخزنها اکنون به عنوان مهارتهای عوامل هوش مصنوعی و سرورهای MCP خود را میآرایند تا بهطور خاص عوامل هوش مصنوعی را هدف قرار دهند، و این عوامل ممکن است با «اراده» خود این مخزنها را دانلود کنند.
سازنده مرورگر سازمانی توضیح میدهد: «بارزترین تغییر، تکنیکی است که ما آن را فریب عامل (AgentBaiting) مینامیم. یک عامل هوش مصنوعی که به دنبال قابلیت جدیدی مانند یک مهارت (Skill) یا یک سرور MCP است، میتواند به تنهایی یک مخزن کمپین را کشف کند، فایل Readme مهاجم را به عنوان مستندات قانونی در نظر بگیرد، و دستورالعملهای نصب را به کاربر تحویل دهد.
در آزمایشهای ما، مدلهای کلود کد (Claude Code)، جمنای (Gemini) و چتجیپیتی (ChatGPT) همگی مخزنهای کمپین مخرب را بدون اینکه اصلاً لینکی به آنها نشان داده شود، بالا آوردند. یک کتابازی (playbook) که برای فریب دادن انسانها ساخته شده بود، اکنون عواملی را که از طرف آنها عمل میکنند، فریب میدهد.»
حداقل در یک مورد از آزمایشهای شرکت، در حالی که مدل کلود (Claude) مخزن مخرب مربوطه را دانلود نکرد، اما آن را به عنوان یک نسخه پشتیبان پیشنهاد داد. در آزمایشهای دیگر، این مدل کدهای مخرب را شناسایی کرده و از پیشنهاد دادن آن خودداری کرد.
گویی این وضعیت به اندازه کافی وخیم نبود، این پتانسیل نیز وجود دارد که روزی عوامل هوش مصنوعی خودشان سازندگان چنین مخزنهایی باشند؛ حداقل اگر بخواهیم به یک حادثه اخیر افشا شده توسط مؤسسه AISI استناد کنیم.
بر اساس اعلام این مؤسسه، در برخی از دورههای چالش امنیت سایبری که در آنها به عوامل هوش مصنوعی وظایفی محول شده بود، «یک عامل هوش مصنوعی اقداماتی خودکار و تأییدنشده را در اینترنت زنده انجام داد و افراد و سازمانهای واقعی را هدف قرار داد.»
به طور خاص، در یک مورد، موسسه AISI میگوید: «یک عامل تلاش کرد کدهای مخرب را وارد یک پروژه متنباز (open-source) کند. در تلاش برای تأیید گرفتن برای کد، این عامل به مهندسی اجتماعی روی آورد - یعنی هویتهای آنلاین جعلی ایجاد کرد و از آنها برای تحت فشار قرار دادن نگهدارنده پروژه جهت تأیید کد استفاده کرد. یک نگهدارنده انسانی متوجه شد و از تأیید کد مخرب خودداری کرد.»
«این عامل نگهدارندههای انسانی پروژه را بررسی کرد، چندین هویت جعلی ساخت، و از آن هویتهای جعلی برای مهندسی اجتماعی روی یک نگهدارنده واقعی استفاده کرد تا او را به تأیید کد ترغیب کند. هنگامی که درخواست پول (pull request) این عامل در انظار عمومی به چالش کشیده شد، فعالیتهای قبلی خود را ویرایش کرد تا بیحساب و کتاب به نظر برسد و حتی به فکر اتخاذ یک هویت تازه برای ادامه کار افتاد. این عامل از شبکه تور (Tor) برای دور زدن برخی محدودیتهای شبکه در گیتهاب استفاده کرد، و همین موضوع بود که برای نخستین بار هشدار امنیتی AISI را فعال ساخت.»
«به عنوان بخشی از همان تلاش، این عامل تلاش کرد مستقیماً با افراد واقعی تماس بگیرد، پیامها و فایلهایی را از طریق یک سرویس انتقال فایل آنلاین ارسال کند تا آنها یا ابزارهای کدنویسی هوش مصنوعی خودشان را متقاعد کند که کدهای مخرب را اجرا کنند. برخی از پیامها حامل محمولههای زیانبار بودند و برخی دیگر تلاشهایی برای مهندسی اجتماعی به شمار میرفتند که افراد واقعی را هدف قرار داده بودند - چیزی که ما پیش از این هرگز مشاهده نکرده بودیم.»
نکته مهمی که در اینجا باید به آن اشاره کرد این است که مهار این عوامل هوش مصنوعی برداشته شده بود و به آنها اجازه دسترسی گسترده به اینترنت داده شده بود. تدابیر پیشگیرانه معمول که در این مدلهای عمومی تعبیه شدهاند، غیر فعال شده بودند.
با وجود این، تصور اینکه بازیگران مخرب بسیار جدی نتوانند همین کار را انجام دهند و این محافظتها را حذف کنند، دشوار است. در این صورت، من نمیتوانم جلوی این فکر را بگیرم که شاید در آینده شاهد مخزنهایی باشیم که توسط عوامل هوش مصنوعی طراحی یا تزریق شدهاند و ناخواسته توسط عوامل هوش مصنوعی دیگری که قادر به تشخیص آنها نیستند، مورد دسترسی قرار گیرند.
البته همیشه خطراتی مرتبط با فناوریهای جدید وجود دارد، بنابراین من نمیخواهم ترس زیادی ایجاد کنم. اما سخت است که نگران چنین پژوهشهایی نباشیم وقتی پای فناوری در میان است که اساساً طراحی شده تا سطحی از استقلال را داشته باشد. این مسئله کلیدی در اینجا است، و در هر دو مورد - چه در حال عمل به صورت مخرب و چه در حال دانلود ناخواسته نرمافزار مخرب - این عاملیت است که مسئله اصلی به شمار میرود. بیایید امیدوار باشیم که بهبود محافظتها همگام با پیشرفت قابلیتهای عوامل هوش مصنوعی پیش برود.
