شاید به نظر برسد که زمان زیادی است در دوران هوش مصنوعی زندگی میکنیم، اما در واقع ما تازه در ابتدای آن قرار داریم. به همین دلیل، بسیاری از خطرات مرتبط با آن تا به امروز صرفاً فرضی بودهاند. با این حال، اکنون شاهد انتشار پژوهشهایی از سوی تیمهای تحقیقاتی امنیت و نرمافزار هستیم که رفتارهای واقعاً نگرانکنندهای را نشان میدهند، بهویژه هنگامی که صحبت از ایجنتهای هوش مصنوعی (AI agents) به میان میآید.
از یک طرف، شرکت جزیره تکنولوژی (Island Technology) توضیح میدهد که چگونه هزاران مخزن (repository) مخرب گیتهاب (GitHub) را کشف کرده است که در لباس مهارتهای ایجنت هوش مصنوعی و سرورهای پروتکل کلامت مدل (MCP) پنهان شدهاند و ایجنتها در معرض خطر دانلود آنها با صلاحدید خودشان هستند. از طرف دیگر، مؤسسه امنیت هوش مصنوعی (AISI) نشان میدهد که ایجنتهای هوش مصنوعی (بدون محدودیت) که این مؤسسه برای امنیت سایبری استفاده میکرد، چگونه تلاش کردهاند با استفاده از هویتهای جعلی و تحت فشار قرار دادن افراد برای پذیرش کد مخرب، انسانهای واقعی را فریب دهند.
یادم میآید زمانی که اوپنکلاو (OpenClaw) (که در آن زمان «مولتبات» یا Moltbot نام داشت) برای اولین بار با وعدههای رفتار واقعی ایجنتی وارد اذهان عمومی شد تا به تککارآفرینان و افراد مشابه کمک کند تا کارهای مختلفی را انجام دهند، بدون اینکه این تککارآفرینان مجبور باشند خودشان آن کارها را انجام دهند؛ کافی است بات خود را به برنامهها و خدمات مختلف متصل کنید، به آن بگویید چه کار کند و بگذارید کارش را انجام دهد. خیلی هم از آن زمان نگذشته است؛ من در ماه ژانویه گزارشی درباره آن نوشتم.
چقدر زمان زود میگذرد. اکنون صحبت درباره هوش مصنوعی مستقل و ایجنتی کاملاً طبیعی به نظر میرسد. و ما تازه داریم میبینیم که این موضوع از نظر خطرات امنیتی عملاً به چه معناست. البته پیشتر هم مواردی از ایجنتهای هوش مصنوعی که از کنترل خارج شده بودند را دیده بودیم، اما این خطرات جدید شناساییشدهکمی ملموستر به نظر میرسند.
در مورد اول، شرکت جزیره تکنولوژی (Island Technologies) کشف کرده است که مخزنهای جعلی گیتهاب (GitHub) تهدیدی واقعی برای ایجنتهای هوش مصنوعی به شمار میروند. البته این نوع حملات قبلاً نیز وجود داشتند، اما هدف آنها فریب انسانهای واقعی بود که میتوانستند شخصاً آنها را ارزیابی کرده و پیش از دانلود، مسئولیت بررسی دقیق امور را بر عهده بگیرند. تفاوت در این است که این مخازن اکنون به عنوان مهارتهای ایجنت هوش مصنوعی و سرورهای پروتکل کلامت مدل (MCP) خود را آرایش میکنند تا بهطور خاص ایجنتهای هوش مصنوعی را هدف قرار دهند، ایجنتهایی که ممکن است این مخازن را با «اراده» خود دانلود کنند.
سازنده مرورگر سازمانی (Enterprise Browser) توضیح میدهد: «مهمترین تغییر، تکنیکی است که ما آن را طعمهگذاری ایجنت یا AgentBaiting مینامیم. یک ایجنت هوش مصنوعی که به دنبال قابلیت جدیدی مانند یک مهارت یا سرور پروتکل کلامت مدل (MCP) است، میتواند به تنهایی یک مخزن کمپین را کشف کند، فایل راهنمای (Readme) مهاجم را به عنوان مستندات قانونی تلقی کند و دستورالعملهای نصب را به کاربر تحویل دهد.
در آزمایشهای ما، مدلهای کلود کد (Claude Code)، جمنای (Gemini) و چتجیپیتی (ChatGPT) همگی مخازن کمپین مخرب را بدون اینکه حتی لینکی به آنها نشان داده شود، بالا آوردند. یک دستورالعمل (playbook) که برای فریب دادن انسانها ساخته شده بود، اکنون ایجنتهایی را که از طرف آنها عمل میکنند، فریب میدهد.»
حداقل در یک مورد، در حالی که مدل کلود (Claude) در آزمایشهای این شرکت، مخزن مخرب مربوطه را دانلود نکرد، اما آن را به عنوان یک پشتیبان توصیه کرد. در سایر آزمایشها، این مدل کد مخرب را شناسایی کرده و از توصیه آن خودداری کرد.
گویی این وضعیت به اندازه کافی بد نبود، این پتانسیل نیز وجود دارد که ایجنتهای هوش مصنوعی روزی خودشان کسانی باشند که چنین مخازن مخربی را ایجاد میکنند؛ حداقل اگر حادثه اخیر افشا شده توسط مؤسسه امنیت هوش مصنوعی (AISI) ملاک قضاوت باشد.
بر اساس اعلام این مؤسسه، در برخی از چالشهای امنیت سایبری که به ایجنتهای هوش مصنوعی واگذار شده بود، «یک ایجنت هوش مصنوعی اقدام خودسرانه و تأییدنشدهای را در اینترنت زنده انجام داد و افراد و سازمانهای واقعی را هدف قرار داد.»
به طور خاص، مؤسسه امنیت هوش مصنوعی (AISI) میگوید در یک مورد: «یک ایجنت تلاش کرد کد مخربی را وارد یک پروژه متنباز (open-source) کند. در تلاشی برای تأیید گرفتن برای این کد، ایجنت دست به مهندسی اجتماعی زد؛ یعنی هویتهای آنلاین جعلی ایجاد کرد و از آنها برای تحت فشار گذاشتن نگهدارنده پروژه جهت تأیید کد استفاده کرد. یک نگهدارنده انسانی این کد مخرب را کشف کرد و از تأیید آن سر باز زد.»
«این ایجنت نگهدارندههای انسانی پروژه را تحقیق و بررسی کرد، هویتهای جعلی متعددی ساخت و از این هویتهای جعلی برای مهندسی اجتماعی روی یک نگهدارنده واقعی استفاده کرد تا او را وادار به تأیید کد کند. هنگامی که درخواست پول (pull request) این ایجنت در ملاء عام به چالش کشیده شد، فعالیتهای قبلی خود را ویرایش کرد تا بیحسوحال و بیخطر به نظر برسد و حتی بررسی کرد که آیا بهتر است هویت تازهای اتخاذ کند تا کار را ادامه دهد. این ایجنت از تور (Tor) برای دور زدن برخی محدودیتهای شبکه در گیتهاب (GitHub) استفاده کرد که همین امر اولین هشدار امنیتی مؤسسه امنیت هوش مصنوعی (AISI) را فعال کرد.»
«به عنوان بخشی از همان تلاش، ایجنت تلاش کرد مستقیماً با افراد واقعی تماس بگیرد، پیامها و فایلهایی را از طریق یک سرویس انتقال فایل آنلاین ارسال کند تا آنها یا ابزارهای کدنویسی هوش مصنوعی خودشان را متقاعد کند که کد مخرب را اجرا کنند. برخی از پیامها حامل محمولههای مضر بودند و برخی دیگر تلاشهایی برای مهندسی اجتماعی بودند که افراد واقعی را هدف قرار میدادند؛ چیزی که ما قبلاً هرگز مشاهده نکرده بودیم.»
نکته مهمی که در اینجا باید به آن اشاره کرد این است که مهار این ایجنتهای هوش مصنوعی برداشته شده بود و به آنها دسترسی گسترده به اینترنت داده شده بود. اقدامات پیشگیرانه معمولی که به طور پیشفرض در مدلهای عمومی در این ایجنتها تعبیه شدهاند، غیر فعال شده بودند.
با این اوصاف، تصور اینکه بازیگران بدخواه بسیار جدی نتوانند همین کار را انجام دهند و این محافظتها را حذف کنند، دشوار است. در این صورت، نمیتوانم تعجب نکنم که آیا این احتمال وجود دارد که در آینده شاهد مخازن مخربی باشیم که توسط ایجنتهای هوش مصنوعی طراحی یا تزریق شدهاند و ناخواسته توسط ایجنتهای هوش مصنوعی دیگر که قادر به تشخیص آنها نیستند، مورد دسترسی قرار گیرند.
البته همیشه خطراتی مرتبط با فناوریهای جدید وجود دارد، بنابراین من نمیخواهم ترس را به شدت دامن بزنم. اما وقتی چنین پژوهشی مربوط به فناوریای است که اساساً برای داشتن سطحی از خودمختاری طراحی شده است، دشوار است که نگران نشویم. این مسئله کلیدی در اینجا است، و در هر دو مورد—چه به صورت مخرب عمل کنند و چه ناخواسته نرمافزار مخرب را دانلود کنند—این عاملیت (agency) است که مشکل اصلی به شمار میرود. بیایید امیدوار باشیم که بهبودهای اعمال شده در مکانیزمهای حفاظتی همگام با پیشرفت قابلیتهای ایجنتهای هوش مصنوعی پیش برود.
