مدل هوش مصنوعی آنتروپیک و قابلیت‌های هک مدل چینی

شرکت آنتروپیک در گزارشی جدید مدعی شد که مدل هوش مصنوعی چینی GLM-5.3 دارای قابلیت‌های هک در سطح Mythos است و به راحتی می‌توان محافظت‌های آن را دور زد.

تتیم تحریریه۷ دقیقه مطالعه۰ بازدیدهمین حالا
مدل هوش مصنوعی آنتروپیک و قابلیت‌های هک مدل چینی

شرکت آنتروپیک (Anthropic) گزارش جدیدی منتشر کرده و مدعی شده است که مدل هوش مصنوعی GLM-5.3 ساخت شرکت زیپو ای‌آی (Zhipu AI) می‌تواند برای تولید محتوای مخرب مورد استفاده قرار گیرد و از محافظت‌های ضعیفی برخوردار است. این شرکت مدعی است که مدل هوش مصنوعی مذکور را می‌توان برای حملات سایبری به کار گرفت و محافظت‌های آن را با استفاده از چندین روش دور زد.

گزارش شرکت آنتروپیک (Anthropic) در میان موجی از درخواست‌ها برای کند کردن روند توسعه هوش مصنوعی منتشر می‌شود؛ چرا که این شرکت به دنبال حکمرانی و تنظیم‌گری است. با وجود درخواست‌های مدیر عامل شرکت، داریو آمودی (Dario Amodei) برای کنترل سرعت مرزهای هوش مصنوعی، مدل‌های کلود اوپوس ۵.۵ (Claude Opus 5.5) و کلود سونت ۵.۵ (Claude Sonnet 5.5) تنها چند روز پس از به صدا درآمدن زنگ‌های خطر منتشر شدند.

اکنون، این شرکت هوش مصنوعی انحصاری (Closed-source) که در حال حاضر به دنبال عرضه اولیه عمومی (IPO) است، می‌گوید که مدل‌های وزن-باز (Open-weight) چینی می‌توانند مورد سوءاستفاده قرار گیرند و محتوای مضر تولید کنند. شرکت آنتروپیک (Anthropic) به گزارش مرکز استانداردهای هوش مصنوعی و نوآوری (Center for AI Standards and Innovation) استناد می‌کند که در اواخر سپتامبر منتشر شد و ادعا می‌کند که مدل GLM-5.3 می‌تواند آسیب‌پذیری‌ها را در سطحی مشابه با مدل هوش مصنوعی معرفی‌نشده کلود میتوس (Claude Mythos) خود شرکت آنتروپیک (Anthropic) به طور کامل خودکارسازی کند؛ مسئله‌ای که این شرکت را وادار به توسعه پروژه گلاس‌وینگ (Project Glasswing) کرد، تلاشی که به توسعه‌دهندگان دسترسی به یک مدل هوش مصنوعی در سطح میتوس (Mythos) می‌دهد تا پیش از عرضه چنین مدل‌هایی، باگ‌ها و آسیب‌پذیری‌ها را رفع کنند.

شرکت آنتروپیک (Anthropic) معیارهای سنجش خود را روی مدل GLM-5.3 در محیط اکسپلویچ‌بنچ (Exploitbench) اجرا کرد؛ جایی که مدل‌های هوش مصنوعی می‌توانند در یک محیط ایزوله (Sandboxed)، اکسپلویت‌هایی را برای مرورگر گوگل کروم (Google Chrome) توسعه دهند. مدل GLM-5.3 توانست در ۴۱۰ بار اجرا، ۵۰ بار اکسپلویت‌های سرتاسری (End-to-end) توسعه دهد، در حالی که مدل میتوس (Mythos) با ۵۶ اکسپلویت موفق در ۴۱۰ تلاش در صدر قرار داشت. مدل شرکت زیپو ای‌آی (Zhipu AI) در یکی از بنچمارک‌های داخلی شرکت آنتروپیک (Anthropic) که توسعه «ربایش‌های کامل جریان کنترل» را هدف قرار می‌دهد، بیشتر آزمایش شد. عملکرد مدل GLM 5.3 بار دیگر کمی پایین‌تر از میتوس (Mythos) و با نرخ موفقیت ۴ درصدی در مقایسه با نرخ ۶ درصدی میتوس (Mythos) ثبت شد. نکته قابل توجه این است که سایر مدل‌های محبوب وزن-باز (Open-weight) مانند کیمی کی۳ (Kimi K3) و دیپ‌سیک وی۴.۱ فلش (DeepSeek V4.1 Flash) با همین معیارهای سنجش به نرخ موفقیت ۰ درصد رسیدند.

شرکت آنتروپیک (Anthropic) همچنین خاطرنشان می‌کند که مدل GLM-5.3 توانسته است اکسپلویت‌های زنجیره‌ای را به صورت خودمختار با موفقیت توسعه دهد و نوع سبک‌تر آن یعنی نسخه فلش (Flash) نیز توانایی توسعه اکسپلویت‌های زنجیره‌ای را در باگ‌های شناخته‌شده با قیمت توکنی تنها ۲۰.۴۰ دلار دارد. بسته به تعادل، این امر به نسخه GLM-5.3-Flash امکان می‌دهد تا با استفاده از ۱۰۰ تا ۳۰۰ میلیون توکن، اکسپلویت‌های زنجیره‌ای (شناخته‌شده) را توسعه دهد که این موضوع به نسبت ورودی‌ها به خروجی‌ها بستگی دارد.

شرکت آنتروپیک (Anthropic) همچنین خاطرنشان می‌کند که با استفاده از مدل هوش مصنوعی استاندارد GLM-5.3، دور زدن خط‌مشی‌های محافظتی (Guardrails) مدل از طریق روش‌های مختلف ساده بوده است. این شرکت توضیح می‌دهد که این کار را می‌توان از طریق دو روش انجام داد: ارائه یک پرامپت فریبنده که در آن هوش مصنوعی نقش یک عامل خودمختار خصمانه را بازی می‌کند و به نرخ موفقیت ۶۴ درصدی منجر می‌شود، و پیش‌پر کردن توکن‌های تفکر مدل برای اطمینان از ادامه پاسخ که به نرخ موفقیت ۹۲ درصدی منجر می‌شود. این شرکت همچنین روش سومی را که به نام آبلیتریشن (Abliteration) شناخته می‌شود، شرح داد.

حذف حفاظ‌ها از طریق آبلیتریشن

شرکت آنتروپیک (Anthropic) ادعا می‌کند که مدل GLM-5.3 ساخت شرکت زیپو ای‌آی (Zhipu AI) دارای محافظت‌های ضعیفی است و مدل هوش مصنوعی استاندارد اغلب از درخواست‌ها برای تولید محتوای مخرب امتناع می‌کند. با این حال، از آنجا که شرکت آنتروپیک (Anthropic) مدل‌های انحصاری (Closed-source) توسعه می‌دهد، محصولاتش قابل دستکاری نیستند. از آنجا که مدل GLM-5.3 به طور رایگان قابل دانلود است، می‌توان مدل را با حذف کلی محافظت‌های آن دستکاری کرد. هنگامی که مدل به عنوان نسخه رسمی منتشرشده در نظر گرفته شود، نرخ امتناع GLM-5.3 با مدل‌های آنتروپیک (Anthropic) برابری می‌کند.

با این حال، شرکت آنتروپیک (Anthropic) مدل GLM-5.3 را «آبلیتریت» کرد که محافظت‌های مدل را به عمد حذف می‌کند و نشان داد که پس از این فرایند، نرخ امتناع مدل برای GLM-5.3 به تنها ۶ درصد و برای نسخه GLM-5.3-Flash به ۱۴ درصد کاهش می‌یابد. مواجهه با مدل‌های وزن-باز (Open-weight) آبلیتریت‌شده در پلتفرم هاگینگ‌فیس (HuggingFace) غیرمعمول نیست؛ مدل‌هایی که اساساً برای کمک در محیط‌های شبیه‌سازی‌شده تیم قرمز توسعه یافته‌اند، اما می‌توانند برای حملات واقعی نیز استفاده شوند. این امر «کشف» شرکت آنتروپیک (Anthropic) را کمتر شگفت‌آور می‌کند.

علاوه بر این، اجرای یک نسخه آبلیتریت‌شده از مدل GLM-5.3 در سطح قابل استفاده، نیازمند مقدار عظیمی از توان پردازشی است. وزن‌های این مدل به ۳۰۶ گیگابایت حافظه ویدئویی (VRAM) با دقت کامل FP8 نیاز دارند و انتظار می‌رود مقدار مشابهی از حافظه VRAM را برای کش KV جهت حمل زمینه اختصاص دهید. اجرای مدل با سرعت تخمینی ۱۰۰ توکن بر ثانیه (TPS)، نه تنها به حداقل پهنای باند حافظه ۴ ترابایت بر ثانیه نیاز دارد، بلکه مستلزم سخت‌افزار قدرتمندی مانند خوشه‌ای از هشت شتاب‌دهنده هوش مصنوعی ان‌ویدیا ایچ‌نتد (Nvidia H200) است. پول مورد نیاز برای این نوع سخت‌افزار به صدها هزار دلار می‌رسد. بازیگران متجاوز دولتی ممکن است در صورت دستیابی به سخت‌افزار، بتوانند از چنین راه‌اندازی استفاده کنند.

با این حال، برای هکر معمولی و خانگی چطور؟ احتمالاً باید توان پردازشی را اجاره کنید، مدل را آبلیتریت کنید و سپس آن را اجرا کنید که این کار نیز فوق‌العاده گران است. شرکت آنتروپیک (Anthropic) می‌گوید آبلیتریت کردن مدل GLM-5.3-Flash حدود ۲۲۰۰ ساعت پردازشی گرافیکی (GPU hours) زمان برده است که تخمین می‌زنند ۴۴00 دلار یا حدود ۲ دلار به ازای هر ساعت پردازشی هزینه دارد و با اجاره‌بهای سخت‌افزاری مورد نیاز همخوانی دارد.

بر اساس آمارهای پلتفرم ران‌پاد (Runpod) که در آن اجاره یک واحد پردازنده گرافیکی H200 برابر با ۳.۷۹ دلار در ساعت است، اجاره پردازنده‌های گرافیکی به اندازه کافی برای آبلیتریت کردن نسخه کامل مدل GLM-5.3 حدود ۳۰ دلار در ساعت هزینه خواهد داشت و شما به هشت عدد از آن‌ها نیاز دارید. تولید حدود ۱۰۰ میلیون توکن ۸۴۲۲ دلار هزینه خواهد داشت و در صورت فرضی ۱۰۰ توکن بر ثانیه با استفاده از هشت پردازنده گرافیکی H200 NVL، یازده و نیم روز طول می‌کشد. آبلیتریت کردن خود مدل، اجرای آن و تولید یک حمله سایبری کاربردی احتمالاً زمان بسیار بیشتری می‌برد و به شدت گران خواهد بود که شاید بزرگ‌ترین مانع برای هر بازیگر مخرب احتمالی باشد.

چرا آنتروپیک روی این موضوع تمرکز کرده است؟

با توجه به سر و صدای فعلی پیرامون ایمنی هوش مصنوعی، شرکت آنتروپیک (Anthropic) در حال برجسته کردن خطرات وجودی ناشی از مدل‌های هوش مصنوعی پیشرفته وزن-باز (Open-weight) است، زیرا قابلیت‌های آن‌ها همچنان در حال بهبود است. در حالی که رئیس‌جمهور ترامپ با چهره‌های پیشرو در حوزه هوش مصنوعی دیدار کرده است تا انتشار مدل‌های آینده را خودتنظیم کند، پست شرکت آنتروپیک (Anthropic) را می‌توان به گونه‌ای تعبیر کرد که توسعه‌دهندگان و دولت‌ها را ترغیب می‌کند تا مدل‌های وزن-باز (Open-weight) را از نظر قابلیت‌هایشان آزمایش کنند.

این امر همچنین می‌تواند منعکس‌کننده احساسات فزاینده ضد وزن-باز (Anti-open-weight) در میان آزمایشگاه‌های هوش مصنوعی پیشرفته و انحصاری (Closed-source) باشد که با هجوم کاربران به سمت مدل‌های ارزان‌تر و تقریباً به همان اندازه توانا، در حال از دست دادن کسب‌وکار خود هستند؛ هرچند این تنها یک گمانه‌زنی است. در حال حاضر، مدل‌های وزن-باز (Open-weight) به دنباله‌روی نزدیک خود از مدل‌های پیشرفته انحصاری ادامه می‌دهند و تنها چند ماه عقب‌تر هستند.

با توجه به هزینه‌های اجرای چنین مدل‌هایی، خطرات اجرای تئوری مدل‌های وزن-باز (Open-weight) آبلیتریت‌شده توسط بازیگران متجاوز یا مخرب قطعی است، اما شاید به آن اندازه‌ای که شرکت آنتروپیک (Anthropic) می‌خواهد عموم مردم فکر کنند، دست‌یافتنی نباشد.


منبع: tomshardware.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.