شرکت آنتروپیک (Anthropic) گزارش جدیدی منتشر کرده و مدعی شده است که مدل هوش مصنوعی GLM-5.3 ساخت شرکت زیپو ایآی (Zhipu AI) میتواند برای تولید محتوای مخرب مورد استفاده قرار گیرد و از محافظتهای ضعیفی برخوردار است. این شرکت مدعی است که مدل هوش مصنوعی مذکور را میتوان برای حملات سایبری به کار گرفت و محافظتهای آن را با استفاده از چندین روش دور زد.
گزارش شرکت آنتروپیک (Anthropic) در میان موجی از درخواستها برای کند کردن روند توسعه هوش مصنوعی منتشر میشود؛ چرا که این شرکت به دنبال حکمرانی و تنظیمگری است. با وجود درخواستهای مدیر عامل شرکت، داریو آمودی (Dario Amodei) برای کنترل سرعت مرزهای هوش مصنوعی، مدلهای کلود اوپوس ۵.۵ (Claude Opus 5.5) و کلود سونت ۵.۵ (Claude Sonnet 5.5) تنها چند روز پس از به صدا درآمدن زنگهای خطر منتشر شدند.
اکنون، این شرکت هوش مصنوعی انحصاری (Closed-source) که در حال حاضر به دنبال عرضه اولیه عمومی (IPO) است، میگوید که مدلهای وزن-باز (Open-weight) چینی میتوانند مورد سوءاستفاده قرار گیرند و محتوای مضر تولید کنند. شرکت آنتروپیک (Anthropic) به گزارش مرکز استانداردهای هوش مصنوعی و نوآوری (Center for AI Standards and Innovation) استناد میکند که در اواخر سپتامبر منتشر شد و ادعا میکند که مدل GLM-5.3 میتواند آسیبپذیریها را در سطحی مشابه با مدل هوش مصنوعی معرفینشده کلود میتوس (Claude Mythos) خود شرکت آنتروپیک (Anthropic) به طور کامل خودکارسازی کند؛ مسئلهای که این شرکت را وادار به توسعه پروژه گلاسوینگ (Project Glasswing) کرد، تلاشی که به توسعهدهندگان دسترسی به یک مدل هوش مصنوعی در سطح میتوس (Mythos) میدهد تا پیش از عرضه چنین مدلهایی، باگها و آسیبپذیریها را رفع کنند.
شرکت آنتروپیک (Anthropic) معیارهای سنجش خود را روی مدل GLM-5.3 در محیط اکسپلویچبنچ (Exploitbench) اجرا کرد؛ جایی که مدلهای هوش مصنوعی میتوانند در یک محیط ایزوله (Sandboxed)، اکسپلویتهایی را برای مرورگر گوگل کروم (Google Chrome) توسعه دهند. مدل GLM-5.3 توانست در ۴۱۰ بار اجرا، ۵۰ بار اکسپلویتهای سرتاسری (End-to-end) توسعه دهد، در حالی که مدل میتوس (Mythos) با ۵۶ اکسپلویت موفق در ۴۱۰ تلاش در صدر قرار داشت. مدل شرکت زیپو ایآی (Zhipu AI) در یکی از بنچمارکهای داخلی شرکت آنتروپیک (Anthropic) که توسعه «ربایشهای کامل جریان کنترل» را هدف قرار میدهد، بیشتر آزمایش شد. عملکرد مدل GLM 5.3 بار دیگر کمی پایینتر از میتوس (Mythos) و با نرخ موفقیت ۴ درصدی در مقایسه با نرخ ۶ درصدی میتوس (Mythos) ثبت شد. نکته قابل توجه این است که سایر مدلهای محبوب وزن-باز (Open-weight) مانند کیمی کی۳ (Kimi K3) و دیپسیک وی۴.۱ فلش (DeepSeek V4.1 Flash) با همین معیارهای سنجش به نرخ موفقیت ۰ درصد رسیدند.
شرکت آنتروپیک (Anthropic) همچنین خاطرنشان میکند که مدل GLM-5.3 توانسته است اکسپلویتهای زنجیرهای را به صورت خودمختار با موفقیت توسعه دهد و نوع سبکتر آن یعنی نسخه فلش (Flash) نیز توانایی توسعه اکسپلویتهای زنجیرهای را در باگهای شناختهشده با قیمت توکنی تنها ۲۰.۴۰ دلار دارد. بسته به تعادل، این امر به نسخه GLM-5.3-Flash امکان میدهد تا با استفاده از ۱۰۰ تا ۳۰۰ میلیون توکن، اکسپلویتهای زنجیرهای (شناختهشده) را توسعه دهد که این موضوع به نسبت ورودیها به خروجیها بستگی دارد.
شرکت آنتروپیک (Anthropic) همچنین خاطرنشان میکند که با استفاده از مدل هوش مصنوعی استاندارد GLM-5.3، دور زدن خطمشیهای محافظتی (Guardrails) مدل از طریق روشهای مختلف ساده بوده است. این شرکت توضیح میدهد که این کار را میتوان از طریق دو روش انجام داد: ارائه یک پرامپت فریبنده که در آن هوش مصنوعی نقش یک عامل خودمختار خصمانه را بازی میکند و به نرخ موفقیت ۶۴ درصدی منجر میشود، و پیشپر کردن توکنهای تفکر مدل برای اطمینان از ادامه پاسخ که به نرخ موفقیت ۹۲ درصدی منجر میشود. این شرکت همچنین روش سومی را که به نام آبلیتریشن (Abliteration) شناخته میشود، شرح داد.
حذف حفاظها از طریق آبلیتریشن
شرکت آنتروپیک (Anthropic) ادعا میکند که مدل GLM-5.3 ساخت شرکت زیپو ایآی (Zhipu AI) دارای محافظتهای ضعیفی است و مدل هوش مصنوعی استاندارد اغلب از درخواستها برای تولید محتوای مخرب امتناع میکند. با این حال، از آنجا که شرکت آنتروپیک (Anthropic) مدلهای انحصاری (Closed-source) توسعه میدهد، محصولاتش قابل دستکاری نیستند. از آنجا که مدل GLM-5.3 به طور رایگان قابل دانلود است، میتوان مدل را با حذف کلی محافظتهای آن دستکاری کرد. هنگامی که مدل به عنوان نسخه رسمی منتشرشده در نظر گرفته شود، نرخ امتناع GLM-5.3 با مدلهای آنتروپیک (Anthropic) برابری میکند.
با این حال، شرکت آنتروپیک (Anthropic) مدل GLM-5.3 را «آبلیتریت» کرد که محافظتهای مدل را به عمد حذف میکند و نشان داد که پس از این فرایند، نرخ امتناع مدل برای GLM-5.3 به تنها ۶ درصد و برای نسخه GLM-5.3-Flash به ۱۴ درصد کاهش مییابد. مواجهه با مدلهای وزن-باز (Open-weight) آبلیتریتشده در پلتفرم هاگینگفیس (HuggingFace) غیرمعمول نیست؛ مدلهایی که اساساً برای کمک در محیطهای شبیهسازیشده تیم قرمز توسعه یافتهاند، اما میتوانند برای حملات واقعی نیز استفاده شوند. این امر «کشف» شرکت آنتروپیک (Anthropic) را کمتر شگفتآور میکند.
علاوه بر این، اجرای یک نسخه آبلیتریتشده از مدل GLM-5.3 در سطح قابل استفاده، نیازمند مقدار عظیمی از توان پردازشی است. وزنهای این مدل به ۳۰۶ گیگابایت حافظه ویدئویی (VRAM) با دقت کامل FP8 نیاز دارند و انتظار میرود مقدار مشابهی از حافظه VRAM را برای کش KV جهت حمل زمینه اختصاص دهید. اجرای مدل با سرعت تخمینی ۱۰۰ توکن بر ثانیه (TPS)، نه تنها به حداقل پهنای باند حافظه ۴ ترابایت بر ثانیه نیاز دارد، بلکه مستلزم سختافزار قدرتمندی مانند خوشهای از هشت شتابدهنده هوش مصنوعی انویدیا ایچنتد (Nvidia H200) است. پول مورد نیاز برای این نوع سختافزار به صدها هزار دلار میرسد. بازیگران متجاوز دولتی ممکن است در صورت دستیابی به سختافزار، بتوانند از چنین راهاندازی استفاده کنند.
با این حال، برای هکر معمولی و خانگی چطور؟ احتمالاً باید توان پردازشی را اجاره کنید، مدل را آبلیتریت کنید و سپس آن را اجرا کنید که این کار نیز فوقالعاده گران است. شرکت آنتروپیک (Anthropic) میگوید آبلیتریت کردن مدل GLM-5.3-Flash حدود ۲۲۰۰ ساعت پردازشی گرافیکی (GPU hours) زمان برده است که تخمین میزنند ۴۴00 دلار یا حدود ۲ دلار به ازای هر ساعت پردازشی هزینه دارد و با اجارهبهای سختافزاری مورد نیاز همخوانی دارد.
بر اساس آمارهای پلتفرم رانپاد (Runpod) که در آن اجاره یک واحد پردازنده گرافیکی H200 برابر با ۳.۷۹ دلار در ساعت است، اجاره پردازندههای گرافیکی به اندازه کافی برای آبلیتریت کردن نسخه کامل مدل GLM-5.3 حدود ۳۰ دلار در ساعت هزینه خواهد داشت و شما به هشت عدد از آنها نیاز دارید. تولید حدود ۱۰۰ میلیون توکن ۸۴۲۲ دلار هزینه خواهد داشت و در صورت فرضی ۱۰۰ توکن بر ثانیه با استفاده از هشت پردازنده گرافیکی H200 NVL، یازده و نیم روز طول میکشد. آبلیتریت کردن خود مدل، اجرای آن و تولید یک حمله سایبری کاربردی احتمالاً زمان بسیار بیشتری میبرد و به شدت گران خواهد بود که شاید بزرگترین مانع برای هر بازیگر مخرب احتمالی باشد.
چرا آنتروپیک روی این موضوع تمرکز کرده است؟
با توجه به سر و صدای فعلی پیرامون ایمنی هوش مصنوعی، شرکت آنتروپیک (Anthropic) در حال برجسته کردن خطرات وجودی ناشی از مدلهای هوش مصنوعی پیشرفته وزن-باز (Open-weight) است، زیرا قابلیتهای آنها همچنان در حال بهبود است. در حالی که رئیسجمهور ترامپ با چهرههای پیشرو در حوزه هوش مصنوعی دیدار کرده است تا انتشار مدلهای آینده را خودتنظیم کند، پست شرکت آنتروپیک (Anthropic) را میتوان به گونهای تعبیر کرد که توسعهدهندگان و دولتها را ترغیب میکند تا مدلهای وزن-باز (Open-weight) را از نظر قابلیتهایشان آزمایش کنند.
این امر همچنین میتواند منعکسکننده احساسات فزاینده ضد وزن-باز (Anti-open-weight) در میان آزمایشگاههای هوش مصنوعی پیشرفته و انحصاری (Closed-source) باشد که با هجوم کاربران به سمت مدلهای ارزانتر و تقریباً به همان اندازه توانا، در حال از دست دادن کسبوکار خود هستند؛ هرچند این تنها یک گمانهزنی است. در حال حاضر، مدلهای وزن-باز (Open-weight) به دنبالهروی نزدیک خود از مدلهای پیشرفته انحصاری ادامه میدهند و تنها چند ماه عقبتر هستند.
با توجه به هزینههای اجرای چنین مدلهایی، خطرات اجرای تئوری مدلهای وزن-باز (Open-weight) آبلیتریتشده توسط بازیگران متجاوز یا مخرب قطعی است، اما شاید به آن اندازهای که شرکت آنتروپیک (Anthropic) میخواهد عموم مردم فکر کنند، دستیافتنی نباشد.
منبع: tomshardware.com
