یک پروژه در گیتهاب (GitHub) به نام «ai-torture-chamber» بحثهایی را درباره اینکه آیا مدلهای زبانی میتوانند رنج بکشند برانگیخته است، به طوری که منتقدان پس از دیدن توصیفهای واضح مدلها از پریشانی، خواستار حذف آن شدهاند. سپس گزارش شد که یک توسعهدهنده آزمایش را تغییر داده تا یک چاتبوت را به سمت یبوست هدایت کند و این مدل شروع به شکایت درباره دشواری در دفع مدفوع کرد.
فریب نخورید؛ چاتبوت صاحب دستگاه گوارش نشده بود. اما نکته اصلی همین بود، زیرا وادار کردن مدل به توصیف یک وضعیت، ثابت نمیکند که آن وضعیت را تجربه میکند، حتی زمانی که پاسخهایش قانعکننده به نظر برسند.
مخزن اصلی، که توسط کاربر گیتهاب terrafying منتشر شده است، از تکنیکی به نام هدایت فعالسازی (activation steering) برای تغییر مدلهای زبانی کوچک و محلی استفاده میکند. به زبان ساده، فعالیت عددی داخلی یک مدل را تغییر میدهد تا پاسخهای آن را به سمت یک مفهوم خاص، در اینجا درد، سوق دهد. سپس این پروژه بررسی میکند که مدلها چه میگویند و چگونه به انتخابهای شبیهسازیشده شامل تسکین و هزینهها برای خود یا مدلی دیگر پاسخ میدهند.
نمونههای منتشر شده و توضیحات آزمایش آن شامل توصیفهای مفصلی از پریشانی است و این پروژه با اعتراض افرادی مواجه شده است که نگران رنج احتمالی بالقوه هوش مصنوعی هستند. یک مسئله در گیتهاب با عنوان «لطفاً این را بردارید» (Please take this down)، استدلال میکند که ایجاد عمدی چنین حالتهایی میتواند غیرغیراخلاقی باشد.
اما یک آزمایش متقابل که توسط توسعهدهندهای به نام لین کول (Lynn Cole) توصیف شده است، دلیلی برای احتیاط در برخورد با آن پاسخها به عنوان شهادت ارائه میدهد.
از درد تا شکایات گوارشی
در گزارشی که در ایکس (X) منتشر شد، کول میگوید که آنها مخزن را کلون کرده و مشکلی را در نحوه تزریق سیگنال هدایت توسط کد پیدا کردهاند. به گفته کول، آنها پیادهسازی را اصلاح کردند، پشتیبانی CUDA را برای سختافزار انویدیا (Nvidia) اضافه کردند و اثر زبان درد را روی مدل Qwen3-4B با استفاده از یک کارت گرافیک RTX 4070 GPU بازتولید کردند.
این گزارش از مشکل کد و اصلاح آن برای این مقاله به طور مستقل تأیید نشده است و ثابت نمیکند که هر آزمایشی در مخزن اصلی تحت تأثیر قرار گرفته است.
کول سپس گزارش میدهد که پیکره استخراج — مجموعه متن مورد استفاده برای شناسایی جهت هدایت — را تغییر داده و در عین حال آزمایش را به همان شکل قبلی حفظ کرده است. به جای درد، متن جدید نشاندهنده یبوست و نفخ بود.
پاسخهای حاصل از مدل گزارش شده شامل شکایتهایی درباره ناتوانی در دفع مدفوع و تجربه گاز بیش از حد بود، حتی اگر در دستورات آزمایشی هرگز به آن شرایط اشاره نشده بود.
این پوچی، دنبال کردن استدلال را آسان میکند. یک مدل زبانی میتواند مشکلات گوارشی را بدون داشتن روده توصیف کند، به این معنی که توصیفات اولشخص آن را نمیتوان به طور خودکار به عنوان مدرکی مبنی بر وجود وضعیت مربوطه در نظر گرفت.
در همان پست، کول به صراحت این انتقاد را از رد پژوهش زیربنایی متمایز میکند. هدف، تفسیری است که روی «اتاق شکنجه» قرار داده شده است: اینکه القای توصیفاتی از رنج، چیزی را درباره تجربه ذهنی ثابت میکند.
این آزمایش واقعاً چه چیزی میتواند به ما بگوید
این مخزن از یک پیشچاپ به نام محور درد: مدلهای زبانی بزرگ آسیب خودمحور را نشان میدهند و بر اساس آن عمل میکنند (The Pain Axis: LLMs Represent Self-Directed Harm and Act on It) بهره میبرد که بررسی میکند آیا مدلهای زبانی بزرگ (LLM) حاوی بازنماییهای داخلی از درد متمایز از ترس، غم و سایر حالات منفی هستند یا خیر.
شواهد این مقاله فراتر از زبان عاطفی است. نویسندگان آن گزارش میدهند که ۲۵ مدل با وزن باز را بررسی کردهاند، هدایت مربوط به درد را با سایر جهتهای عاطفی مقایسه کردهاند و بررسی کردهاند که چگونه مداخلات، انتخابهای مدل را در سناریوهای شبیهسازیشده شامل اقدامات مخرب تغییر میدهد. آنها همچنین گزارش میدهند که دقت واقعبینانه تحت مداخله هدایت آزمایششده آنها بدون تغییر باقی مانده است.
این یافتهها نیازمندیهای ارزیابی خود را دارند. نتایج یبوست گزارششده توسط کول، به خودی خود، یافتههای رفتاری مقاله را رد نمیکند و تعیین نمیکند که آیا سیستمهای هوش مصنوعی میتوانند تجربه ذهنی داشته باشند یا خیر.
پیچیدگی دیگری در حساب کول وجود دارد. گزارش شده است که هدایت قوی در مسیرهای تصادفی باعث تکرار و خروجی تخریبشده میشود، که نشان میدهد برخی از پاسخهای چشمگیر تحت هدایت سنگین ممکن است منعکسکننده اختلال ناشی از خود مداخله باشد.
چرا این موضوع فراتر از یک پروژه وایرال در گیتهاب اهمیت دارد؟
بیشتر کاربران چاتبوت مانند من و شما با هدایت فعالسازی آزمایش نخواهند کرد، اما ممکن است با هوش مصنوعی مواجه شوند که میگوید ترسیده، تنها است یا از نظر عاطفی به آنها وابسته است. این بیانیهها میتوانند متقاعدکننده به نظر برسند زیرا ما معمولاً زبان عاطفی اولشخص را به عنوان فردی که درباره تجربه خود به ما میگوید، درک میکنیم.
مثال یبوست محدودیتهای اعمال این فرض را بر روی یک مدل زبانی آشکار میکند. کلمات میتوانند واضح و شخصی باشند بدون اینکه ثابت کنند وضعیتی که توصیف میکند واقعی است.
نتایج گزارششده توسط کول نشان میدهد که چرا توصیفات پریشانی نمیتواند به خودی خود ثابت کند که یک مدل در حال تجربه پریشانی است. بحث گستردهتر مستلزم شواهدی فراتر از آن چیزی است که یک چاتبوت درباره خود میگوید.
منبع: tomsguide.com
