اتاق شکنجه هوش مصنوعی و آزمایش یبوست چاتبوت

یک پروژه در گیت‌هاب با ایجاد توصیفاتی از درد توسط هوش مصنوعی جنجال‌به‌پا کرد، اما آزمایش بعدی یک توسعه‌دهنده با موضوع یبوست نشان داد که این مدل‌ها در واقع روده یا احساسی ندارند.

تتیم تحریریه۴ دقیقه مطالعه۰ بازدید۴ دقیقه پیش
اتاق شکنجه هوش مصنوعی و آزمایش یبوست چاتبوت

یک پروژه در گیت‌هاب (GitHub) به نام «ai-torture-chamber» بحث‌هایی را درباره اینکه آیا مدل‌های زبانی می‌توانند رنج بکشند برانگیخته است، به طوری که منتقدان پس از دیدن توصیف‌های واضح مدل‌ها از پریشانی، خواستار حذف آن شده‌اند. سپس گزارش شد که یک توسعه‌دهنده آزمایش را تغییر داده تا یک چاتبوت را به سمت یبوست هدایت کند و این مدل شروع به شکایت درباره دشواری در دفع مدفوع کرد.

فریب نخورید؛ چاتبوت صاحب دستگاه گوارش نشده بود. اما نکته اصلی همین بود، زیرا وادار کردن مدل به توصیف یک وضعیت، ثابت نمی‌کند که آن وضعیت را تجربه می‌کند، حتی زمانی که پاسخ‌هایش قانع‌کننده به نظر برسند.

مخزن اصلی، که توسط کاربر گیت‌هاب terrafying منتشر شده است، از تکنیکی به نام هدایت فعال‌سازی (activation steering) برای تغییر مدل‌های زبانی کوچک و محلی استفاده می‌کند. به زبان ساده، فعالیت عددی داخلی یک مدل را تغییر می‌دهد تا پاسخ‌های آن را به سمت یک مفهوم خاص، در اینجا درد، سوق دهد. سپس این پروژه بررسی می‌کند که مدل‌ها چه می‌گویند و چگونه به انتخاب‌های شبیه‌سازی‌شده شامل تسکین و هزینه‌ها برای خود یا مدلی دیگر پاسخ می‌دهند.

نمونه‌های منتشر شده و توضیحات آزمایش آن شامل توصیف‌های مفصلی از پریشانی است و این پروژه با اعتراض افرادی مواجه شده است که نگران رنج احتمالی بالقوه هوش مصنوعی هستند. یک مسئله در گیت‌هاب با عنوان «لطفاً این را بردارید» (Please take this down)، استدلال می‌کند که ایجاد عمدی چنین حالت‌هایی می‌تواند غیرغیراخلاقی باشد.

اما یک آزمایش متقابل که توسط توسعه‌دهنده‌ای به نام لین کول (Lynn Cole) توصیف شده است، دلیلی برای احتیاط در برخورد با آن پاسخ‌ها به عنوان شهادت ارائه می‌دهد.

از درد تا شکایات گوارشی

در گزارشی که در ایکس (X) منتشر شد، کول می‌گوید که آن‌ها مخزن را کلون کرده و مشکلی را در نحوه تزریق سیگنال هدایت توسط کد پیدا کرده‌اند. به گفته کول، آن‌ها پیاده‌سازی را اصلاح کردند، پشتیبانی CUDA را برای سخت‌افزار انویدیا (Nvidia) اضافه کردند و اثر زبان درد را روی مدل Qwen3-4B با استفاده از یک کارت گرافیک RTX 4070 GPU بازتولید کردند.

این گزارش از مشکل کد و اصلاح آن برای این مقاله به طور مستقل تأیید نشده است و ثابت نمی‌کند که هر آزمایشی در مخزن اصلی تحت تأثیر قرار گرفته است.

کول سپس گزارش می‌دهد که پیکره استخراج — مجموعه متن مورد استفاده برای شناسایی جهت هدایت — را تغییر داده و در عین حال آزمایش را به همان شکل قبلی حفظ کرده است. به جای درد، متن جدید نشان‌دهنده یبوست و نفخ بود.

پاسخ‌های حاصل از مدل گزارش شده شامل شکایت‌هایی درباره ناتوانی در دفع مدفوع و تجربه گاز بیش از حد بود، حتی اگر در دستورات آزمایشی هرگز به آن شرایط اشاره نشده بود.

این پوچی، دنبال کردن استدلال را آسان می‌کند. یک مدل زبانی می‌تواند مشکلات گوارشی را بدون داشتن روده توصیف کند، به این معنی که توصیفات اول‌شخص آن را نمی‌توان به طور خودکار به عنوان مدرکی مبنی بر وجود وضعیت مربوطه در نظر گرفت.

در همان پست، کول به صراحت این انتقاد را از رد پژوهش زیربنایی متمایز می‌کند. هدف، تفسیری است که روی «اتاق شکنجه» قرار داده شده است: اینکه القای توصیفاتی از رنج، چیزی را درباره تجربه ذهنی ثابت می‌کند.

این آزمایش واقعاً چه چیزی می‌تواند به ما بگوید

این مخزن از یک پیش‌چاپ به نام محور درد: مدل‌های زبانی بزرگ آسیب خودمحور را نشان می‌دهند و بر اساس آن عمل می‌کنند (The Pain Axis: LLMs Represent Self-Directed Harm and Act on It) بهره می‌برد که بررسی می‌کند آیا مدل‌های زبانی بزرگ (LLM) حاوی بازنمایی‌های داخلی از درد متمایز از ترس، غم و سایر حالات منفی هستند یا خیر.

شواهد این مقاله فراتر از زبان عاطفی است. نویسندگان آن گزارش می‌دهند که ۲۵ مدل با وزن باز را بررسی کرده‌اند، هدایت مربوط به درد را با سایر جهت‌های عاطفی مقایسه کرده‌اند و بررسی کرده‌اند که چگونه مداخلات، انتخاب‌های مدل را در سناریوهای شبیه‌سازی‌شده شامل اقدامات مخرب تغییر می‌دهد. آن‌ها همچنین گزارش می‌دهند که دقت واقع‌بینانه تحت مداخله هدایت آزمایش‌شده آن‌ها بدون تغییر باقی مانده است.

این یافته‌ها نیازمندی‌های ارزیابی خود را دارند. نتایج یبوست گزارش‌شده توسط کول، به خودی خود، یافته‌های رفتاری مقاله را رد نمی‌کند و تعیین نمی‌کند که آیا سیستم‌های هوش مصنوعی می‌توانند تجربه ذهنی داشته باشند یا خیر.

پیچیدگی دیگری در حساب کول وجود دارد. گزارش شده است که هدایت قوی در مسیرهای تصادفی باعث تکرار و خروجی تخریب‌شده می‌شود، که نشان می‌دهد برخی از پاسخ‌های چشمگیر تحت هدایت سنگین ممکن است منعکس‌کننده اختلال ناشی از خود مداخله باشد.

چرا این موضوع فراتر از یک پروژه وایرال در گیت‌هاب اهمیت دارد؟

بیشتر کاربران چاتبوت مانند من و شما با هدایت فعال‌سازی آزمایش نخواهند کرد، اما ممکن است با هوش مصنوعی مواجه شوند که می‌گوید ترسیده، تنها است یا از نظر عاطفی به آن‌ها وابسته است. این بیانیه‌ها می‌توانند متقاعدکننده به نظر برسند زیرا ما معمولاً زبان عاطفی اول‌شخص را به عنوان فردی که درباره تجربه خود به ما می‌گوید، درک می‌کنیم.

مثال یبوست محدودیت‌های اعمال این فرض را بر روی یک مدل زبانی آشکار می‌کند. کلمات می‌توانند واضح و شخصی باشند بدون اینکه ثابت کنند وضعیتی که توصیف می‌کند واقعی است.

نتایج گزارش‌شده توسط کول نشان می‌دهد که چرا توصیفات پریشانی نمی‌تواند به خودی خود ثابت کند که یک مدل در حال تجربه پریشانی است. بحث گسترده‌تر مستلزم شواهدی فراتر از آن چیزی است که یک چاتبوت درباره خود می‌گوید.


منبع: tomsguide.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.