کمتر از دو هفته پس از اینکه گوگل (Google) نقشهبرداری کامل مغز و سیستم عصبی مرکزی یک مگس سرکه نر بالغ را منتشر کرد، علاقهمندان دیدهایم که این ساختار را در همه زمینهها به کار گرفتهاند؛ از تبدیل کردن یک مگس سرکه به معاملهگر روزانه ارز دیجیتال گرفته تا آموزش پارک موازی به آن. حالا، یکی از طرفداران بازی بالاترو (Balatro) میگوید که این ساختار را با یک الگوریتم برای انجام بازی آموزش داده است و نرخ پیروزی در حال حاضر روی عدد راحت ۲۰ درصد قرار دارد.
این بازیکن ویدئویی با دور تند از مدلی که ظاهراً در حال انجام بازی است را به اشتراک گذاشت. بر اساس این ویدیو، بازیکن پایینترین درجه سختی (White Stake) و عرشه پیشفرض (Red Deck) را انتخاب کرده است. ما قبلاً دیدهایم که مدل جیپیتی-۶ آسترا (GPT-6 'Astra') شرکت اوپنآیسیآی (OpenAI) بازی را با عرشه سیاه در سختی Gold Stack شکست داده است که بهطور کلی سختترین ترکیب در بازی محسوب میشود.
کاربر ردیت که این ویدیو را به اشتراک گذاشته است، میگوید که مدل را با استفاده از یک الگوریتم آموزشی که خودش توسعه داده بود تا بذرهای (Seeds) مفید بالاترو (Balatro) را کشف کند، آموزش داده است. مانند سایر بازیهای روگلایک (Roguelike)، بالاترو (Balatro) تصادفی است، بنابراین الگوریتمهایی مانند این میتوانند بذرهایی را کشف کنند که منحصر به فرد هستند و به طور بالقوه میتوانند به امتیازات بسیار بالایی منجر شوند. برای آموزش مغز، هم دستگاه مغز (یک کانکتوم در کنار مدل واقعی) و هم الگوریتم یک بذر را بازی میکنند. سپس نتایج مقایسه میشوند و مدل روی مغز بر اساس انتخابهایش پاداش یا تنبیه دریافت میکند.
در حال حاضر، این کاربر میگوید که مغز دارای نرخ موفقیت ۲۰ درصدی در یک بذر تصادفی است که احتمالاً در همان سختی White Stack و عرشه قرمز است. این کاربر میگوید که مدل هیچ اطلاعی درباره بذر ندارد مگر آنچه بلافاصله روی صفحه قابل مشاهده است و آموزش همچنان ادامه دارد. آنها در نظری روی پست اصلی خود نوشتند: «مگس سرکه قویتر و باهوشتر باز خواهد گشت.»
این یک شاهکار چشمگیر است، যদিও برخی از کامنتگذاران نسبت به این پروژه ابراز تردید کردهاند. این بازیکن جزئیات زیادی در مورد نحوه آموزش مدل فراتر از آنچه در بالا ذکر شد، یا هیچ مخزنی برای پروژه یا ارجاعات به پروژههای متنباز دیگری که استفاده کرده است، به اشتراک نگذاشته است. این برای بالاترو (Balatro) قلمرو ناشناختهای نیست؛ پروژههایی مانند بالاتروبات (BalatroBot) و بالاترولام (BalatroLLM) حدود یک سال است که در دسترس بودهاند.
ما با این کاربر تماس گرفتهایم تا ببینیم آیا او میتواند جزئیات بیشتری در مورد نحوه آموزش مدل ارائه دهد یا خیر و به محض دریافت پاسخ، این خبر را بهروزرسانی خواهیم کرد.
اگرچه بازی بالاترو (Balatro) به اندازه کافی ساده به نظر میرسد، اما آموزش دادن به یک مدل برای انجام بازی، بهویژه در سطوح سختی بالاتر، بهطور شگفتانگیزی دشوار است. قوانین اصلی بازی و امتیازدهی دستهای پوکر دشوار نیستند. با این حال، تعاملات پیچیده بین جوکرهای (امتیازات کمکی که به شما برای کسب امتیازات بالاتر کمک میکنند)، نحوه مرتبسازی و امتیازدهی آنها، و شرایط خاص مانند قابلیتهای رئیس و جوکرهای موقت/دائمی، سازگاری را به مانع بلندی برای عبور تبدیل میکند، حتی برای بازیکنان انسانی، چه رسد به یک مدل هوش مصنوعی.
منبع: tomshardware.com
