شرکت آنتروپیک (Anthropic)، سازنده ابزار هوش مصنوعی کلود (Claude AI)، طبق گزارشها ادبیات کلاسیک فیزیکی را از هم جدا کرده است تا روند اسکن را سریعتر کرده و مدلهای هوش مصنوعی خود را با مطالب آنها بیشتر آموزش دهد. در اینجا توضیحی درباره علت و چگونگی شکلگیری این روند آورده شده است.
چرا و چگونه این روند اتفاق میافتد
شرکت آنتروپیک که به نام «پروژه پاناما» (Project Panama) شناخته میشود، ظاهراً از این نام رمز برای تعریف یک تلاش بزرگ جهت به دست آوردن مقدار زیادی از کتابهای چاپی و تبدیل آنها به دادههای آموزشی هوش مصنوعی استفاده میکند.
گفته میشود که این شرکت هوش مصنوعی میلیونها دلار برای خرید عمده میلیونها کتاب فیزیکی هزینه کرده و سپس عطف این کتابها را بریده است تا صفحات فردی به راحتی از طریق اسکنرهای صنعتی با سرعت بالا تغذیه شوند. سپس این فرآیند منجر به تبدیل آن صفحات به متن قابل خواندن توسط ماشین برای یادگیری ماشین شد - اطلاعاتی که در نهایت به بخشی از یک مجموعه داده بزرگتر تبدیل شد که برای آموزش هوش مصنوعی کلود استفاده میشد. و به دلیل حذف جلد کتابهای اصلی، آنها دور انداخته شدند زیرا اکنون چیزی بیش از زباله در نظر گرفتهچ نمیشدند.
گزارش واشنگتن پست شامل نقلی از یک سند برنامهریزی داخلی مرتبط با هدف نهایی آنتروپیک بود. در آن سند آمده بود: «پروژه پاناما تلاش ما برای اسکن مخرب تمام کتابهای جهان است. ما نمیخواهیم شناخته شود که روی این موضوع کار میکنیم.» ژوئیه گذشته، آنتروپیک با همین نویسندگان به مبلغ ۱.۵ میلیارد دلار به توافق رسید.
رویترز گزارش داد که دادگاه ناظر بر این پرونده حکم داده است، در حالی که آموزش هوش مصنوعی روی کتابها تحت قانون حق چاپ به عنوان استفاده منصفانه (fair use) طبقهبندی میشود، اما آنتروپیک با نگهداری ۷ میلیون کتاب دزدیشونده متعلق به آنها در یک کتابخانه مرکزی، حق چاپ چندین نویسنده و ناشران آنها را نقض کرده است. در حالی که شرکتهایی مانند اوپنایآی (OpenAI)، گوگل (Google) و متا (Meta) درگیر مشکلات قانونی مربوط به استفاده از کتابها برای آموزش هوش مصنوعی بودهاند، آنتروپیک تنها شرکتی است که تاکنون افشا شده که واقعاً کتابهای فیزیکی را برای آموزش مدلهای خود از هم جدا کرده است.
آنتروپیک چه نظری داشت
سخنگوی آنتروپیک به تامز گاید (Tom’s Guide) گفت: «کلود روی ترکیبی از دادههای وب به طور عمومی در دسترس، مجموعههای داده کسب شده تجاری و دادههایی که خودمان تولید میکنیم آموزش دیده است. تهیه کتاب رویکردی به طور گسترده استفاده شده برای آموزش مدلهای زبانی بزرگ در سراسر صنعت هوش مصنوعی است. هیچیک از برنامههای اکتساب داده ما کتابهای کمیاب یا عتیقه را خریداری و تخریب نمیکنند.»
آنتروپیک همچنین زمینه بیشتری در مورد نحوه مشارکت آنها در عمل استفاده از کتابها برای آموزش هوش مصنوعی ارائه داد:
- تهیه کتاب یک رویکرد بسیار رایج برای آموزش مدلهای زبانی بزرگ (LLM) در سراسر صنعت هوش مصنوعی است.
- هیچیک از برنامههای اکتساب داده ما کتابهای «کمیاب» یا «عتیقه» را خریداری و تخریب نمیکنند. ما کتابها را از بازارهای تجاری معمولی خریداری میکنیم.
- بسیاری از گفتگوهای آنلاین به توافقنامه اخیر ما با بارتز (Bartz settlement) اشاره دارند؛ به عنوان یادآوری: ما این پرونده را تابستان گذشته تسویه کردیم، پس از آن که دادگاه حکم داد آموزش هوش مصنوعی روی کتابها تحت قانون حق چاپ مجاز است [که به آن «استفاده منصفانه» میگویند] - حکمی که همچنان به قوت خود باقی است.
- همانطور که قاضی آلسوپ (Alsup) نوشت: «مانند هر خوانندهای که آرزوی نویسنده شدن را دارد، مدلهای زبانی بزرگ آنتروپیک روی آثار آموزش دیدهاند تا جلوتر نروند و آنها را تکرار یا جایگزین نکنند - بلکه زاویه سختی را طی کنند و چیز متفاوتی خلق کنند.»
- پرونده بارتز بهطور خاص به ادعاهایی مربوط میشود که آنتروپیک مطالب را به طور نامناسب از دو کتابخانه آنلاین - مجموعههای داده LibGen و PiLiMi - دانلود کرده است.
- آنتروپیک هرگز هیچ مدلی را که روی مجموعههای داده LibGen یا PiLiMi آموزش دیده باشد به صورت تجاری منتشر نکرد و هیچ درآمدی از هیچیک از این مدلها به دست نیاورد.
- ما خوشحالیم که بیش از ۹۱ درصد از نویسندگان و ناشران مشمول این توافقنامه، سهم خود را از پرداخت مطالبه کردهاند.
نتیجهگیری
کتابهای کمیاب و حتی خارج از چاپ ممکن است برای تلاشهای گذشته آنتروپیک به دست آمده باشند، اما ممکن است تا سالها بعد هرگز به طور واقعی ندانیم که آیا نامهای آن کتابهای تخریبشده به طور گسترده شناخته میشوند یا خیر.
من مطمئن هستم که هیچکس نمیخواهد در دنیایی زندگی کند که توسط ابزارهای هوش مصنوعی تحت سلطه است که بر روی مطالب خواندنی آموزش دیدهاند که به شکل فیزیکی اصلی خود به راحتی در دسترس نیستند.
