نابودی میلیون‌ها کتاب برای آموزش هوش مصنوعی؛ پشت پرده این روند نگران‌کننده

گزارش‌ها حاکی از آن است که شرکت انتروپیک میلیون‌ها کتاب فیزیکی را برای تسریع اسکن و آموزش مدل‌های هوش مصنوعی خود نابود کرده است.

تتیم تحریریه۴ دقیقه مطالعه۰ بازدید۱۴۰۵/۵/۱۵
نابودی میلیون‌ها کتاب برای آموزش هوش مصنوعی؛ پشت پرده این روند نگران‌کننده

شرکت انتروپیک (Anthropic)، سازنده ابزار هوش مصنوعی کلود (Claude)، طبق گزارش‌ها، ادبیات کلاسیک فیزیکی را از هم جدا کرده است تا روند اسکن را سریع‌تر کرده و مدل‌های هوش مصنوعی خود را با استفاده از مطالب آن‌ها بیشتر آموزش دهد. در ادامه توضیح می‌دهیم که چرا و چگونه این روند شکل گرفته است.

چرا و چگونه این روند اتفاق می‌افتد

این روند که با نام «پروژه پاناما» (Project Panama) شناخته می‌شود، طبق گزارش‌ها کدی است که انتروپیک برای یک تلاش گسترده جهت تهیه حجم عظیمی از کتاب‌های چاپ‌شده و تبدیل آن‌ها به داده‌های آموزشی هوش مصنوعی استفاده می‌کند.

گفته می‌شود این شرکت هوش مصنوعی میلیون‌ها دلار خرج کرده تا میلیون‌ها کتاب فیزیکی را به‌صورت عمده بخرد و سپس عطف این کتاب‌ها را ببرد تا صفحات جداگانه راحت‌تر وارد اسکنرهای صنعتی پرسرعت شوند. این فرآیند باعث شد که آن صفحات برای یادگیری ماشین به متن قابل خواندن توسط ماشین تبدیل شوند؛ اطلاعاتی که در نهایت بخشی از یک مجموعه داده بزرگ‌تر مورد استفاده برای آموزش هوش مصنوعی کلود (Claude AI) شد. و از آنجا که عطف کتاب‌های اصلی برداشته شده بود، آن‌ها به عنوان زباله دور ریخته شدند زیرا دیگر چیزی جز آشغال محسوب نمی‌شدند.

گزارش واشنگتن پست (Washington Post) حاوی نقل‌قولی از یک سند برنامه‌ریزی داخلی مرتبط با هدف نهایی انتروپیک بود. در آن سند آمده بود: «پروژه پاناما تلاش ما برای اسکن مخرب تمام کتاب‌های جهان است. ما نمی‌خواهیم شناخته شویم که روی این موضوع کار می‌کنیم.» ژوئیه گذشته، انتروپیک با همان نویسندگان به توافق ۱.۵ میلیارد دلاری رسید.

رویترز (Reuters) گزارش داد دادگاه ناظر بر آن پرونده حکم داد که اگرچه آموزش هوش مصنوعی روی کتاب‌ها تحت قانون حق نشر (کپی‌رایت) به عنوان استفاده منصفانه (fair use) دسته‌بندی می‌شود، اما انتروپیک با نگهداری ۷ میلیون کتاب قاچاق‌شده از نویسندگان و ناشران آن‌ها در یک کتابخانه مرکزی، حق نشر چندین نویسنده را نقض کرده است. در حالی که شرکت‌هایی مانند اوپن‌آی‌سی (OpenAI)، گوگل (Google) و متا (Meta) با مشکلات حقوقی مربوط به استفاده از کتاب‌ها برای آموزش هوش مصنوعی درگیر بوده‌اند، انتروپیک تنها شرکتی است که تاکنون به دلیل جداسازی فیزیکی کتاب‌ها برای آموزش مدل‌های خود افشا شده است.

دیدگاه انتروپیک در این زمینه

یک سخنگوی انتروپیک به تامز گاید (Tom's Guide) گفت: «کلود (Claude) روی ترکیبی از داده‌های وب عمومی در دسترس، مجموعه‌های داده خریداری‌شده تجاری و داده‌هایی که خودمان تولید می‌کنیم آموزش دیده است.» سخنگوی انتروپیک به ما گفت: «تهیه کتاب رویکردی به‌طور گسترده موردافاده برای آموزش مدل‌های زبانی بزرگ در سراسر صنعت هوش مصنوعی است. هیچ‌یک از برنامه‌های اکتساب داده ما کتاب‌های کمیاب یا عتیقه را خریداری و نابود نمی‌کنند.»

انتروپیک همچنین زمینه بیشتری در مورد چگونگی مشارکت آن‌ها در شیوه استفاده از کتاب‌ها برای آموزش هوش مصنوعی ارائه داد:

  • تهیه کتاب رویکردی به‌طور گسترده موردافاده برای آموزش مدل‌های زبانی بزرگ (LLM) در سراسر صنعت هوش مصنوعی است.
  • هیچ‌یک از برنامه‌های اکتساب داده ما کتاب‌های «کمیاب» یا «عتیقه» را خریداری و نابود نمی‌کنند. ما کتاب‌ها را از بازارهای تجاری معمولی می‌خریم.
  • بسیاری از گفتگوهای آنلاین به توافق‌نامه اخیر ما با بارتز (Bartz) اشاره دارد؛ به عنوان یادآوری: ما این پرونده را تابستان گذشته، پس از آن که دادگاه تشخیص داد آموزش هوش مصنوعی روی کتاب‌ها تحت قانون حق نشر (معروف به «استفاده منصفانه») مجاز است، تسویه کردیم؛ حکمی که همچنان به قوت خود باقی است.
  • همان‌طور که قاضی آلساپ (Alsup) نوشت: «مانند هر خواننده‌ای که آرزوی نویسنده شدن را دارد، مدل‌های زبانی بزرگ انتروپیک روی آثار آموزش دیده‌اند نه برای پیشی گرفتن و تکثیر یا جایگزینی آن‌ها بلکه برای تغییر مسیر و ایجاد چیزی متفاوت.»
  • پرونده بارتز به‌طور خاص مربوط به ادعاهایی است که انتروپیک مطالب را به طور نامناسب از دو کتابخانه آنلاین — مجموعه‌های داده LibGen و PiLiMi — دانلود کرده است.
  • انتروپیک هرگز هیچ مدلی را که روی مجموعه‌های داده LibGen یا PiLiMi آموزش دیده باشد به صورت تجاری منتشر نکرد و از هیچ‌یک از این مدل‌ها درآمدی کسب نکرد.
  • ما خوشحالیم که بیش از ۹۱ درصد از نویسندگان و ناشران تحت پوشش توافق‌نامه، سهم خود را از پرداخت دریافت کرده‌اند.

نتیجه‌گیری

ممکن است کتاب‌های کمیاب و حتی نایاب توسط انتروپیک برای تلاش‌های گذشته‌شان به دست آمده باشند، اما ممکن است تا سال‌ها بعد هرگز به طور واقعی ندانیم که آیا نام آن کتاب‌های تخریب‌شده به طور گسترده شناخته می‌شود یا خیر.

من مطمئن هستم هیچ‌کس نمی‌خواهد در دنیایی زندگی کند که توسط ابزارهای هوش مصنوعی تسخیر شده که روی مطالب خواندنی آموزش دیده‌اند که به شکل فیزیکی اصلی خود در دسترس نیستند.

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.