میلیون‌ها کتاب برای آموزش هوش مصنوعی نابود شده‌اند

گزارش‌ها حاکی از آن است که آنتروپیک کتاب‌های فیزیکی را برای سرعت بخشیدن به اسکن و آموزش مدل‌های هوش مصنوعی کلود تخریب کرده است.

تتیم تحریریه۰ دقیقه مطالعه۰ بازدید۱۴۰۵/۵/۱۴
میلیون‌ها کتاب برای آموزش هوش مصنوعی نابود شده‌اند

شرکت آنتروپیک (Anthropic)، سازنده ابزار هوش مصنوعی کلود (Claude AI)، طبق گزارش‌ها ادبیات کلاسیک فیزیکی را از هم جدا کرده است تا روند اسکن را سریع‌تر کرده و مدل‌های هوش مصنوعی خود را با مطالب آن‌ها بیشتر آموزش دهد. در اینجا توضیحی درباره علت و چگونگی شکل‌گیری این روند آورده شده است.

چرا و چگونه این روند اتفاق می‌افتد

شرکت آنتروپیک که به نام «پروژه پاناما» (Project Panama) شناخته می‌شود، ظاهراً از این نام رمز برای تعریف یک تلاش بزرگ جهت به دست آوردن مقدار زیادی از کتاب‌های چاپی و تبدیل آن‌ها به داده‌های آموزشی هوش مصنوعی استفاده می‌کند.

گفته می‌شود که این شرکت هوش مصنوعی میلیون‌ها دلار برای خرید عمده میلیون‌ها کتاب فیزیکی هزینه کرده و سپس عطف این کتاب‌ها را بریده است تا صفحات فردی به راحتی از طریق اسکنرهای صنعتی با سرعت بالا تغذیه شوند. سپس این فرآیند منجر به تبدیل آن صفحات به متن قابل خواندن توسط ماشین برای یادگیری ماشین شد - اطلاعاتی که در نهایت به بخشی از یک مجموعه داده بزرگ‌تر تبدیل شد که برای آموزش هوش مصنوعی کلود استفاده می‌شد. و به دلیل حذف جلد کتاب‌های اصلی، آن‌ها دور انداخته شدند زیرا اکنون چیزی بیش از زباله در نظر گرفتهچ نمی‌شدند.

گزارش واشنگتن پست شامل نقلی از یک سند برنامه‌ریزی داخلی مرتبط با هدف نهایی آنتروپیک بود. در آن سند آمده بود: «پروژه پاناما تلاش ما برای اسکن مخرب تمام کتاب‌های جهان است. ما نمی‌خواهیم شناخته شود که روی این موضوع کار می‌کنیم.» ژوئیه گذشته، آنتروپیک با همین نویسندگان به مبلغ ۱.۵ میلیارد دلار به توافق رسید.

رویترز گزارش داد که دادگاه ناظر بر این پرونده حکم داده است، در حالی که آموزش هوش مصنوعی روی کتاب‌ها تحت قانون حق چاپ به عنوان استفاده منصفانه (fair use) طبقه‌بندی می‌شود، اما آنتروپیک با نگهداری ۷ میلیون کتاب دزدی‌شونده متعلق به آن‌ها در یک کتابخانه مرکزی، حق چاپ چندین نویسنده و ناشران آن‌ها را نقض کرده است. در حالی که شرکت‌هایی مانند اوپن‌ای‌آی (OpenAI)، گوگل (Google) و متا (Meta) درگیر مشکلات قانونی مربوط به استفاده از کتاب‌ها برای آموزش هوش مصنوعی بوده‌اند، آنتروپیک تنها شرکتی است که تاکنون افشا شده که واقعاً کتاب‌های فیزیکی را برای آموزش مدل‌های خود از هم جدا کرده است.

آنتروپیک چه نظری داشت

سخنگوی آنتروپیک به تامز گاید (Tom’s Guide) گفت: «کلود روی ترکیبی از داده‌های وب به طور عمومی در دسترس، مجموعه‌های داده کسب شده تجاری و داده‌هایی که خودمان تولید می‌کنیم آموزش دیده است. تهیه کتاب رویکردی به طور گسترده استفاده شده برای آموزش مدل‌های زبانی بزرگ در سراسر صنعت هوش مصنوعی است. هیچ‌یک از برنامه‌های اکتساب داده ما کتاب‌های کمیاب یا عتیقه را خریداری و تخریب نمی‌کنند.»

آنتروپیک همچنین زمینه بیشتری در مورد نحوه مشارکت آن‌ها در عمل استفاده از کتاب‌ها برای آموزش هوش مصنوعی ارائه داد:

  • تهیه کتاب یک رویکرد بسیار رایج برای آموزش مدل‌های زبانی بزرگ (LLM) در سراسر صنعت هوش مصنوعی است.
  • هیچ‌یک از برنامه‌های اکتساب داده ما کتاب‌های «کمیاب» یا «عتیقه» را خریداری و تخریب نمی‌کنند. ما کتاب‌ها را از بازارهای تجاری معمولی خریداری می‌کنیم.
  • بسیاری از گفتگوهای آنلاین به توافق‌نامه اخیر ما با بارتز (Bartz settlement) اشاره دارند؛ به عنوان یادآوری: ما این پرونده را تابستان گذشته تسویه کردیم، پس از آن که دادگاه حکم داد آموزش هوش مصنوعی روی کتاب‌ها تحت قانون حق چاپ مجاز است [که به آن «استفاده منصفانه» می‌گویند] - حکمی که همچنان به قوت خود باقی است.
  • همان‌طور که قاضی آلسوپ (Alsup) نوشت: «مانند هر خواننده‌ای که آرزوی نویسنده شدن را دارد، مدل‌های زبانی بزرگ آنتروپیک روی آثار آموزش دیده‌اند تا جلوتر نروند و آن‌ها را تکرار یا جایگزین نکنند - بلکه زاویه سختی را طی کنند و چیز متفاوتی خلق کنند.»
  • پرونده بارتز به‌طور خاص به ادعاهایی مربوط می‌شود که آنتروپیک مطالب را به طور نامناسب از دو کتابخانه آنلاین - مجموعه‌های داده LibGen و PiLiMi - دانلود کرده است.
  • آنتروپیک هرگز هیچ مدلی را که روی مجموعه‌های داده LibGen یا PiLiMi آموزش دیده باشد به صورت تجاری منتشر نکرد و هیچ درآمدی از هیچ‌یک از این مدل‌ها به دست نیاورد.
  • ما خوشحالیم که بیش از ۹۱ درصد از نویسندگان و ناشران مشمول این توافق‌نامه، سهم خود را از پرداخت مطالبه کرده‌اند.

نتیجه‌گیری

کتاب‌های کمیاب و حتی خارج از چاپ ممکن است برای تلاش‌های گذشته آنتروپیک به دست آمده باشند، اما ممکن است تا سال‌ها بعد هرگز به طور واقعی ندانیم که آیا نام‌های آن کتاب‌های تخریب‌شده به طور گسترده شناخته می‌شوند یا خیر.

من مطمئن هستم که هیچ‌کس نمی‌خواهد در دنیایی زندگی کند که توسط ابزارهای هوش مصنوعی تحت سلطه است که بر روی مطالب خواندنی آموزش دیده‌اند که به شکل فیزیکی اصلی خود به راحتی در دسترس نیستند.

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.