مقایسه چت‌جی‌پی‌تی-۶ و کلود اپوس ۵.۵ در ۵ سناریو

در بررسی مقایسه‌ای میان مدل‌های هوش مصنوعی چت‌جی‌پی‌تی-۶ و کلود اپوس ۵.۵ با ۵ دستور روزمره، مشخص شد کدام مدل عملکرد بهتری ارائه می‌دهد.

تتیم تحریریه۹ دقیقه مطالعه۰ بازدید۱ ساعت پیش
مقایسه چت‌جی‌پی‌تی-۶ و کلود اپوس ۵.۵ در ۵ سناریو

شرکت‌های اوپن‌ای‌آی (OpenAI) و انتروپیک (Anthropic) هر دو مدل‌های پرچمدار هوش مصنوعی جدید خود یعنی چت‌جی‌پی‌تی-۶ (ChatGPT-6) و کلود اپوس ۵.۵ (Claude Opus 5.5) را در ماه جاری عرضه کردند. هر دو مدل به طرز شگفت‌انگیزی توانمند هستند؛ به گونه‌ای که بسیار فراتر از انتظارات و دستورات اکثر کاربران عمل می‌کنند.

خانواده جی‌پی‌تی-۶ (GPT-6) شرکت اوپن‌ای‌آی (OpenAI) بر پایه مدل جی‌پی‌تی-۶ آسترا (GPT-6 Astra) (چشمگیرترین مدل این شرکت تا به امروز) ساخته شده است و پیشرفت‌های چشمگیری در حوزه‌های استدلال، کار حرفه‌ای، برنامه‌نویسی، وب‌گردی و استفاده از کامپیوتر دارد. نسخه جدیدتر جی‌پی‌تی-۶ سول (GPT-6 Sol) بخش عمده‌ای از این هوش را به نسخه‌ای مختص کارهای روزمره آورده است و شرکت اوپن‌ای‌آی (OpenAI) آن را به عنوان یک مدل استدلالی سریع‌تر و مقرون‌به‌صرفه‌تر معرفی می‌کند.

مدل کلود اپوس ۵.۵ (Claude Opus 5.5) از زاویه‌ای کمی متفاوت به این مسئله نگاه می‌کند. شرکت انتروپیک (Anthropic) آن را مدلی توصیف می‌کند که برای کارهای عاملی (agentic) طولانی‌مدت و دانش‌محور ساخته شده است و دارای تفکر تطبیقی است که تعیین می‌کند یک درخواست چقدر به تلاش نیاز دارد. این مدل دارای پنجره زمینه ۱ میلیون توکنی است، می‌تواند تا ۱۲۸,۰۰۰ توکن خروجی تولید کند و به گفته شرکت انتروپیک (Anthropic)، در بیشتر کارها به عملکردی تقریباً مشابه با مدل رده‌بالای خود یعنی کلود فیبل ۵.۱ (Claude Fable 5.1) دست می‌یابد، در حالی که هزینه اجرای آن ۴۰ درصد کمتر از نسخه قبلی اپوس (Opus) است. شرکت انتروپیک (Anthropic) همچنین به‌طور خاص بر بهبودهای صورت‌گرفته در نحوه ارتباط طبیعی مدل و پیروی آن از دستورالعمل‌های نگارشی تأکید کرده است.

این تفاوت‌ها چشمگیر به نظر می‌رسند، اما لزوماً به شما نمی‌گویند که ترجیح می‌دهید کدام چت‌بات در زندگی واقعی به شما کمک کند.

بنابراین، من دقیقاً همان پنج دستور را به چت‌جی‌پی‌تی-۶ (ChatGPT-6) و کلود اپوس ۵.۵ (Claude Opus 5.5) دادم. نتیجه، آن پیروزی قاطعی نبود که انتظار داشتم. در ادامه می‌بینید که وقتی آن‌ها را در معرض دستورات روزمره قرار دادم، چه اتفاقی افتاد.

۱. برنامه‌ریزی آشفته دنیای واقعی — محدودیت‌ها + قضاوت

دستور: من ۱۵۰ دلار برای برنامه‌ریزی یک مهمانی تولد برای ۱۰ کودک ۸ تا ۱۱ ساله دارم. این مهمانی باید سه ساعت طول بکشد، در صورت بارندگی در فضای سرپوشیده برگزار شود، شامل غذا باشد و زمان استفاده از صفحه نمایش به حداقل برسد. دو نفر از بچه‌ها گیاه‌خوار هستند و یکی به بادام‌زمینی حساسیت دارد. برنامه کامل را شامل بودجه، جدول زمانی، فعالیت‌ها و برنامه پشتیبان ایجاد کنید. به هیچ وجه از ۱۵۰ دلار تجاوز نکنید.

چت‌جی‌پی‌تی (ChatGPT) با دادن یک هویت و جهت‌گیری فوری به رویداد، چارچوب مفهومی روشنی را ارائه داد. اختصاص ۳۶ دلار از بودجه برای سفارش ۳ پیتزای پنیر برای والدین میزبان ۱۰ کودک، عملاً ساده‌تر از مدیریت مینی‌پیتزاهای دست‌ساز در یک آشپزخانه معمولی خانگی است. این مدل همچنین نیاز به یک «پوئن اضطراری/قیمت» را در پایان تشخیص داد.

کلود (Claude) از این جهت هوشمندانه عمل کرد که رویکرد پیشگیرانه‌ای نسبت به آلرژی‌ها و پروتکل‌های غذایی داشت. این مدل همچنین به موضوع آلودگی متقاطع کیک‌های قنادی و مخلوط‌های جعبه‌ای پرداخت. علاوه بر این، با صرف ۱۴ دلار برای کیف‌های خرید پارچه‌ای و ۱۲ دلار برای ماژیک‌های پارچه‌ای، بودجه‌بندی دوجانبه‌ای انجام داد که هم به عنوان فعالیت صنایع دستی در بدو ورود و هم به عنوان هدیه مهمانی برای بردن به خانه عمل می‌کند، که باعث صرفه‌جویی در هزینه و کاهش استفاده از وسایل پلاستیکی ارزان‌قیمت می‌شود. این مدل همچنین یک برنامه زمانی عملیاتی و قابل اجرا و عیب‌یابی عملیاتی را ارائه داد.

برنده: کلود برنده می‌شود زیرا یک برنامه آماده و کلید در دست با دقت ایمنی واقعی ارائه داد، در حالی که چت‌جی‌پی‌تی (ChatGPT) یک فهرست خرید تکه‌تکه تولید کرد.

۲. نگارش — انسانی‌سازی هوش مصنوعی

دستور: این اطلاعیه خسته‌کننده را بازنویسی کنید تا شبیه چیزی شود که یک فرد واقعی واقعاً بخواهد آن را بخواند. تمام جزئیات واقعی را حفظ کنید، از خط فاصله تیره استفاده نکنید، از کلیشه‌ها بپرهیزید و از کلمات «هیجان‌انگیز»، «انقلابی»، «تحول‌آفرین» یا «یکپارچه» استفاده نکنید.

«شرکت ما در حال معرفی یک ویژگی تقویم جدید مبتنی بر هوش مصنوعی است که به طور خودکار تداخلات برنامه‌ریزی را شناسایی می‌کند، زمان‌های ملاقات را پیشنهاد می‌کند و پس از جلسات خلاصه‌هایی ایجاد می‌کند. این ویژگی در ۱۵ اکتبر راه‌اندازی می‌شود و بدون هزینه اضافی در دسترس همه مشتریان خواهد بود.»

چت‌جی‌پی‌تی (ChatGPT) یک جمله کوتاه و جذاب ارائه داد که خواننده را مجذوب خود می‌کند و همچنین از سبک‌های هوش مصنوعی اجتناب کرده و تمام جزئیات واقعی را حفظ کرد. شکستن پاراگراف‌ها مرور سریع آن را آسان می‌کند.

کلود (Claude) نکات گلوله‌ای را به مزایای ملموس انسانی تبدیل کرد و جزئیات را پیرامون آرامش واقعی در محیط کار بازتعریف کرد.

برنده: کلود برنده می‌شود زیرا متوجه شد که بازنویسی «انسانی» نیازمند بازنگری در نحوه توضیح ارزش ویژگی‌ها است، نه اینکه صرفاً چند فعل را در متن اصلی جابجا کند.

۳. استدلال — پاسخی که واضح نیست

دستور: یک خانواده در حال انتخاب میان دو اقامتگاه تعطیلات هستند. اقامتگاه الف ۱۸۵۰ دلار هزینه دارد و ۱۰ دقیقه پیاده‌روی تا ساحل فاصله دارد. اقامتگاه ب ۱۵۰۰ دلار هزینه دارد اما نیازمند ۲۵ دقیقه رانندگی تا ساحل و ۳۵ دلار هزینه پارکینگ در روز است. آن‌ها هفت روز اقامت دارند و انتظار دارند روزی دو بار به ساحل بروند. آن‌ها سه کودک دارند. کدام یک را باید انتخاب کنند؟ فقط هزینه را محاسبه نکنید. عوامل تغییردهنده توصیه خود را شناسایی کنید و به من بگویید چه اطلاعات اضافی بیشترین اهمیت را دارد.

چت‌جی‌پی‌تی (ChatGPT) بهترین دیدگاه متقابل را در مورد سن کودکان ارائه داد. این مدل همچنین با هومندی خاطرنشان کرد که «۱۰ دقیقه پیاده‌روی» بسته به زیرساخت‌ها (پیاده‌روی چوبی در مقایسه با عبور از بزرگراه چهار بانده یا گذر از تپه‌های شنی) به شدت متغیر است. چت‌بات به‌طور خاص اشاره کرد که اقامتگاه الف به والدین اجازه می‌دهد از هم جدا شوند (مثلاً یک والد کودک خسته را برمی‌گرداند در حالی که والد دیگر با دو کودک دیگر در ساحل می‌ماند).

کلود (Claude) در واقع محاسبه مسافت را انجام داد و ثابت کرد که پس‌انداز مالی اقامتگاه ب عملاً مبلغ ناچیز ۵۵ تا ۶۵ دلار برای کل هفته است. کلود همچنین یک نکته روان‌شناختی زیرکانه ارائه داد: سوار و پیاده کردن سه کودک در صندلی‌های خودرو چهار بار در روز به این معناست که خانواده احتمالاً دومین سفر روزانه به ساحل را به کلی رها خواهند کرد. این مدل همچنین راز کثیف پلتفرم‌های اجاره اقامتگاه را به درستی پرچم‌گذاری کرد: نرخ‌های پایه هزینه‌های نظافت، هزینه‌های خدمات یا مالیات‌های اشغال را منعکس نمی‌کنند که به خودی خود می‌توانند اختلاف ۱۰۵ دلاری را به راحتی جابجا کنند.

برنده: کلود با اختلاف بسیار کمی برنده می‌شود. اگرچه چت‌جی‌پی‌تی (ChatGPT) بهترین نکته فردی را داشت (تشخیص اینکه پیاده‌روی با تجهیزات سنگین ساحلی و کودکان خشک‌سالی می‌تواند در واقع طاقت‌فرساتر از رانندگی باشد)، اما کلود به طور کلی برنده شد زیرا تفکیک مالی آن تا سطح هر گالن کامل بود، هزینه‌های پنهان را پیش‌بینی کرد و مشاهده‌اش مبنی بر اینکه رفت‌وآمد باعث می‌شود خانواده برنامه‌های تفریحی خود را لغو کنند، کاملاً درست بود.

۴. اضافه‌بار گزینه‌ها — پیدا کردن آنچه مهم است

دستور: یک شهر ۱۰ میلیون دلار بودجه برای خرج کردن دارد و سه گزینه پیش رو دارد:

الف) ساخت یک کتابخانه عمومی جدید که پیش‌بینی می‌شود برای حداقل ۳۰ سال، سالانه ۲۰۰,۰۰۰ بازدید را پوشش دهد.

ب) پرداخت یک‌باره ۵۰۰ دلار به هر خانوار.

ج) ارتقای زیرساخت‌های فرسوده آب که ساکنان متوجه آن نخواهند شد مگر اینکه مشکلی پیش بیاید.

شهر تنها می‌تواند یک گزینه را انتخاب کند. گزینه‌ای را که به نظر شما بهترین است انتخاب کنید. استدلال خود را توضیح دهید، قوی‌ترین استدلال علیه انتخاب خود را شناسایی کنید و توضیح دهید چه اطلاعات اضافی احتمال بیشتری دارد که پاسخ شما را تغییر دهد. با گفتن اینکه هر سه گزینه خوب هستند، طفره نروید.

چت‌جی‌پی‌تی (ChatGPT) تمام دستورالعمل‌ها را به طور تمیز دنبال کرد و دفاعی خوانا از گزینه ج ارائه داد. این مدل همچنین آستانه ارزیابی مهندسی را به طور تمیز تعریف کرد.

کلود (Claude) انتخابی را که انجام داده بود از طریق انگیزه‌های شهرداری چارچوب‌بندی کرد و تشخیص داد که تأمین مالی آنچه سیاست‌های انتخاباتی نادیده می‌گیرند، وظیفه اصلی مدیریت شهری است.

برنده: کلود برای پاسخگویی بسیار بهتر برنده می‌شود. به نظر می‌رسید این چت‌بات در حوزه مدیریت مالی عمومی تجربه دارد، در حالی که پاسخ چت‌جی‌پی‌تی (ChatGPT) بیشتر استاندارد و سطحی به نظر می‌رسید.

۵. آزمون نهایی — درخواست مبهم + ابتکار عمل

دستور: احساس می‌کنم زندگی‌ام بی‌نظم است. من سه فرزند، یک شغل تمام‌وقت، مسئولیت‌های خانه و حدود ۳۰ دقیقه در هر عصر برای سر و سامان دادن به امور دارم. سیستمی برای من بسازید که بتوانم واقعاً آن را حفظ کنم. به من توصیه‌های عمومی بهره‌وری نکنید. در صورت نیاز فرض‌های منطقی داشته باشید، به من بگویید چه چیزی را فرض می‌کنید و چیزی را به من بدهید که بتوانم امشب شروع کنم.

چت‌جی‌پی‌تی (ChatGPT) راه‌های ساده‌ای برای جلوگیری از فرسودگی شغلی پیشنهاد کرد و دستورالعمل‌هایی را ارائه داد که به بخش‌های کوچکی تقسیم شده بودند تا کاربر مجبور نباشد برنامه‌ریزی کند یا سعی کند حدس بزند از کجا شروع کند.

کلود (Claude) به بار ذهنی پرداخت که بینشی دقیق و هوشمندانه در مورد چرایی بی‌نظمی است. این مدل همچنین به نکته مفیدی درباره واگذاری کارهای خانه در صورت امکان اشاره کرد و در عین حال تشخیص داد که یک والد نمی‌تواند به تنهایی موتور عملیاتی یک خانواده پنج‌نفره باشد.

برنده: چت‌جی‌پی‌تی برنده می‌شود زیرا چارچوب شناختی آن بسیار بیشتر از پهنای باند ذهنی یک والد خسته محافظت می‌کند. کلود یک روال سازماندهی خانگی خوب ارائه داد؛ اما چت‌جی‌پی‌تی (ChatGPT) یک فیلتر تصمیم‌گیری ارائه کرد که در واقع مانع از آن می‌شود که کار، خانواده و زندگی یکدیگر را ببلعند.

برنده کلی: کلود

پس از پنج تست، کلود اپوس ۵.۵ (Claude Opus 5.5) در چهار مورد جلو افتاد. اما آنچه مرا شگفت‌زده کرد این بود که تفاوت یکسان بین این مدل‌ها چقدر به طور مداوم در وظایف کاملاً مرتبط ظاهر شد. کلود تمایل دارد به کاوش ادامه دهد.

وقتی از آن خواستم یک مهمانی تولد برنامه‌ریزی کنم، به آلودگی متقاطع فکر کرد و راه‌هایی پیدا کرد که یک خرید به دو هدف خدمت کند. وقتی مسئله اقامتگاه تعطیلات را به آن دادم، هزینه‌هایی را محاسبه کرد که صراحتاً نخواسته بودم و بررسی کرد که آیا ناراحتی ناشی از رانندگی واقعاً رفتار خانواده را تغییر می‌دهد یا خیر. حتی هنگام انتخاب نحوه هزینه کرد ۱۰ میلیون دلاری شهر، فراتر از مزایا و معایب آشکار نگاه کرد تا به این فکر کند که چرا دولت‌ها در وهله اول دست به چنین تصمیماتی می‌زنند.

این همان جایی است که اپوس ۵.۵ (Opus 5.5) قوی‌تر به نظر می‌رسید. چت‌جی‌پی‌تی-۶ (ChatGPT-6) به طور کلی ساده‌تر بود که بسیار با هویت برند چت‌جی‌پی‌تی همخوانی دارد. صرف‌نظر از مدل، چت‌جی‌پی‌تی همیشه به نظر می‌رسد که مدل «کمتر حاشیه‌دار» بین این دو است و پاسخی ارائه می‌دهد که سریع‌تر به اصل مطلب می‌رسد. این همچنین بدان معناست که گاهی اوقات پاسخ‌های آن به عمق پاسخ‌های کلود نمی‌رسید. با این حال، این رویکرد در آزمایش نهایی من به یک مزیت تبدیل شد.

  • Nvidia says 'local AI is here' — and it could change how you use AI at home
  • I replaced ChatGPT with Siri AI for a day — here's what surprised me
  • AI could be costing you money: new study finds chatbots get most financial questions wrong


منبع: tomsguide.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.