شرکتهای اوپنایآی (OpenAI) و انتروپیک (Anthropic) هر دو مدلهای پرچمدار هوش مصنوعی جدید خود یعنی چتجیپیتی-۶ (ChatGPT-6) و کلود اپوس ۵.۵ (Claude Opus 5.5) را در ماه جاری عرضه کردند. هر دو مدل به طرز شگفتانگیزی توانمند هستند؛ به گونهای که بسیار فراتر از انتظارات و دستورات اکثر کاربران عمل میکنند.
خانواده جیپیتی-۶ (GPT-6) شرکت اوپنایآی (OpenAI) بر پایه مدل جیپیتی-۶ آسترا (GPT-6 Astra) (چشمگیرترین مدل این شرکت تا به امروز) ساخته شده است و پیشرفتهای چشمگیری در حوزههای استدلال، کار حرفهای، برنامهنویسی، وبگردی و استفاده از کامپیوتر دارد. نسخه جدیدتر جیپیتی-۶ سول (GPT-6 Sol) بخش عمدهای از این هوش را به نسخهای مختص کارهای روزمره آورده است و شرکت اوپنایآی (OpenAI) آن را به عنوان یک مدل استدلالی سریعتر و مقرونبهصرفهتر معرفی میکند.
مدل کلود اپوس ۵.۵ (Claude Opus 5.5) از زاویهای کمی متفاوت به این مسئله نگاه میکند. شرکت انتروپیک (Anthropic) آن را مدلی توصیف میکند که برای کارهای عاملی (agentic) طولانیمدت و دانشمحور ساخته شده است و دارای تفکر تطبیقی است که تعیین میکند یک درخواست چقدر به تلاش نیاز دارد. این مدل دارای پنجره زمینه ۱ میلیون توکنی است، میتواند تا ۱۲۸,۰۰۰ توکن خروجی تولید کند و به گفته شرکت انتروپیک (Anthropic)، در بیشتر کارها به عملکردی تقریباً مشابه با مدل ردهبالای خود یعنی کلود فیبل ۵.۱ (Claude Fable 5.1) دست مییابد، در حالی که هزینه اجرای آن ۴۰ درصد کمتر از نسخه قبلی اپوس (Opus) است. شرکت انتروپیک (Anthropic) همچنین بهطور خاص بر بهبودهای صورتگرفته در نحوه ارتباط طبیعی مدل و پیروی آن از دستورالعملهای نگارشی تأکید کرده است.
این تفاوتها چشمگیر به نظر میرسند، اما لزوماً به شما نمیگویند که ترجیح میدهید کدام چتبات در زندگی واقعی به شما کمک کند.
بنابراین، من دقیقاً همان پنج دستور را به چتجیپیتی-۶ (ChatGPT-6) و کلود اپوس ۵.۵ (Claude Opus 5.5) دادم. نتیجه، آن پیروزی قاطعی نبود که انتظار داشتم. در ادامه میبینید که وقتی آنها را در معرض دستورات روزمره قرار دادم، چه اتفاقی افتاد.
۱. برنامهریزی آشفته دنیای واقعی — محدودیتها + قضاوت
دستور: من ۱۵۰ دلار برای برنامهریزی یک مهمانی تولد برای ۱۰ کودک ۸ تا ۱۱ ساله دارم. این مهمانی باید سه ساعت طول بکشد، در صورت بارندگی در فضای سرپوشیده برگزار شود، شامل غذا باشد و زمان استفاده از صفحه نمایش به حداقل برسد. دو نفر از بچهها گیاهخوار هستند و یکی به بادامزمینی حساسیت دارد. برنامه کامل را شامل بودجه، جدول زمانی، فعالیتها و برنامه پشتیبان ایجاد کنید. به هیچ وجه از ۱۵۰ دلار تجاوز نکنید.
چتجیپیتی (ChatGPT) با دادن یک هویت و جهتگیری فوری به رویداد، چارچوب مفهومی روشنی را ارائه داد. اختصاص ۳۶ دلار از بودجه برای سفارش ۳ پیتزای پنیر برای والدین میزبان ۱۰ کودک، عملاً سادهتر از مدیریت مینیپیتزاهای دستساز در یک آشپزخانه معمولی خانگی است. این مدل همچنین نیاز به یک «پوئن اضطراری/قیمت» را در پایان تشخیص داد.
کلود (Claude) از این جهت هوشمندانه عمل کرد که رویکرد پیشگیرانهای نسبت به آلرژیها و پروتکلهای غذایی داشت. این مدل همچنین به موضوع آلودگی متقاطع کیکهای قنادی و مخلوطهای جعبهای پرداخت. علاوه بر این، با صرف ۱۴ دلار برای کیفهای خرید پارچهای و ۱۲ دلار برای ماژیکهای پارچهای، بودجهبندی دوجانبهای انجام داد که هم به عنوان فعالیت صنایع دستی در بدو ورود و هم به عنوان هدیه مهمانی برای بردن به خانه عمل میکند، که باعث صرفهجویی در هزینه و کاهش استفاده از وسایل پلاستیکی ارزانقیمت میشود. این مدل همچنین یک برنامه زمانی عملیاتی و قابل اجرا و عیبیابی عملیاتی را ارائه داد.
برنده: کلود برنده میشود زیرا یک برنامه آماده و کلید در دست با دقت ایمنی واقعی ارائه داد، در حالی که چتجیپیتی (ChatGPT) یک فهرست خرید تکهتکه تولید کرد.
۲. نگارش — انسانیسازی هوش مصنوعی
دستور: این اطلاعیه خستهکننده را بازنویسی کنید تا شبیه چیزی شود که یک فرد واقعی واقعاً بخواهد آن را بخواند. تمام جزئیات واقعی را حفظ کنید، از خط فاصله تیره استفاده نکنید، از کلیشهها بپرهیزید و از کلمات «هیجانانگیز»، «انقلابی»، «تحولآفرین» یا «یکپارچه» استفاده نکنید.
«شرکت ما در حال معرفی یک ویژگی تقویم جدید مبتنی بر هوش مصنوعی است که به طور خودکار تداخلات برنامهریزی را شناسایی میکند، زمانهای ملاقات را پیشنهاد میکند و پس از جلسات خلاصههایی ایجاد میکند. این ویژگی در ۱۵ اکتبر راهاندازی میشود و بدون هزینه اضافی در دسترس همه مشتریان خواهد بود.»
چتجیپیتی (ChatGPT) یک جمله کوتاه و جذاب ارائه داد که خواننده را مجذوب خود میکند و همچنین از سبکهای هوش مصنوعی اجتناب کرده و تمام جزئیات واقعی را حفظ کرد. شکستن پاراگرافها مرور سریع آن را آسان میکند.
کلود (Claude) نکات گلولهای را به مزایای ملموس انسانی تبدیل کرد و جزئیات را پیرامون آرامش واقعی در محیط کار بازتعریف کرد.
برنده: کلود برنده میشود زیرا متوجه شد که بازنویسی «انسانی» نیازمند بازنگری در نحوه توضیح ارزش ویژگیها است، نه اینکه صرفاً چند فعل را در متن اصلی جابجا کند.
۳. استدلال — پاسخی که واضح نیست
دستور: یک خانواده در حال انتخاب میان دو اقامتگاه تعطیلات هستند. اقامتگاه الف ۱۸۵۰ دلار هزینه دارد و ۱۰ دقیقه پیادهروی تا ساحل فاصله دارد. اقامتگاه ب ۱۵۰۰ دلار هزینه دارد اما نیازمند ۲۵ دقیقه رانندگی تا ساحل و ۳۵ دلار هزینه پارکینگ در روز است. آنها هفت روز اقامت دارند و انتظار دارند روزی دو بار به ساحل بروند. آنها سه کودک دارند. کدام یک را باید انتخاب کنند؟ فقط هزینه را محاسبه نکنید. عوامل تغییردهنده توصیه خود را شناسایی کنید و به من بگویید چه اطلاعات اضافی بیشترین اهمیت را دارد.
چتجیپیتی (ChatGPT) بهترین دیدگاه متقابل را در مورد سن کودکان ارائه داد. این مدل همچنین با هومندی خاطرنشان کرد که «۱۰ دقیقه پیادهروی» بسته به زیرساختها (پیادهروی چوبی در مقایسه با عبور از بزرگراه چهار بانده یا گذر از تپههای شنی) به شدت متغیر است. چتبات بهطور خاص اشاره کرد که اقامتگاه الف به والدین اجازه میدهد از هم جدا شوند (مثلاً یک والد کودک خسته را برمیگرداند در حالی که والد دیگر با دو کودک دیگر در ساحل میماند).
کلود (Claude) در واقع محاسبه مسافت را انجام داد و ثابت کرد که پسانداز مالی اقامتگاه ب عملاً مبلغ ناچیز ۵۵ تا ۶۵ دلار برای کل هفته است. کلود همچنین یک نکته روانشناختی زیرکانه ارائه داد: سوار و پیاده کردن سه کودک در صندلیهای خودرو چهار بار در روز به این معناست که خانواده احتمالاً دومین سفر روزانه به ساحل را به کلی رها خواهند کرد. این مدل همچنین راز کثیف پلتفرمهای اجاره اقامتگاه را به درستی پرچمگذاری کرد: نرخهای پایه هزینههای نظافت، هزینههای خدمات یا مالیاتهای اشغال را منعکس نمیکنند که به خودی خود میتوانند اختلاف ۱۰۵ دلاری را به راحتی جابجا کنند.
برنده: کلود با اختلاف بسیار کمی برنده میشود. اگرچه چتجیپیتی (ChatGPT) بهترین نکته فردی را داشت (تشخیص اینکه پیادهروی با تجهیزات سنگین ساحلی و کودکان خشکسالی میتواند در واقع طاقتفرساتر از رانندگی باشد)، اما کلود به طور کلی برنده شد زیرا تفکیک مالی آن تا سطح هر گالن کامل بود، هزینههای پنهان را پیشبینی کرد و مشاهدهاش مبنی بر اینکه رفتوآمد باعث میشود خانواده برنامههای تفریحی خود را لغو کنند، کاملاً درست بود.
۴. اضافهبار گزینهها — پیدا کردن آنچه مهم است
دستور: یک شهر ۱۰ میلیون دلار بودجه برای خرج کردن دارد و سه گزینه پیش رو دارد:
الف) ساخت یک کتابخانه عمومی جدید که پیشبینی میشود برای حداقل ۳۰ سال، سالانه ۲۰۰,۰۰۰ بازدید را پوشش دهد.
ب) پرداخت یکباره ۵۰۰ دلار به هر خانوار.
ج) ارتقای زیرساختهای فرسوده آب که ساکنان متوجه آن نخواهند شد مگر اینکه مشکلی پیش بیاید.
شهر تنها میتواند یک گزینه را انتخاب کند. گزینهای را که به نظر شما بهترین است انتخاب کنید. استدلال خود را توضیح دهید، قویترین استدلال علیه انتخاب خود را شناسایی کنید و توضیح دهید چه اطلاعات اضافی احتمال بیشتری دارد که پاسخ شما را تغییر دهد. با گفتن اینکه هر سه گزینه خوب هستند، طفره نروید.
چتجیپیتی (ChatGPT) تمام دستورالعملها را به طور تمیز دنبال کرد و دفاعی خوانا از گزینه ج ارائه داد. این مدل همچنین آستانه ارزیابی مهندسی را به طور تمیز تعریف کرد.
کلود (Claude) انتخابی را که انجام داده بود از طریق انگیزههای شهرداری چارچوببندی کرد و تشخیص داد که تأمین مالی آنچه سیاستهای انتخاباتی نادیده میگیرند، وظیفه اصلی مدیریت شهری است.
برنده: کلود برای پاسخگویی بسیار بهتر برنده میشود. به نظر میرسید این چتبات در حوزه مدیریت مالی عمومی تجربه دارد، در حالی که پاسخ چتجیپیتی (ChatGPT) بیشتر استاندارد و سطحی به نظر میرسید.
۵. آزمون نهایی — درخواست مبهم + ابتکار عمل
دستور: احساس میکنم زندگیام بینظم است. من سه فرزند، یک شغل تماموقت، مسئولیتهای خانه و حدود ۳۰ دقیقه در هر عصر برای سر و سامان دادن به امور دارم. سیستمی برای من بسازید که بتوانم واقعاً آن را حفظ کنم. به من توصیههای عمومی بهرهوری نکنید. در صورت نیاز فرضهای منطقی داشته باشید، به من بگویید چه چیزی را فرض میکنید و چیزی را به من بدهید که بتوانم امشب شروع کنم.
چتجیپیتی (ChatGPT) راههای سادهای برای جلوگیری از فرسودگی شغلی پیشنهاد کرد و دستورالعملهایی را ارائه داد که به بخشهای کوچکی تقسیم شده بودند تا کاربر مجبور نباشد برنامهریزی کند یا سعی کند حدس بزند از کجا شروع کند.
کلود (Claude) به بار ذهنی پرداخت که بینشی دقیق و هوشمندانه در مورد چرایی بینظمی است. این مدل همچنین به نکته مفیدی درباره واگذاری کارهای خانه در صورت امکان اشاره کرد و در عین حال تشخیص داد که یک والد نمیتواند به تنهایی موتور عملیاتی یک خانواده پنجنفره باشد.
برنده: چتجیپیتی برنده میشود زیرا چارچوب شناختی آن بسیار بیشتر از پهنای باند ذهنی یک والد خسته محافظت میکند. کلود یک روال سازماندهی خانگی خوب ارائه داد؛ اما چتجیپیتی (ChatGPT) یک فیلتر تصمیمگیری ارائه کرد که در واقع مانع از آن میشود که کار، خانواده و زندگی یکدیگر را ببلعند.
برنده کلی: کلود
پس از پنج تست، کلود اپوس ۵.۵ (Claude Opus 5.5) در چهار مورد جلو افتاد. اما آنچه مرا شگفتزده کرد این بود که تفاوت یکسان بین این مدلها چقدر به طور مداوم در وظایف کاملاً مرتبط ظاهر شد. کلود تمایل دارد به کاوش ادامه دهد.
وقتی از آن خواستم یک مهمانی تولد برنامهریزی کنم، به آلودگی متقاطع فکر کرد و راههایی پیدا کرد که یک خرید به دو هدف خدمت کند. وقتی مسئله اقامتگاه تعطیلات را به آن دادم، هزینههایی را محاسبه کرد که صراحتاً نخواسته بودم و بررسی کرد که آیا ناراحتی ناشی از رانندگی واقعاً رفتار خانواده را تغییر میدهد یا خیر. حتی هنگام انتخاب نحوه هزینه کرد ۱۰ میلیون دلاری شهر، فراتر از مزایا و معایب آشکار نگاه کرد تا به این فکر کند که چرا دولتها در وهله اول دست به چنین تصمیماتی میزنند.
این همان جایی است که اپوس ۵.۵ (Opus 5.5) قویتر به نظر میرسید. چتجیپیتی-۶ (ChatGPT-6) به طور کلی سادهتر بود که بسیار با هویت برند چتجیپیتی همخوانی دارد. صرفنظر از مدل، چتجیپیتی همیشه به نظر میرسد که مدل «کمتر حاشیهدار» بین این دو است و پاسخی ارائه میدهد که سریعتر به اصل مطلب میرسد. این همچنین بدان معناست که گاهی اوقات پاسخهای آن به عمق پاسخهای کلود نمیرسید. با این حال، این رویکرد در آزمایش نهایی من به یک مزیت تبدیل شد.
- Nvidia says 'local AI is here' — and it could change how you use AI at home
- I replaced ChatGPT with Siri AI for a day — here's what surprised me
- AI could be costing you money: new study finds chatbots get most financial questions wrong
منبع: tomsguide.com
