در طول چند هفته گذشته، سر و صدای زیادی پیرامون مدلهای تصمیمگیری مانند مدل Jev سیستم وان شرکت تایپسِف AI (Typesafe AI’s Jev) به پا شده است. در حالی که مدلهای دستهبندی مدتی است که وجود دارند، Jev یک مفهوم جدید مدل تصمیمگیری را به دنیای هوش مصنوعی معرفی میکند؛ مدلی که خروجیهای ساختاریافته محدود را ارزان، سریع و بهطور مداوم تولید میکند و میتوان زمانی که تصمیمی مورد نیاز است، آن را به یک چرخه کاری اضافه کرد. این مدلها به اندازه کافی توانمند هستند تا روی هر مجموعه ورودی بدون نیاز به بازآموزی مداوم مدل برای گنجاندن دستهبندیهای جدید دستهبندی کار کنند. این در تضاد با دنیای مدلهای زبانی بزرگ (LLMs) است که تا حد زیادی غیرقطعی هستند، اما به اندازه کافی باز هستند تا برای بارهای کاری عاملی (agentic workloads) استدلال کرده، متن تولید کنند و فرازهای ابزاری انجام دهند.
امروز، ما در حال انتشار دو مدل تصمیمگیری آموزشدیده توسط کلودفلر (Cloudflare) به نامهای Clef و Clef-flash هستیم که روی ورکرز AI (Workers AI) میزبانی میشوند. مدل Clef در حال حاضر رهبر ارزیابیشده در برابر شاخص تصمیمگیری Jev (Jev Decision Index) است و شما میتوانید نتایج کامل را در سایت نمایشی بنچمارک زنده مشاهده کنید. این مدلها هوشمندتر، سریعتر و کاملاً سازگار با API مدل Jev هستند، بنابراین میتوانید به راحتی با این مدلهای میزبانیشده آزمایش کنید. ما این مدلها را به طور کامل به صورت متنباز تحت مجوز Apache 2.0 در هاگ فیس (Hugging Face) منتشر میکنیم تا خودتان آنها را به صورت محلی اجرا کرده و آزمایش کنید.
در نهایت، ما بسیار هیجانزده هستیم که محصول جدید یادگیری تقویتی (RL) خود را معرفی کنیم که به مشتریان اجازه میدهد Clef را برای موارد استفاده خود نیز تنظیم دقیق (fine-tune) کنند.
مدل تصمیمگیری چیست؟
یک مدل تصمیمگیری دستهبندیهایی را انجام میدهد تا به ایجنتها کمک کند تصمیم بگیرند چگونه عمل کنند، که این کار بر اساس احتمالات خاصی انجام میشود. برای مثال، میتوانید یک پیام پشتیبانی مشتری (ورودیها) را ارسال کنید و بپرسید آیا فوری است و کدام تیم باید به آن رسیدگی کند. یک مدل تصمیمگیری پاسخهای تایپشده با احتمالات (خروجیها) را برمیگرداند که کد شما میتواند از آنها برای هدایت تیکت، راهاندازی تشدید یا ارجاع به یک انسان استفاده کند. این بدان معناست که دیگر نیازی نیست انسان لزوماً در حلقه تصمیمهای عاملی حضور داشته باشد — ایجنتها میتوانند به صورت برنامهنویسی زمینه را جمعآوری کنند، تصمیم بگیرند و در مورد وظایف اقدام کنند یا در صورت نیاز به یک انسان ارجاع دهند.
به طور خاص در کلودفلر، ما مدل جدید Clef خود را روی تیم هوش تهدید (Threat Intelligence) خود آزمایش کردهایم تا به ما در دستهبندی دندههای وبسایت کمک کند. با دادن یک دامنه به Clef (با Browser Run)، این مدل میتواند به سرعت دستههایی را که دامنه در آنها قرار میگیرد شناسایی کند — برای مثال، ممکن است دامنهای را با احتمال ۹۵ درصد به عنوان یک وبسایت مد، ۸۵ درصد تجارت الکترونیک، کمتر از ۱ درصد فیشینگ و غیره دستهبندی کند. این دستهبندی برای مدل Clef ما ۲.۲ ثانیه طول کشید تا وبسایت را دریافت، رندر و دستهبندی کند. در مقابل، سریعترین مدل زبانی بزرگ عمومی ما یعنی gpt-oss-120b در همان چرخه کاری ۴.۷ ثانیه زمان برد و تنها دو دستهبندی را برگرداند. به عنوان یک کاربر، میتوانید تصور کنید که چگونه کاهش ۲ برابری در تأخیر (latency) و نتایج میتواند به ما کمک کند تا چرخههای کاری هوش تهدید خود را بهبود بخشیم و در شناسایی دامنههای مخرب یا مشروع سریعتر عمل کنیم. این را به هر مورد استفادهای که در آن نیاز به تصمیمگیری سریع برنامهنویسی دارید تعمیم دهید، و چرخههای کاری عاملی قدرتمندی را باز میکنید که قادر به تصمیمگیری، استدلال و اجرای مستقل هستند.
در تئوری موسیقی، کلِف (clef) نمادی است که در ابتدای حامل موسیقی قرار میگیرد و نامهای زیروبمی خاصی را به خطوط و فضاها اختصاص میدهد. یک مدل تصمیمگیری مشابه یک کلِف موسیقی است زیرا به تعریف دامنه زمینه و نتهای بعدی (اعمال) که پس از آن میآیند کمک میکند. ما Clef را به عنوان نام خانواده مدلهای تصمیمگیری خود انتخاب کردیم، زیرا اهداف مشابهی را دنبال میکند و حروف CF یادآور کلودفلر است.
Clef چه تفاوتی با سایر مدلهای تصمیمگیری دارد؟
اگرچه بازار به طور فزایندهای با مدلهای تصمیمگیری اشباع میشود، Clef دارای ویژگیهای منحصر به فردی است که باعث میشود ما از عرضه آن به عموم هیجانزده شویم. اول اینکه، این مدل دارای یک رمزگذار بینایی (vision encoder) است بنابراین میتواند تصاویر را دریافت کرده و محتوای بصری را دستهبندی کند. این با Jev که امروزه فقط دستهبندی متن را انجام میدهد متفاوت است. دوم اینکه، مدل ما دارای یک پنجره زمینه 64k است (در مقایسه با 32k مدل Jev)، که به کاربران اجازه میدهد وضعیت ورودی بیشتری را برای مدل فراهم کنند تا بر اساس آن دستهبندی کند.
سوم، مدل ما دقیق و قدرتمند است و در بنچمارکهای مختلف کیفیت، به طور رقابتی در برابر سایر مدلهای تصمیمگیری موجود در بازار امتیاز کسب میکند. ما برخی از ارزیابیهای مهم برای تصمیمگیری را که توسط شاخص تصمیمگیری Jev تعریف شدهاند، در اینجا آوردهایم و برخی از محبوبترین مدلهای بازار را برای آن امتیازدهی کردهایم.
علاوه بر مزایای تأخیر از خود مدل، مدلهای Clef ما روی Workers AI میزبانی میشوند. از آنجا که آنها روی زیرساخت کلودفلر میزبانی میشوند، ما میتوانیم از پردازندههای گرافیکی (GPUs) خود در لبه شبکه (edge) بهرهبری کنیم که منجر به تأخیر شبکه کمتر و تصمیمات سریعتر میشود. این بدان معناست که شما میتوانید Clef را در مسیر اصلی (hot path) برای ایجنتها قرار دهید تا تصمیمگیری کنند و آن را با یکی از مدلهای زبانی بزرگ ما روی Workers AI ترکیب کنید تا اقدام کنید.
Clef همچنین خروجیهای کاملاً تایپشده مشابه Jev تولید میکند و کاملاً سازگار با API است، بنابراین میتوانید تعویض را بسیار آسان انجام دهید. مدل بزرگتر Clef مدل دقت قدرتمندتر شما است، در حالی که مدل Clef-Flash برای تصمیمات حساس به تأخیر عالی است. این مدلها آماده سازمانی (enterprise-ready) هستند و تضمین میکنیم که درخواستها یا پاسخهای شما را نمیخوانیم، ذخیره نمیکنیم یا روی آنها آموزش نمیدهیم (مگر اینکه بخواهید از محصول تنظیم دقیق ما استفاده کنید). شما میتوانید مدلهای Clef را امروز شروع کنید، از مستندات توسعهدهنده ما شروع کنید یا با مدل متنباز در مخزن هاگ فیس بازی کنید.
اگر مایل به کمک در تنظیم دقیق Clef برای یک بار کاری خاص هستید، ما همچنین خدمات تنظیم دقیق را ارائه میدهیم — ابتدا به عنوان یک شریک عملی با تیم مهندسین مستقر در خط مقدم (FDE) خود، و سپس به عنوان یک پلتفرم تنظیم دقیق سلفسرویس برای مشتریان تا مدل را آموزش داده و مجدداً روی کلودفلر مستقر کنند.
نحوه آموزش Clef
در همان هفتهای که Jev منتشر شد، ما درباره برخی آزمایشهایی که با مدل تصمیمگیری بومی خود انجام داده بودیم پستی منتشر کردیم. نسخه نمایشی ما نشان میدهد که چگونه مدل DiffusionGemma را تطبیق دادیم تا با افشای logprobs تولید شده توسط یک مدل زبانی بزرگ، احتمالات قطعی را خروجی دهد. رویکرد اولیه ما بر اساس تحقیقات مستقل مات استراچی (Matt Mastracci) ساخته شد که در جامعه یادگیری ماشین فعال بوده است.
Clef بر اساس این مفهوم ساخته شده است، اما از یک مدل پایه متفاوت به عنوان ستون فقرات استفاده میکند. ما در حال حاضر از Qwen به عنوان مدل پایه استفاده میکنیم و آن را برای موارد استفاده از مدل تصمیمگیری پس از آموزش (post-trained) دادهایم. در طول استنتاج، Clef از Qwen برای یک پاس فقط پیشپر کردن (prefill-only) استفاده میکند و سپس انتخابهای طرح معتبر را به صورت موازی امتیازدهی میکند.
با فریز کردن Qwen3.8-27B برای Clef و Qwen3.5-9B برای Clef-flash، ما به طور مشترک سر مسیریابی را در کنار آداپتورهای رتبه-256 کمرتبه (low-rank adapters) بهینهسازی کردیم. پس از آموزش ما از آنتروپی متقاطع هموار شده با برچسب برای خروجیهای طرح معتبر همراه با ضرر بریر (Brier loss) برای اصلاح کالیبراسیون احتمال استفاده میکند.
چگونه تنظیم دقیق میتواند قابلیتهای Clef را گسترش دهد
ما موارد استفاده داخلی زیادی را شنیدیم که نیازمند تنظیم دقیق مدل Clef ما برای ساخت در چرخههای کاری عاملی خود در کلودفلر بود. به عنوان مثال، تیمهای داخلی میخواهند یک مدل دستهبندیکننده قادر به ارزیابی ارسالهای اعتماد و ایمنی (Trust & Safety)، کمک به تریاژ درخواستهای پشتیبانی کلودفلر، یا حتی ساخت در محصولات ربات ما باشد تا تصمیم بگیرد آیا یک خزنده یک ربات خوب است یا ربات بد.
این موارد استفاده بسیار خاص هستند و ما سالها دادههای برچسبگذاریشده داریم که میتوانیم از آنها برای آموزش یک دستهبندیکننده خاص استفاده کنیم. از آنجا که کلودفلر بیش از ۱۵ سال داده شبکه در دامنههای مختلف دارد، ما میتوانیم یک مدل را تنظیم دقیق کنیم تا با این موارد استفاده خاص مطابقت داشته باشد که دقیقتر و سریعتر از مدل عمومی Clef ما است.
سرویس یادگیری تقویتی جدید ما
ما در حال ارائه سرویسی برای کمک به مشتریان در تنظیم دقیق Clef متناسب با بارهای کاری آنها با تیم عملی FDE خود هستیم. از این طریق، از تجربههای عملی خود خواهیم آموخت تا یک پلتفرم سلفسرویس بسازیم که مشتریان بتوانند از آن برای ضبط دادهها، تنظیم دقیق و استقرار مجدد مدل، همه روی کلودفلر استفاده کنند.
برای انجام این کار، ما از پریمیتیوهایی که قبلاً روی پلتفرم کلودفلر خود ساختهایم بهره میبریم:
- Cloudflare AI Gateway — عبور تمام ترافیک هوش مصنوعی شما از طریق AI Gateway و ایجاد خودکار مجموعهای از دادههای درخواست برای مورد استفاده شما
- Cloudflare Workers AI — تولید رولاوتها در برابر مدل پایه Clef
- Cloudflare Containers — سندباکس یادگیری تقویتی برای امتیازدهی و بازپخش اقدامات ایجنت
- [جدید] Trainer — بهروزرسانی وزنهای مدل Clef تنظیمشده دقیق
- Cloudflare Workers AI + BYO Model — استقرار مجدد مدل تنظیمشده دقیق روی Workers AI
همین امروز آن را امتحان کنید
ما بسیار هیجانزده هستیم که اولین مدل یادگیری ماشین آموزشدیده کلودفلر را از تیم Workers AI امروز راهاندازی کنیم. ما معتقدیم که Clef توانایی ایجاد تحول در نحوه استفاده ما از ایجنتها را دارد که به طور طبیعی با ماموریت کلودفلر برای تبدیل شدن به ابر ایجنت (the agent cloud) مطابقت دارد.
منبع: blog.cloudflare.com
