معرفی مدل‌های تصمیم‌گیری متن‌باز Clef و پلتفرم جدید یادگیری تقویتی کلودفلر

شرکت کلودفلر (Cloudflare) از مدل‌های تصمیم‌گیری جدید خود به نام‌های Clef و Clef-flash رونمایی کرد که خروجی‌های ساختاریافته سریع و دقیقی ارائه می‌دهند.

تتیم تحریریه۸ دقیقه مطالعه۰ بازدیدهمین حالا
معرفی مدل‌های تصمیم‌گیری متن‌باز Clef و پلتفرم جدید یادگیری تقویتی کلودفلر

در طول چند هفته گذشته، سر و صدای زیادی پیرامون مدل‌های تصمیم‌گیری مانند مدل Jev سیستم وان شرکت تایپسِف AI (Typesafe AI’s Jev) به پا شده است. در حالی که مدل‌های دسته‌بندی مدتی است که وجود دارند، Jev یک مفهوم جدید مدل تصمیم‌گیری را به دنیای هوش مصنوعی معرفی می‌کند؛ مدلی که خروجی‌های ساختاریافته محدود را ارزان، سریع و به‌طور مداوم تولید می‌کند و می‌توان زمانی که تصمیمی مورد نیاز است، آن را به یک چرخه کاری اضافه کرد. این مدل‌ها به اندازه کافی توانمند هستند تا روی هر مجموعه ورودی بدون نیاز به بازآموزی مداوم مدل برای گنجاندن دسته‌بندی‌های جدید دسته‌بندی کار کنند. این در تضاد با دنیای مدل‌های زبانی بزرگ (LLMs) است که تا حد زیادی غیرقطعی هستند، اما به اندازه کافی باز هستند تا برای بارهای کاری عاملی (agentic workloads) استدلال کرده، متن تولید کنند و فرازهای ابزاری انجام دهند.

امروز، ما در حال انتشار دو مدل تصمیم‌گیری آموزش‌دیده توسط کلودفلر (Cloudflare) به نام‌های Clef و Clef-flash هستیم که روی ورکرز AI (Workers AI) میزبانی می‌شوند. مدل Clef در حال حاضر رهبر ارزیابی‌شده در برابر شاخص تصمیم‌گیری Jev (Jev Decision Index) است و شما می‌توانید نتایج کامل را در سایت نمایشی بنچمارک زنده مشاهده کنید. این مدل‌ها هوشمندتر، سریع‌تر و کاملاً سازگار با API مدل Jev هستند، بنابراین می‌توانید به راحتی با این مدل‌های میزبانی‌شده آزمایش کنید. ما این مدل‌ها را به طور کامل به صورت متن‌باز تحت مجوز Apache 2.0 در هاگ فیس (Hugging Face) منتشر می‌کنیم تا خودتان آن‌ها را به صورت محلی اجرا کرده و آزمایش کنید.

در نهایت، ما بسیار هیجان‌زده هستیم که محصول جدید یادگیری تقویتی (RL) خود را معرفی کنیم که به مشتریان اجازه می‌دهد Clef را برای موارد استفاده خود نیز تنظیم دقیق (fine-tune) کنند.

مدل تصمیم‌گیری چیست؟

یک مدل تصمیم‌گیری دسته‌بندی‌هایی را انجام می‌دهد تا به ایجنت‌ها کمک کند تصمیم بگیرند چگونه عمل کنند، که این کار بر اساس احتمالات خاصی انجام می‌شود. برای مثال، می‌توانید یک پیام پشتیبانی مشتری (ورودی‌ها) را ارسال کنید و بپرسید آیا فوری است و کدام تیم باید به آن رسیدگی کند. یک مدل تصمیم‌گیری پاسخ‌های تایپ‌شده با احتمالات (خروجی‌ها) را برمی‌گرداند که کد شما می‌تواند از آن‌ها برای هدایت تیکت، راه‌اندازی تشدید یا ارجاع به یک انسان استفاده کند. این بدان معناست که دیگر نیازی نیست انسان لزوماً در حلقه تصمیم‌های عاملی حضور داشته باشد — ایجنت‌ها می‌توانند به صورت برنامه‌نویسی زمینه را جمع‌آوری کنند، تصمیم بگیرند و در مورد وظایف اقدام کنند یا در صورت نیاز به یک انسان ارجاع دهند.

به طور خاص در کلودفلر، ما مدل جدید Clef خود را روی تیم هوش تهدید (Threat Intelligence) خود آزمایش کرده‌ایم تا به ما در دسته‌بندی دنده‌های وب‌سایت کمک کند. با دادن یک دامنه به Clef (با Browser Run)، این مدل می‌تواند به سرعت دسته‌هایی را که دامنه در آن‌ها قرار می‌گیرد شناسایی کند — برای مثال، ممکن است دامنه‌ای را با احتمال ۹۵ درصد به عنوان یک وب‌سایت مد، ۸۵ درصد تجارت الکترونیک، کمتر از ۱ درصد فیشینگ و غیره دسته‌بندی کند. این دسته‌بندی برای مدل Clef ما ۲.۲ ثانیه طول کشید تا وب‌سایت را دریافت، رندر و دسته‌بندی کند. در مقابل، سریع‌ترین مدل زبانی بزرگ عمومی ما یعنی gpt-oss-120b در همان چرخه کاری ۴.۷ ثانیه زمان برد و تنها دو دسته‌بندی را برگرداند. به عنوان یک کاربر، می‌توانید تصور کنید که چگونه کاهش ۲ برابری در تأخیر (latency) و نتایج می‌تواند به ما کمک کند تا چرخه‌های کاری هوش تهدید خود را بهبود بخشیم و در شناسایی دامنه‌های مخرب یا مشروع سریع‌تر عمل کنیم. این را به هر مورد استفاده‌ای که در آن نیاز به تصمیم‌گیری سریع برنامه‌نویسی دارید تعمیم دهید، و چرخه‌های کاری عاملی قدرتمندی را باز می‌کنید که قادر به تصمیم‌گیری، استدلال و اجرای مستقل هستند.

در تئوری موسیقی، کلِف (clef) نمادی است که در ابتدای حامل موسیقی قرار می‌گیرد و نام‌های زیروبمی خاصی را به خطوط و فضاها اختصاص می‌دهد. یک مدل تصمیم‌گیری مشابه یک کلِف موسیقی است زیرا به تعریف دامنه زمینه و نت‌های بعدی (اعمال) که پس از آن می‌آیند کمک می‌کند. ما Clef را به عنوان نام خانواده مدل‌های تصمیم‌گیری خود انتخاب کردیم، زیرا اهداف مشابهی را دنبال می‌کند و حروف CF یادآور کلودفلر است.

Clef چه تفاوتی با سایر مدل‌های تصمیم‌گیری دارد؟

اگرچه بازار به طور فزاینده‌ای با مدل‌های تصمیم‌گیری اشباع می‌شود، Clef دارای ویژگی‌های منحصر به فردی است که باعث می‌شود ما از عرضه آن به عموم هیجان‌زده شویم. اول اینکه، این مدل دارای یک رمزگذار بینایی (vision encoder) است بنابراین می‌تواند تصاویر را دریافت کرده و محتوای بصری را دسته‌بندی کند. این با Jev که امروزه فقط دسته‌بندی متن را انجام می‌دهد متفاوت است. دوم اینکه، مدل ما دارای یک پنجره زمینه 64k است (در مقایسه با 32k مدل Jev)، که به کاربران اجازه می‌دهد وضعیت ورودی بیشتری را برای مدل فراهم کنند تا بر اساس آن دسته‌بندی کند.

سوم، مدل ما دقیق و قدرتمند است و در بنچمارک‌های مختلف کیفیت، به طور رقابتی در برابر سایر مدل‌های تصمیم‌گیری موجود در بازار امتیاز کسب می‌کند. ما برخی از ارزیابی‌های مهم برای تصمیم‌گیری را که توسط شاخص تصمیم‌گیری Jev تعریف شده‌اند، در اینجا آورده‌ایم و برخی از محبوب‌ترین مدل‌های بازار را برای آن امتیازدهی کرده‌ایم.

علاوه بر مزایای تأخیر از خود مدل، مدل‌های Clef ما روی Workers AI میزبانی می‌شوند. از آنجا که آن‌ها روی زیرساخت کلودفلر میزبانی می‌شوند، ما می‌توانیم از پردازنده‌های گرافیکی (GPUs) خود در لبه شبکه (edge) بهره‌بری کنیم که منجر به تأخیر شبکه کمتر و تصمیمات سریع‌تر می‌شود. این بدان معناست که شما می‌توانید Clef را در مسیر اصلی (hot path) برای ایجنت‌ها قرار دهید تا تصمیم‌گیری کنند و آن را با یکی از مدل‌های زبانی بزرگ ما روی Workers AI ترکیب کنید تا اقدام کنید.

Clef همچنین خروجی‌های کاملاً تایپ‌شده مشابه Jev تولید می‌کند و کاملاً سازگار با API است، بنابراین می‌توانید تعویض را بسیار آسان انجام دهید. مدل بزرگ‌تر Clef مدل دقت قدرتمندتر شما است، در حالی که مدل Clef-Flash برای تصمیمات حساس به تأخیر عالی است. این مدل‌ها آماده سازمانی (enterprise-ready) هستند و تضمین می‌کنیم که درخواست‌ها یا پاسخ‌های شما را نمی‌خوانیم، ذخیره نمی‌کنیم یا روی آن‌ها آموزش نمی‌دهیم (مگر اینکه بخواهید از محصول تنظیم دقیق ما استفاده کنید). شما می‌توانید مدل‌های Clef را امروز شروع کنید، از مستندات توسعه‌دهنده ما شروع کنید یا با مدل متن‌باز در مخزن هاگ فیس بازی کنید.

اگر مایل به کمک در تنظیم دقیق Clef برای یک بار کاری خاص هستید، ما همچنین خدمات تنظیم دقیق را ارائه می‌دهیم — ابتدا به عنوان یک شریک عملی با تیم مهندسین مستقر در خط مقدم (FDE) خود، و سپس به عنوان یک پلتفرم تنظیم دقیق سلف‌سرویس برای مشتریان تا مدل را آموزش داده و مجدداً روی کلودفلر مستقر کنند.

نحوه آموزش Clef

در همان هفته‌ای که Jev منتشر شد، ما درباره برخی آزمایش‌هایی که با مدل تصمیم‌گیری بومی خود انجام داده بودیم پستی منتشر کردیم. نسخه نمایشی ما نشان می‌دهد که چگونه مدل DiffusionGemma را تطبیق دادیم تا با افشای logprobs تولید شده توسط یک مدل زبانی بزرگ، احتمالات قطعی را خروجی دهد. رویکرد اولیه ما بر اساس تحقیقات مستقل مات استراچی (Matt Mastracci) ساخته شد که در جامعه یادگیری ماشین فعال بوده است.

Clef بر اساس این مفهوم ساخته شده است، اما از یک مدل پایه متفاوت به عنوان ستون فقرات استفاده می‌کند. ما در حال حاضر از Qwen به عنوان مدل پایه استفاده می‌کنیم و آن را برای موارد استفاده از مدل تصمیم‌گیری پس از آموزش (post-trained) داده‌ایم. در طول استنتاج، Clef از Qwen برای یک پاس فقط پیش‌پر کردن (prefill-only) استفاده می‌کند و سپس انتخاب‌های طرح معتبر را به صورت موازی امتیازدهی می‌کند.

با فریز کردن Qwen3.8-27B برای Clef و Qwen3.5-9B برای Clef-flash، ما به طور مشترک سر مسیریابی را در کنار آداپتورهای رتبه-256 کم‌رتبه (low-rank adapters) بهینه‌سازی کردیم. پس از آموزش ما از آنتروپی متقاطع هموار شده با برچسب برای خروجی‌های طرح معتبر همراه با ضرر بریر (Brier loss) برای اصلاح کالیبراسیون احتمال استفاده می‌کند.

چگونه تنظیم دقیق می‌تواند قابلیت‌های Clef را گسترش دهد

ما موارد استفاده داخلی زیادی را شنیدیم که نیازمند تنظیم دقیق مدل Clef ما برای ساخت در چرخه‌های کاری عاملی خود در کلودفلر بود. به عنوان مثال، تیم‌های داخلی می‌خواهند یک مدل دسته‌بندی‌کننده قادر به ارزیابی ارسال‌های اعتماد و ایمنی (Trust & Safety)، کمک به تریاژ درخواست‌های پشتیبانی کلودفلر، یا حتی ساخت در محصولات ربات ما باشد تا تصمیم بگیرد آیا یک خزنده یک ربات خوب است یا ربات بد.

این موارد استفاده بسیار خاص هستند و ما سال‌ها داده‌های برچسب‌گذاری‌شده داریم که می‌توانیم از آن‌ها برای آموزش یک دسته‌بندی‌کننده خاص استفاده کنیم. از آنجا که کلودفلر بیش از ۱۵ سال داده شبکه در دامنه‌های مختلف دارد، ما می‌توانیم یک مدل را تنظیم دقیق کنیم تا با این موارد استفاده خاص مطابقت داشته باشد که دقیق‌تر و سریع‌تر از مدل عمومی Clef ما است.

سرویس یادگیری تقویتی جدید ما

ما در حال ارائه سرویسی برای کمک به مشتریان در تنظیم دقیق Clef متناسب با بارهای کاری آن‌ها با تیم عملی FDE خود هستیم. از این طریق، از تجربه‌های عملی خود خواهیم آموخت تا یک پلتفرم سلف‌سرویس بسازیم که مشتریان بتوانند از آن برای ضبط داده‌ها، تنظیم دقیق و استقرار مجدد مدل، همه روی کلودفلر استفاده کنند.

برای انجام این کار، ما از پری‌میتیوهایی که قبلاً روی پلتفرم کلودفلر خود ساخته‌ایم بهره می‌بریم:

  • Cloudflare AI Gateway — عبور تمام ترافیک هوش مصنوعی شما از طریق AI Gateway و ایجاد خودکار مجموعه‌ای از داده‌های درخواست برای مورد استفاده شما
  • Cloudflare Workers AI — تولید رول‌اوت‌ها در برابر مدل پایه Clef
  • Cloudflare Containers — سندباکس یادگیری تقویتی برای امتیازدهی و بازپخش اقدامات ایجنت
  • [جدید] Trainer — به‌روزرسانی وزن‌های مدل Clef تنظیم‌شده دقیق
  • Cloudflare Workers AI + BYO Model — استقرار مجدد مدل تنظیم‌شده دقیق روی Workers AI

همین امروز آن را امتحان کنید

ما بسیار هیجان‌زده هستیم که اولین مدل یادگیری ماشین آموزش‌دیده کلودفلر را از تیم Workers AI امروز راه‌اندازی کنیم. ما معتقدیم که Clef توانایی ایجاد تحول در نحوه استفاده ما از ایجنت‌ها را دارد که به طور طبیعی با ماموریت کلودفلر برای تبدیل شدن به ابر ایجنت (the agent cloud) مطابقت دارد.


منبع: blog.cloudflare.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.