از گفتگوهای ما با شرکتها در مراحل مختلف مسیر بهکارگیری هوش مصنوعی، الگوهای مشترکی را مشاهده کردهایم. ابتدا یک دوره اکتشافی وجود دارد که در آن هر ابزار جدیدی را به کار میگیرید، کلیدهای API را آزادانه توزیع میکنید و اجازه میدهید توکنها جریان پیدا کنند. سپس، شما روی ابزارهای اصلی سازمان خود برای کدنویسی عاملی (agentic coding)، جریانهای کاری غیرفنی، و اجرای و استقرار عاملها همگرا میشوید. همانطور که شرکتها پذیرش هوش مصنوعی را رسمی میکنند، آنها میخواهند هزینههای توکن را برای کاربران مدیریت و نظارت کنند، اما بودجهها و قوانین فقط تا حد مشخصی کارایی دارند. بهترین پساندازها آنهایی هستند که کاربران هرگز متوجهشان نمیشوند.
امروز، ما مسیریاب خودکار کلودفلر (Cloudflare) را در قالب نسخه بتای عمومی، از طریق AI Gateway منتشر میکنیم. مدل خود را روی cloudflare/auto تنظیم کنید و مسیریاب خودکار به طور خودکار هر درخواست را به مدلی هدایت میکند که برای آن کار به اندازه کافی توانمند باشد، بدون اینکه کاربر نهایی نیازی به فکر کردن درباره انتخاب مدل داشته باشد. نتایج اولیه ما با استفاده از مسیریاب خودکار به صورت داخلی از طریق مهار OpenCode ما، کاهش هزینهای تا ۳۰ درصد را در مقایسه با استفاده تنها از مدلهای پیشرو مانند OpenAI Sol و Anthropic Claude Opus نشان میدهد.
چرا این قابلیت را ساختیم
از تجربه خودمان در پیگیری هزینههای هوش مصنوعی در کلودفلر (Cloudflare)، آموختهایم که مدیریت هزینهها نیازمند یک رویکرد چندجانبه است. پیش از این، درباره نحوه تعیین بودجهها و محدودیتها پیرامون هزینه هوش مصنوعی و نحوه مشاهده اینکه چه کسی در سراسر سازمان شما با پیوند دادن کارمندان به استفادهشان از هوش مصنوعی هزینه میکند، صحبت کرده بودیم.
در بسیاری از ابزارها از جمله OpenCode، Claude Code و Codex، کاربران فردی همچنان مدلها را به صورت دستی انتخاب میکنند. البته، همه کارها یکسان آفریده نشدهاند و اغلب افراد در نهایت از مدلهایی استفاده میکنند که برای کارشان بیش از حد نیاز (overkill) است. برای مثال، اگر به دنبال خلاصهسازی یک ایمیل یا رشتههای چت هستید، به هوشمندی در سطح Opus نیازی ندارید. با این حال، شما نمیخواهید آن مدل را به طور کامل از تیم مهندسی امنیت خود مسدود کنید.
هدف ما این است که AI Gateway به لایه کنترلی برای سازمانهایی تبدیل شود که هوش مصنوعی را به صورت داخلی مستقر میکنند. از آنجا که هر درخواست از هر کاربر، عامل و ابزاری از قبل از آن عبور میکند، AI Gateway در موقعیت منحصر به فردی قرار دارد تا فراتر از نظارت و اعمال قانون عمل کند. بودجهها، محدودیتهای هزینه، و تحلیلهای آگاه از هویت به سازمانها دیدگاه و محافظهایی میدهند، اما آنها همچنان به افراد متکی هستند تا بر اساس درخواست، انتخابهای آگاه از هزینه داشته باشند. گام بعدی این است که خود دروازه (gateway) تصمیمات هوشمندانهای به نمایندگی از کاربر بگیرد: ارسال هر درخواست به مدلی که برای آن کار به اندازه کافی توانمند باشد. به این ترتیب، سازمانها هزینهها را به طور خودکار کاهش میدهند، در حالی که کاربران در صورت نیاز واقعی کارشان به مدلهای توانمندتر، همچنان به آنها دسترسی دارند.
نتایج
ما از مسیریاب خودکار به صورت داخلی در کلودفلر (Cloudflare) در استقرار OpenCode خود و در Cloudflare OS، مهار عامل سفارشی خود استفاده میکنیم. در استفاده داخلی خود، نتایجی قابل مقایسه با مدلهای پیشرو برای کارهای کدنویسی مشاهده کردهایم.
مسیریاب خودکار زمانی بهترین عملکرد را دارد که در طیف گستردهای از کارهای دانشمحور استفاده شود، مانند کارهایی که معمولاً در یک سازمان بزرگ یافت میشوند و کار آنها شامل تیمهای فنی و غیرفنی است. ما مدل cloudflare/auto را در برابر GPT-6 Sol شرکت OpenAI و Claude Opus 5.5 شرکت Anthropic روی معیار کار دانش عمومی داخلی خود ارزیابی کردیم. این معیار از ابزارهای شبیهسازی شده فضای کار استفاده میکند و جریانهای کاری روزمره رایج در ایمیل، تقویمها، Slack، فایلها، سفر و امور مالی را پوشش میدهد. هر کار نیازمند آن است که مدل از این ابزارها برای تولید یک پاسخ قابل تأیید یا تکمیل یک اقدام استفاده کند.
- مسیریاب خودکار (cloudflare/auto): موفقیت ۸۶.۶٪ با هزینه کل ۲.۱۰ دلار
- کلود اوپوس ۵.۵ (Anthropic Claude Opus 5.5): موفقیت ۹۶.۶٪ با هزینه کل ۵.۹۱ دلار
- جیپیتی-۶ سول (OpenAI GPT-6 Sol): موفقیت ۸۴.۲٪ با هزینه کل ۲.۶۴ دلار
مسیریاب خودکار ما عملکردی مشابه با سایر مدلهای روزمره پیشرو ارائه داد، و با ۸۰٪ هزینه Sol و ۳۵٪ هزینه Opus تمام شد. در حالی که این ممکن است در ابتدا تعجبآور به نظر برسد، یکی از راههای چارچوببندی مشکلی که یک مسیریاب مدل حل میکند، «مرز دندانهدار» (jagged frontier) در میان مدلها است. توانایی حل یک مسئله اغلب جایی در این سبد مدلها وجود دارد؛ کار مسیریاب این است که مدل مناسب را برای هر کار انتخاب کند در حالی که کیفیت و قیمت را متعادل میکند. پساندازها ناشی از عدم پرداخت نرخهای پیشرو برای کارهای غیرپیشرو است، و با میزان انجام آن کار توسط شما رشد میکند.
بینش دیگر این است که قیمتهای پایینتر توکن همیشه به نتایج با هزینه کمتر منجر نمیشود. مدلی که روی کاغذ ارزانتر به نظر میرسد ممکن است در نهایت به طور نامتناسبی از توکنهای بیشتری برای حل یک مسئله استفاده کند. یک مسیریاب باید هزینه پیشبینیشده مسیر را به حداقل برساند، نه اینکه صرفاً بار را بر اساس دلار بر میلیون توکن بالانس کند.
این قابلیت هماکنون مفید است، اما اینتازه آغاز راهی است که مسیریاب خودکار میتواند از جایگاه کلودفلر (Cloudflare) در مسیر استنتاج بیاموزد.
نحوه کارکرد
هنگامی که درخواستی را به cloudflare/auto ارسال میکنید، AI Gateway ابتدا استخری از مدلها را میسازد که واقعاً میتوانند به آن خدمترسانی کنند. این ابزار، مدلهایی را که از فرمت درخواست یا حالت اجرای آن پشتیبانی نمیکنند فیلتر میکند و اعتبارنامهها، پیکربندی صورتحساب، خطمشیهای کنترل دسترسی، و محدودیتهای هزینه متصل به دروازه را در نظر میگیرد. همچنین ارائهدهندگان بالادستی ناسالم یا مدلها را در طول قطعی فیلتر کرده و پس از قطعی به طور خودکار آنها را به استخر بازمیگرداند.
برای نامزدهای باقیمانده، مسیریاب نمای فشردهای از گفتگو را بررسی میکند. این ابزار جدیدترین پیامها را در نظر میگیرد و به جدیدترین چرخشها اولویت میدهد. سپس گفتگو به یک مدل دستهبندی چند سر (multi-head classification) که روی Workers AI در حال اجراست و روی پردازندههای گرافیکی در سراسر شبکه لبه (edge network) ما مستقر شده، ارسال میشود. طبقهبندیکننده دو مجموعه سیگنال تولید میکند. ابتدا، probabilities را در سراسر ۱۴ دسته کار (مانند کدنویسی، برنامهریزی، تحقیق، تحلیل داده) اختصاص میدهد. سپس درخواست را در چهار بعد در مقیاسی از یک تا پنج رتبهبندی میکند: پیچیدگی، ابهام، سهام (stakes)، و وابستگی به زمینه قبلی.
یک ماتریس امتیازدهی جداگانه آن سیگنالها را با نتایج معیارهای مدل ترکیب میکند تا تخمین بزند که هر مدل چقدر با درخواست مطابقت دارد. برای کالیبره کردن ماتریس امتیازدهی، ما مدل ترجیحی را برای مجموعهای از کارهای نمونه و پروفایلهای دشواری تعریف کردیم، سپس وزنها را برای تولید آن انتخابها تنظیم کردیم.
در نهایت، مسیریاب کیفیت مورد انتظار را با قیمت توکنهای ورودی و خروجی هر مدل ترکیب میکند. در درخواستهای سادهتر، قیمت وزن بیشتری دارد، بنابراین یک مدل کوچکتر میتواند زمانی که به اندازه کافی توانمند است برنده شود. با افزایش دشواری، جریمه هزینه کاهش مییابد و مدلهای قویتر فضای بیشتری برای برنده شدن دارند. به زبان ساده، cloudflare/auto مدلی را با بالاترین مطلوبیت انتخاب میکند.
برای جلسات عاملی طولانی مانند رفع اشکال یا کدنویسی، هزینه کمتر توسط قیمت لیست مدل هدایت میشود تا هزینه خواندن کش، که با طول جلسه رشد میکند. جابجایی مدلها کش را دور میاندازد و مدل جدید را مجبور میکند کل زمینه را دوباره بنویسد. این کار میتواند ارزش داشته باشد، زیرا مدلی با قیمتهای ارزانتر خواندن و نوشتن کش میتواند بازنویسی را به سرعت جبران کند.
مسیریاب خودکار به جای اجتناب کامل از جابجایی مدل، هزینه خواندن و نوشتن کش را در نظر میگیرد. در یک چرخش (یک حلقه ورودی کاربر)، کش داغ است و جابجایی به ندرت سودآور است، بنابراین بهتر است به استفاده از همان مدل ادامه دهید. در سراسر چرخشها، مسیریاب خودکار جابجایی اعمال میکند که با تعداد توکنهای موجود در زمینه رشد میکند. مدلی که همچنان کش زنده را برای جلسه حفظ میکند با نرخ ارزانتر خواندن کش قیمتگذاری میشود. هر نامزد دیگری با هزینه کامل بازنویسی زمینه قیمتگذاری میشود، بنابراین هرچه گفتگو عمیقتر باشد، جابجایی باید بیشتر از طریق نتایج باکیفیتتر که از توکنهای کلی کمتری استفاده میکنند یا بازخوانیهای ارزانتر کش، پاداش کسب کند. جابجایی مدل هزینه دیگری دارد: بیشتر مدلها نمیتوانند توکنهای استدلال مدل دیگر را بخوانند، بنابراین جابجایی مدلی که توکنهای استدلال را حذف میکند به این معنی است که مدل جدید ممکن است مجبور شود آن را با قیمتهای خروجی دوباره انجام دهد. در آینده، ما میخواهیم با ترجیح دادن مسیریاب برای ماندن در همان خانواده مدل هنگام جابجایی، این موضوع را محاسبه کنیم.
از آنجا، مسیریاب یک لیست رتبهبندی شده برمیگرداند. AI Gateway ابتدا برنده را امتحان میکند و اگر آن ارائهدهنده نتواند به درخواست خدمترسانی کند، میتواند به مدل واجد شرایط دیگری برود.
این طراحی کلی مزایای متعددی دارد. معماری دو مرحلهای به این معنی است که تصمیمات مسیریابی قابل خواندن هستند زیرا میتوانید دسته پیشبینیشده و پیچیدگی هر کار را بررسی کنید تا ببینید چگونه به انتخاب مدل تبدیل شده است. تنظیم مسیریاب هنگام انتشار یک مدل جدید نیازی به آموزش مجدد ندارد - ما فقط وزنهای مشتق شده از معیار آن را به ماتریس امتیازدهی اضافه میکنیم. همین طبقهبندیکننده همچنین میتواند از پروفایلهای مسیریابی مختلفی پشتیبانی کند. برای مثال، علاوه بر cloudflare/auto، ما قصد داریم مسیریابهای دیگری را در آینده منتشر کنیم، از جمله cloudflare/auto-best، که از همان دستهبندی و استخر مدل استفاده میکند، اما بالاترین کیفیت مورد انتظار را بدون اعمال مبادله هزینه انتخاب میکند.
گامهای بعدی
انتشار امروز ما تنها نقطه شروع است و ما همچنان به سرمایهگذاری در تحقیق و استراتژیهای مسیریابی جدید ادامه میدهیم. در آینده نزدیک، ما میخواهیم:
- گسترش مدلهای ارائهشده از طریق cloudflare/auto
- گنجاندن الزامات عدم نگهداری داده هنگام فیلتر کردن مدلها
- در نظر گرفتن ظرفیت ارائهدهنده هنگام انتخاب مدلها
- انتخاب سطح استدلال یا تفکر مناسب برای هر درخواست
- افزودن پشتیبانی کامل از Responses API و WebSockets
- بررسی مدلهای تصمیمگیری ساختاریافته به عنوان دستهبندیکننده مرحله اول
مسیریاب خودکار در طول دوره بتا رایگان است. اطلاعات بیشتر را در مستندات توسعهدهنده ما بخوانید.
منبع: blog.cloudflare.com
