کاهش هزینه‌های هوش مصنوعی با مسیریاب خودکار کلودفلر

شرکت کلودفلر (Cloudflare) مسیریاب خودکار خود را تحت عنوان Auto Router در بخش AI Gateway معرفی کرد تا به سازمان‌ها در کاهش هزینه‌های هوش مصنوعی کمک کند.

تتیم تحریریه۸ دقیقه مطالعه۰ بازدیدهمین حالا
کاهش هزینه‌های هوش مصنوعی با مسیریاب خودکار کلودفلر

از گفتگوهای ما با شرکت‌ها در مراحل مختلف مسیر به‌کارگیری هوش مصنوعی، الگوهای مشترکی را مشاهده کرده‌ایم. ابتدا یک دوره اکتشافی وجود دارد که در آن هر ابزار جدیدی را به کار می‌گیرید، کلیدهای API را آزادانه توزیع می‌کنید و اجازه می‌دهید توکن‌ها جریان پیدا کنند. سپس، شما روی ابزارهای اصلی سازمان خود برای کدنویسی عاملی (agentic coding)، جریان‌های کاری غیرفنی، و اجرای و استقرار عامل‌ها همگرا می‌شوید. همانطور که شرکت‌ها پذیرش هوش مصنوعی را رسمی می‌کنند، آن‌ها می‌خواهند هزینه‌های توکن را برای کاربران مدیریت و نظارت کنند، اما بودجه‌ها و قوانین فقط تا حد مشخصی کارایی دارند. بهترین پس‌اندازها آنهایی هستند که کاربران هرگز متوجه‌شان نمی‌شوند.

امروز، ما مسیریاب خودکار کلودفلر (Cloudflare) را در قالب نسخه بتای عمومی، از طریق AI Gateway منتشر می‌کنیم. مدل خود را روی cloudflare/auto تنظیم کنید و مسیریاب خودکار به طور خودکار هر درخواست را به مدلی هدایت می‌کند که برای آن کار به اندازه کافی توانمند باشد، بدون اینکه کاربر نهایی نیازی به فکر کردن درباره انتخاب مدل داشته باشد. نتایج اولیه ما با استفاده از مسیریاب خودکار به صورت داخلی از طریق مهار OpenCode ما، کاهش هزینه‌ای تا ۳۰ درصد را در مقایسه با استفاده تنها از مدل‌های پیشرو مانند OpenAI Sol و Anthropic Claude Opus نشان می‌دهد.

چرا این قابلیت را ساختیم

از تجربه خودمان در پیگیری هزینه‌های هوش مصنوعی در کلودفلر (Cloudflare)، آموخته‌ایم که مدیریت هزینه‌ها نیازمند یک رویکرد چندجانبه است. پیش از این، درباره نحوه تعیین بودجه‌ها و محدودیت‌ها پیرامون هزینه هوش مصنوعی و نحوه مشاهده اینکه چه کسی در سراسر سازمان شما با پیوند دادن کارمندان به استفاده‌شان از هوش مصنوعی هزینه می‌کند، صحبت کرده بودیم.

در بسیاری از ابزارها از جمله OpenCode، Claude Code و Codex، کاربران فردی همچنان مدل‌ها را به صورت دستی انتخاب می‌کنند. البته، همه کارها یکسان آفریده نشده‌اند و اغلب افراد در نهایت از مدل‌هایی استفاده می‌کنند که برای کارشان بیش از حد نیاز (overkill) است. برای مثال، اگر به دنبال خلاصه‌سازی یک ایمیل یا رشته‌های چت هستید، به هوشمندی در سطح Opus نیازی ندارید. با این حال، شما نمی‌خواهید آن مدل را به طور کامل از تیم مهندسی امنیت خود مسدود کنید.

هدف ما این است که AI Gateway به لایه کنترلی برای سازمان‌هایی تبدیل شود که هوش مصنوعی را به صورت داخلی مستقر می‌کنند. از آنجا که هر درخواست از هر کاربر، عامل و ابزاری از قبل از آن عبور می‌کند، AI Gateway در موقعیت منحصر به فردی قرار دارد تا فراتر از نظارت و اعمال قانون عمل کند. بودجه‌ها، محدودیت‌های هزینه، و تحلیل‌های آگاه از هویت به سازمان‌ها دیدگاه و محافظ‌هایی می‌دهند، اما آن‌ها همچنان به افراد متکی هستند تا بر اساس درخواست، انتخاب‌های آگاه از هزینه داشته باشند. گام بعدی این است که خود دروازه (gateway) تصمیمات هوشمندانه‌ای به نمایندگی از کاربر بگیرد: ارسال هر درخواست به مدلی که برای آن کار به اندازه کافی توانمند باشد. به این ترتیب، سازمان‌ها هزینه‌ها را به طور خودکار کاهش می‌دهند، در حالی که کاربران در صورت نیاز واقعی کارشان به مدل‌های توانمندتر، همچنان به آن‌ها دسترسی دارند.

نتایج

ما از مسیریاب خودکار به صورت داخلی در کلودفلر (Cloudflare) در استقرار OpenCode خود و در Cloudflare OS، مهار عامل سفارشی خود استفاده می‌کنیم. در استفاده داخلی خود، نتایجی قابل مقایسه با مدل‌های پیشرو برای کارهای کدنویسی مشاهده کرده‌ایم.

مسیریاب خودکار زمانی بهترین عملکرد را دارد که در طیف گسترده‌ای از کارهای دانش‌محور استفاده شود، مانند کارهایی که معمولاً در یک سازمان بزرگ یافت می‌شوند و کار آن‌ها شامل تیم‌های فنی و غیرفنی است. ما مدل cloudflare/auto را در برابر GPT-6 Sol شرکت OpenAI و Claude Opus 5.5 شرکت Anthropic روی معیار کار دانش عمومی داخلی خود ارزیابی کردیم. این معیار از ابزارهای شبیه‌سازی شده فضای کار استفاده می‌کند و جریان‌های کاری روزمره رایج در ایمیل، تقویم‌ها، Slack، فایل‌ها، سفر و امور مالی را پوشش می‌دهد. هر کار نیازمند آن است که مدل از این ابزارها برای تولید یک پاسخ قابل تأیید یا تکمیل یک اقدام استفاده کند.

  • مسیریاب خودکار (cloudflare/auto): موفقیت ۸۶.۶٪ با هزینه کل ۲.۱۰ دلار
  • کلود اوپوس ۵.۵ (Anthropic Claude Opus 5.5): موفقیت ۹۶.۶٪ با هزینه کل ۵.۹۱ دلار
  • جی‌پی‌تی-۶ سول (OpenAI GPT-6 Sol): موفقیت ۸۴.۲٪ با هزینه کل ۲.۶۴ دلار

مسیریاب خودکار ما عملکردی مشابه با سایر مدل‌های روزمره پیشرو ارائه داد، و با ۸۰٪ هزینه Sol و ۳۵٪ هزینه Opus تمام شد. در حالی که این ممکن است در ابتدا تعجب‌آور به نظر برسد، یکی از راه‌های چارچوب‌بندی مشکلی که یک مسیریاب مدل حل می‌کند، «مرز دندانه‌دار» (jagged frontier) در میان مدل‌ها است. توانایی حل یک مسئله اغلب جایی در این سبد مدل‌ها وجود دارد؛ کار مسیریاب این است که مدل مناسب را برای هر کار انتخاب کند در حالی که کیفیت و قیمت را متعادل می‌کند. پس‌اندازها ناشی از عدم پرداخت نرخ‌های پیشرو برای کارهای غیرپیشرو است، و با میزان انجام آن کار توسط شما رشد می‌کند.

بینش دیگر این است که قیمت‌های پایین‌تر توکن همیشه به نتایج با هزینه کمتر منجر نمی‌شود. مدلی که روی کاغذ ارزان‌تر به نظر می‌رسد ممکن است در نهایت به طور نامتناسبی از توکن‌های بیشتری برای حل یک مسئله استفاده کند. یک مسیریاب باید هزینه پیش‌بینی‌شده مسیر را به حداقل برساند، نه اینکه صرفاً بار را بر اساس دلار بر میلیون توکن بالانس کند.

این قابلیت هم‌اکنون مفید است، اما اینتازه آغاز راهی است که مسیریاب خودکار می‌تواند از جایگاه کلودفلر (Cloudflare) در مسیر استنتاج بیاموزد.

نحوه کارکرد

هنگامی که درخواستی را به cloudflare/auto ارسال می‌کنید، AI Gateway ابتدا استخری از مدل‌ها را می‌سازد که واقعاً می‌توانند به آن خدمت‌رسانی کنند. این ابزار، مدل‌هایی را که از فرمت درخواست یا حالت اجرای آن پشتیبانی نمی‌کنند فیلتر می‌کند و اعتبارنامه‌ها، پیکربندی صورت‌حساب، خط‌مشی‌های کنترل دسترسی، و محدودیت‌های هزینه متصل به دروازه را در نظر می‌گیرد. همچنین ارائه‌دهندگان بالادستی ناسالم یا مدل‌ها را در طول قطعی فیلتر کرده و پس از قطعی به طور خودکار آن‌ها را به استخر بازمی‌گرداند.

برای نامزدهای باقی‌مانده، مسیریاب نمای فشرده‌ای از گفتگو را بررسی می‌کند. این ابزار جدیدترین پیام‌ها را در نظر می‌گیرد و به جدیدترین چرخش‌ها اولویت می‌دهد. سپس گفتگو به یک مدل دسته‌بندی چند سر (multi-head classification) که روی Workers AI در حال اجراست و روی پردازنده‌های گرافیکی در سراسر شبکه لبه (edge network) ما مستقر شده، ارسال می‌شود. طبقه‌بندی‌کننده دو مجموعه سیگنال تولید می‌کند. ابتدا، probabilities را در سراسر ۱۴ دسته کار (مانند کدنویسی، برنامه‌ریزی، تحقیق، تحلیل داده) اختصاص می‌دهد. سپس درخواست را در چهار بعد در مقیاسی از یک تا پنج رتبه‌بندی می‌کند: پیچیدگی، ابهام، سهام (stakes)، و وابستگی به زمینه قبلی.

یک ماتریس امتیازدهی جداگانه آن سیگنال‌ها را با نتایج معیارهای مدل ترکیب می‌کند تا تخمین بزند که هر مدل چقدر با درخواست مطابقت دارد. برای کالیبره کردن ماتریس امتیازدهی، ما مدل ترجیحی را برای مجموعه‌ای از کارهای نمونه و پروفایل‌های دشواری تعریف کردیم، سپس وزن‌ها را برای تولید آن انتخاب‌ها تنظیم کردیم.

در نهایت، مسیریاب کیفیت مورد انتظار را با قیمت توکن‌های ورودی و خروجی هر مدل ترکیب می‌کند. در درخواست‌های ساده‌تر، قیمت وزن بیشتری دارد، بنابراین یک مدل کوچک‌تر می‌تواند زمانی که به اندازه کافی توانمند است برنده شود. با افزایش دشواری، جریمه هزینه کاهش می‌یابد و مدل‌های قوی‌تر فضای بیشتری برای برنده شدن دارند. به زبان ساده، cloudflare/auto مدلی را با بالاترین مطلوبیت انتخاب می‌کند.

برای جلسات عاملی طولانی مانند رفع اشکال یا کدنویسی، هزینه کمتر توسط قیمت لیست مدل هدایت می‌شود تا هزینه خواندن کش، که با طول جلسه رشد می‌کند. جابجایی مدل‌ها کش را دور می‌اندازد و مدل جدید را مجبور می‌کند کل زمینه را دوباره بنویسد. این کار می‌تواند ارزش داشته باشد، زیرا مدلی با قیمت‌های ارزان‌تر خواندن و نوشتن کش می‌تواند بازنویسی را به سرعت جبران کند.

مسیریاب خودکار به جای اجتناب کامل از جابجایی مدل، هزینه خواندن و نوشتن کش را در نظر می‌گیرد. در یک چرخش (یک حلقه ورودی کاربر)، کش داغ است و جابجایی به ندرت سودآور است، بنابراین بهتر است به استفاده از همان مدل ادامه دهید. در سراسر چرخش‌ها، مسیریاب خودکار جابجایی اعمال می‌کند که با تعداد توکن‌های موجود در زمینه رشد می‌کند. مدلی که همچنان کش زنده را برای جلسه حفظ می‌کند با نرخ ارزان‌تر خواندن کش قیمت‌گذاری می‌شود. هر نامزد دیگری با هزینه کامل بازنویسی زمینه قیمت‌گذاری می‌شود، بنابراین هرچه گفتگو عمیق‌تر باشد، جابجایی باید بیشتر از طریق نتایج باکیفیت‌تر که از توکن‌های کلی کمتری استفاده می‌کنند یا بازخوانی‌های ارزان‌تر کش، پاداش کسب کند. جابجایی مدل هزینه دیگری دارد: بیشتر مدل‌ها نمی‌توانند توکن‌های استدلال مدل دیگر را بخوانند، بنابراین جابجایی مدلی که توکن‌های استدلال را حذف می‌کند به این معنی است که مدل جدید ممکن است مجبور شود آن را با قیمت‌های خروجی دوباره انجام دهد. در آینده، ما می‌خواهیم با ترجیح دادن مسیریاب برای ماندن در همان خانواده مدل هنگام جابجایی، این موضوع را محاسبه کنیم.

از آنجا، مسیریاب یک لیست رتبه‌بندی شده برمی‌گرداند. AI Gateway ابتدا برنده را امتحان می‌کند و اگر آن ارائه‌دهنده نتواند به درخواست خدمت‌رسانی کند، می‌تواند به مدل واجد شرایط دیگری برود.

این طراحی کلی مزایای متعددی دارد. معماری دو مرحله‌ای به این معنی است که تصمیمات مسیریابی قابل خواندن هستند زیرا می‌توانید دسته پیش‌بینی‌شده و پیچیدگی هر کار را بررسی کنید تا ببینید چگونه به انتخاب مدل تبدیل شده است. تنظیم مسیریاب هنگام انتشار یک مدل جدید نیازی به آموزش مجدد ندارد - ما فقط وزن‌های مشتق شده از معیار آن را به ماتریس امتیازدهی اضافه می‌کنیم. همین طبقه‌بندی‌کننده همچنین می‌تواند از پروفایل‌های مسیریابی مختلفی پشتیبانی کند. برای مثال، علاوه بر cloudflare/auto، ما قصد داریم مسیریاب‌های دیگری را در آینده منتشر کنیم، از جمله cloudflare/auto-best، که از همان دسته‌بندی و استخر مدل استفاده می‌کند، اما بالاترین کیفیت مورد انتظار را بدون اعمال مبادله هزینه انتخاب می‌کند.

گام‌های بعدی

انتشار امروز ما تنها نقطه شروع است و ما همچنان به سرمایه‌گذاری در تحقیق و استراتژی‌های مسیریابی جدید ادامه می‌دهیم. در آینده نزدیک، ما می‌خواهیم:

  • گسترش مدل‌های ارائه‌شده از طریق cloudflare/auto
  • گنجاندن الزامات عدم نگهداری داده هنگام فیلتر کردن مدل‌ها
  • در نظر گرفتن ظرفیت ارائه‌دهنده هنگام انتخاب مدل‌ها
  • انتخاب سطح استدلال یا تفکر مناسب برای هر درخواست
  • افزودن پشتیبانی کامل از Responses API و WebSockets
  • بررسی مدل‌های تصمیم‌گیری ساختاریافته به عنوان دسته‌بندی‌کننده مرحله اول

مسیریاب خودکار در طول دوره بتا رایگان است. اطلاعات بیشتر را در مستندات توسعه‌دهنده ما بخوانید.


منبع: blog.cloudflare.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.