شناسایی استفاده بیش از حد از مدل‌های هوش مصنوعی با User Insights

کلودفلر (Cloudflare) به‌روزرسانی جدیدی برای User Insights ارائه داده است که به تیم‌ها کمک می‌کند تا نحوه استفاده از مدل‌های هوش مصنوعی، وظایف و هزینه‌های مرتبط با آن را بهتر درک کنند.

تتیم تحریریه۱۱ دقیقه مطالعه۰ بازدیدهمین حالا
شناسایی استفاده بیش از حد از مدل‌های هوش مصنوعی با User Insights

ماه گذشته که قابلیت User Insights را معرفی کردیم، هدفمان کمک به تیم‌ها برای پاسخ به یک سوال اساسی بود: افراد واقعاً با هوش مصنوعی چه می‌کنند؟ قابلیت User Insights دیدگاه روشن‌تری از نحوه استفاده از هوش مصنوعی به تیم‌ها ارائه می‌دهد و نشان می‌دهد که کدام کاربران، برنامه‌ها، وظایف و مدل‌ها باعث ایجاد ترافیک می‌شوند. این ابزار همچنین ناهنجاری‌های کاربران و ایجنت‌ها را برجسته می‌کند و به تیم‌ها کمک می‌کند تا هزینه‌ها و میزان استفاده غیرمنتظره یا خارج از کنترل را قبل از تبدیل شدن به مشکلات بزرگ‌تر شناسایی کنند.

آخرین به‌روزرسانی ما چیزی را اضافه می‌کند که کاربرانمان درخواست کرده بودند: زمینه (Context).

از زمان راه‌اندازی، از کاربران شنیده‌ایم که نام مدل‌ها و تعداد درخواست‌ها فقط بخشی از ماجرا را روایت می‌کنند. آن‌ها نشان می‌دهند که ترافیک به کجا می‌رود، اما اطلاعات کمی درباره کار پشت آن آشکار می‌کنند: آیا این درخواست یک بررسی کد، یک وظیفه پژوهشی است، یا یک ایجنت که چندین فراخوانی برای تکمیل یک کار انجام می‌دهد؟ تعداد توکن یکسان می‌تواند نشان‌دهنده انواع بسیار متفاوتی از کار باشد و شما نمی‌توانید انتخاب مدل را بدون درک وظیفه ارزیابی کنید.

اکنون User Insights نشان می‌دهد که چه زمانی یک مدل ممکن است تواناتر از حد نیاز یک وظیفه باشد، کدام‌یک از کاربران و ایجنت‌های شما آن استفاده را هدایت می‌کنند، و چگونه وظیفه، مدل، هزینه و الگوهای مکالمه با یکدیگر مرتبط هستند. تیم‌ها می‌توانند از این بینش‌ها برای بررسی و ایجاد تغییرات هدفمند در سازمان خود استفاده کنند. این قابلیت‌ها به صورت رایگان برای کاربران AI Gateway در دسترس است.

چرا درک استفاده از هوش مصنوعی دشوار است؟

تیمی را در نظر بگیرید که ترافیک داخلی هوش مصنوعی خود را از طریق AI Gateway هدایت کرده است. پس از چند هفته، هزینه‌ها در حال افزایش است و برخی درخواست‌ها کُندتر از حد انتظار به نظر می‌رسند، که این یک چالش رایج با پذیرش مقیاس‌پذیر هوش مصنوعی توسط سازمان‌ها است.

می‌تواند چندین توضیح وجود داشته باشد. توسعه‌دهندگان ممکن است از هوش مصنوعی برای کارهای کدنویسی به طور فزاینده‌ای پیچیده استفاده کنند. ایجنت‌ها ممکن است فراخوانی‌های پیگیری بیش از حدی برای تکمیل یک کار انجام دهند. یا گروه کوچکی از کاربران یا ایجنت‌ها ممکن است مسئول سهم نامتناسبی از استفاده سازمان باشند.

توکن‌ها و تعداد درخواست‌ها به تنهایی نمی‌توانند نشان دهند که کدام الگو باعث افزایش می‌شود. تیم‌ها باید بفهمند ترافیک نشان‌دهنده چیست و قبل از تصمیم‌گیری در مورد تغییر مدل، گردش کار یا قانون مسیریابی، آن را درک کنند.

کمک به تیم‌ها برای یافتن جاهایی که مدل‌های هوش مصنوعی بیش از حد توان (Overkill) هستند

نمای «بیش از حد توان مدل» به تیم‌ها کمک می‌کند مکالماتی را شناسایی کنند که در آن‌ها مدل انتخاب‌شده تواناتر از حد نیاز وظیفه به نظر می‌رسد. به عنوان مثال، یک تیم ممکن است متوجه شود که کاربران یا ایجنت‌ها در حال ارسال درخواست‌های ساده قالب‌بندی یا خلاصه‌سازی به یک مدل استدلال با قابلیت بالا هستند.

این به سازمان نقطه شروعی می‌دهد. آن‌ها می‌توانند ببینند کدام کاربران، ایجنت‌ها یا برنامه‌ها با این الگو مرتبط هستند، سپس وظایف پشت آن را بررسی کنند. یک تیم ممکن است متوجه شود که یک مدل به این دلیل استفاده می‌شود که پیش‌فرض است، زیرا کاربران مطمئن نیستند کدام مدل را انتخاب کنند، یا زیرا یک ایجنت برای استفاده از یک مدل برای هر مرحله پیکربندی شده است.

نمای بیش از حد توان یک جدول امتیازات نیست و به طور خودکار یک مدل جایگزین را پیشنهاد نمی‌کند. این به تیم‌ها کمک می‌کند سوالاتبهتری بپرسند:

  • آیا این مدل برای این وظیفه مناسب است؟
  • آیا قابلیت اضافی نتیجه را بهبود می‌بخشد؟
  • آیا یک مدل سریع‌تر یا ارزان‌تر نتیجه‌ای معادل تولید می‌کند؟
  • آیا مسئله به یک گردش کار، کاربر یا ایجنت محدود است؟

از آنجا، تیم‌ها می‌توانند قبل از تصمیم‌گیری در مورد تغییر، هزینه، تاخیر، استفاده از توکن و چرخش‌های مکالمه را مقایسه کنند.

این بینش‌ها هم از نمای جدید «صنوف بالقوه» (Potential Savings) و هم از Auto Router پشتیبانی می‌کنند که در کنار این انتشار به صورت بتای عمومی راه‌اندازی می‌شود. نمای صرفه‌جویی بالقوه به تیم‌ها کمک می‌کند درخواست‌هایی را شناسایی کنند که ممکن است توسط یک مدل سریع‌تر یا ارزان‌تر بدون به خطر انداختن کیفیت خروجی مدیریت شوند. Auto Router این سیگنال‌های وظیفه و تطابق مدل را به طور خودکار اعمال می‌کند و به کاهش هزینه‌ها بدون نیاز به یک قانون مسیریابی جداگانه برای هر بارکاری کمک می‌کند.

نمای بیش از حد توان نقطه‌شروعی برای ارزیابی تطابق مدل است. تیم‌ها می‌توانند تاخیر، توکن‌های ورودی و خروجی، چرخش‌های مکالمه و هزینه کل را برای همان نوع کار مقایسه کنند. یک کار سخت کدنویسی یا پژوهشی ممکن است به یک مدل استدلال توانمند نیاز داشته باشد، در حالی که یک کار خلاصه کوتاه یا دسته‌بندی ساده ممکن است نیازی نداشته باشد. هدف این نیست که هر درخواست به ارزان‌ترین مدل منتقل شود، بلکه این است که بفهمیم آیا مدل انتخاب‌شده برای کار مناسب است یا خیر.

درک اینکه افراد برای چه چیزی از هوش مصنوعی استفاده می‌کنند

تجزیه و تحلیل وظایف، مکالمات را بر اساس نوع کاری که نشان می‌دهند دسته‌بندی می‌کند. دسته‌های اولیه شامل کدنویسی، پژوهش، نگارش، خلاصه‌سازی و تجزیه و تحلیل داده‌ها است.

این زمینه‌ای را فراهم می‌کند که لیستی از نام مدل‌ها نمی‌تواند ارائه دهد. یک تیم مهندسی ممکن است بیشتر از هوش مصنوعی برای کدنویسی و اشکال‌زدایی استفاده کند، در حالی که تیم دیگری ممکن است از آن برای پژوهش و خلاصه‌سازی استفاده کند. یک تیم همچنین ممکن است کشف کند که مقدار شگفت‌انگیزی از ترافیک از وظایف ساده می‌آید، حتی اگر آن وظایف به یک مدل با قابلیت بالا ارسال شوند.

پاسخ‌ها در تیم‌های مختلف متفاوت خواهد بود. داده‌های دسته‌بندی روشی را برای بررسی آن تفاوت‌ها با استفاده از ترافیکی که قبلاً از AI Gateway عبور می‌کند فراهم می‌کند. تیم‌ها می‌توانند تعیین کنند که آیا از یک مدل برای کاری که بهترین تناسب را برای مدیریت آن دارد استفاده می‌شود، یا اینکه یک مدل پیش‌فرض بیش از حد گسترده اعمال می‌شود.

درک هزینه کامل یک کار

برخی از کارها در یک تبادل به پایان می‌رسند. برخی دیگر چند دور سوال، اصلاح و پیگیری نیاز دارند. تجزیه و تحلیل چرخش‌ها نشان می‌دهد که وظایف مختلف چقدر رفت‌وبرگشت نیاز دارند. یک مکالمه طولانی لزوماً چیز بدی نیست، به خصوص برای کارهای پیچیده. اما اگر یک کار ساده 계속 چند دور طول بکشد، ممکن است ارزش بررسی پرامپت، مدل یا گردش کار را داشته باشد.

درخواست اول تنها بخشی از هزینه است. تیم‌ها همچنین باید زمان، توکن‌ها و پول صرف شده قبل از اتمام کار را بررسی کنند. مقایسه این اعداد می‌تواند نشان دهد که یک گردش کار کجا طولانی‌تر یا پر هزینه‌تر از حد انتظار است.

تبدیل بینش‌ها به مسیریابی خودکار

هنگامی که یک تیم الگوی بیش از حد توان را شناسایی کرد و آن را در داده‌های وظیفه، هزینه، تاخیر و چرخش تأیید کرد، می‌تواند آن بینش را به یک تصمیم مسیریابی خودکار تبدیل کند.

به عنوان مثال، نمای وظیفه ممکن است نشان دهد که بیشتر استفاده تیم از هوش مصنوعی خلاصه‌سازی و قالب‌بندی است. نمای مدل می‌تواند نشان دهد که آن درخواست‌ها به یک مدل استدلال بزرگ ارسال می‌شوند، در حالی که نمای چرخش‌ها نشان می‌دهد که بیشتر مکالمات در یک چرخش واحد به پایان می‌رسند. در کنار هم، این سیگنال‌ها به تیم یک بارکاری مشخص برای ارزیابی می‌دهند.

علاوه بر به‌روزرسانی‌های ما در User Insights، قابلیت Auto Router اکنون در بتای بسته در دسترس است. Auto Router از مسیر مکالمه، دسته وظیفه، پیچیدگی وظیفه و سیگنال‌های تطابق مدل استفاده می‌کند تا درخواست‌ها را به طور خودکار به یک مدل مناسب در حالی که هزینه را در نظر می‌گیرد، مسیریابی کند.

به جای ایجاد یک قانون مسیریابی جداگانه برای هر بارکاری، مشتریان در نسخه بتا می‌توانند به Auto Router اجازه دهند از میان مدل‌های موجود برای برنامه خود یکی را انتخاب کند. روتر صرفاً هر درخواست را به ارزان‌ترین مدل ارسال نمی‌کند، بلکه یک مدل مناسب را برای کار در دست انتخاب می‌کند. کار کدنویسی یا پژوهشی پیچیده ممکن است همچنان به یک مدل توانمندتر نیاز داشته باشد، در حالی که کارهای ساده‌تر ممکن است توسط یک گزینه سریع‌تر یا ارزان‌تر مدیریت شوند.

Auto Router از همان سیگنال‌های وظیفه و مکالمه استفاده می‌کند که به User Insights نیرو می‌بخشد. بخش زیر توضیح می‌دهد که چگونه آن سیگنال‌ها تولید می‌شوند.

چگونه User Insights ترافیک را دسته‌بندی می‌کند

هر مکالمه یک سیگنال تجزیه و تحلیل دریافت می‌کند که می‌تواند در User Insights گروه‌بندی شود. این سیگنال برای گزارش‌دهی و تجزیه و تحلیل مسیریابی استفاده می‌شود و قرار نیست جایگزین درخواست اصلی شود یا آن را افشای کند.

موتور دسته‌بندی یک Cloudflare Worker اختصاصی است که لاگ‌های واجد شرایط AI Gateway را پردازش می‌کند. این موتور مسیر مکالمه، از جمله درخواست‌های کاربر، پاسخ‌های دستیار، فراخوانی ابزارها و نتایج ابزار را بررسی می‌کند و نوع کار در حال انجام مانند کدنویسی، اشکال‌زدایی، پژوهش یا خلاصه‌سازی را شناسایی می‌کند. این موتور همچنین یک امتیاز اعتماد برمی‌گرداند و ابعادی مانند پیچیدگی وظیفه، ابهام نیت، ریسک‌ها و وابستگی به زمینه را ارزیابی می‌کند.

Worker دسته‌بندی را برمی‌گرداند که می‌توان آن را با متادیتای لاگ مورد استفاده داشبورد ترکیب کرد. این سیگنال‌ها همچنین می‌توانند برای ارزیابی تطابق مدل با مقایسه میزان مناسب بودن مدل‌های کاندیدا برای وظیفه در برابر هزینه آن‌ها استفاده شوند. پیاده‌سازی فعلی بر روی مجموعه کوچکی از دسته‌ها تمرکز دارد که درک آن‌ها آسان است، به جای اینکه سعی کند تمام جزئیات کار یک کاربر را استنتاج کند.

خط لوله از معماری لاگ موجود AI Gateway پیروی می‌کند. متادیتا جدا از بدنه‌های لاگ ذخیره می‌شود و پیاده‌سازی فعلی از Durable Objects برای متادیتا و R2 برای بدنه‌های لاگ استفاده می‌کند. User Insights دسته‌های مشتق شده و نماهای تجمیعی را آشکار می‌کند. این قابلیت داشبورد را به یک مرورگر پرامپت خام تبدیل نمی‌کند. نگهداری بدنه‌های لاگ زیرین به پیروی از رفتار لاگ‌برداری پیکربندی شده AI Gateway ادامه می‌دهد، بنابراین تیم‌ها باید هنگام تصمیم‌گیری در مورد آنچه از طریق دسته‌بندی‌کننده ارسال می‌شود، آن تنظیمات را بررسی کنند.

دسته‌بندی ناهم‌زمان است، به این معنی که پس از اینکه AI Gateway درخواست را مدیریت کرد، به جای اینکه کاربر منتظر پاسخ باشد، اتفاق می‌افتد. AI Gateway ابتدا لاگ را در مسیر ذخیره‌سازی موجود می‌نویسد و Worker دسته‌بندی بعد از آن پردازش را انجام می‌دهد. این کار دسته‌بندی را خارج از مسیر درخواست نگه می‌دارد و هیچ تأخیری به پاسخ کاربر اضافه نمی‌کند.

معاوضه این است که User Insights یک نمای بلادرنگ نیست. مکالمات تازه دریافت شده ممکن است بلافاصله در داشبورد ظاهر نشوند و تجزیه و تحلیل ممکن است ترافیک ورودی را با تأخیر حدود یک روز به عنوان لاگ‌های پردازش شده و تجمیع شده دنبال کند. تیم‌ها باید از User Insights برای شناسایی الگوهای استفاده در طول زمان به جای نظارت بر فعالیت درخواست زنده استفاده کنند.

اتصال استفاده به کاربران، تیم‌ها و ابزارها

دسته‌های وظیفه زمانی مفیدتر می‌شوند که بتوانند توسط کاربر، تیم یا برنامه مشاهده شوند. AI Gateway دارای آگاهی از هویت (Identity-aware) است و این زمینه را بدون نیاز به ساخت یک خط لوله گزارش‌دهی جداگانه توسط تیم‌ها فراهم می‌کند.

این کار نه تنها برای برنامه‌هایی که تیم‌ها خودشان می‌سازند، بلکه برای ابزارهای توسعه‌دهنده و ابزارهای کمکی ایجنت مانند Claude Code، Codex و OpenCode نیز کار می‌کند. با قرار دادن AI Gateway پشت Cloudflare Access، تیم‌ها می‌توانند کاربران و نشست‌های احراز هویت شده را به ترافیک هوش مصنوعی خود متصل کنند و به User Insights اجازه دهند فعالیت را با شخص و مکالمه مناسب مرتبط کند.

برای برنامه‌های سفارشی، درخواست‌ها باید شامل هر دو شناسه user_id پایدار و session_id برای تجزیه و تحلیل User Insights باشند. پیکربندی دقیق هویت و نام فیلدها به نحوه راه‌اندازی برنامه یا ابزار بستگی دارد. بخش مهم این است که شناسه‌های کاربر و نشست پایدار و غیرحساس ارائه شود تا بتوان استفاده را بدون قرار دادن داده‌های هویت در خود پرامپت گروه‌بندی کرد.

بدنه درخواست شامل مدل و پیام‌های مکالمه است.

با پیکربندی Access در جلوی AI Gateway، ابزارهایی مانند Claude Code، Codex و OpenCode می‌توانند این زمینه هویت را به طور خودکار به ارث ببرند. Cloudflare Access برای تیم‌هایی با حداکثر ۵۰ کاربر به صورت رایگان در دسترس است و این امر را به روشی آسان برای شروع تبدیل می‌کند.

شروع کار با AI Gateway User Insights

استفاده از هوش مصنوعی به سرعت در حال تغییر است. مدل‌ها تغییر می‌کنند، تیم‌ها جریان‌های کاری جدیدی ایجاد می‌کنند، و انتخاب مناسب برای یک گروه ممکن است انتخاب اشتباهی برای گروه دیگر باشد.

User Insights به تیم‌ها اجازه می‌دهد با شناسایی اینکه مدل‌های خاصی کجا ممکن است بیش از حد توان باشند، انتخاب‌های هوشمندانه‌تری داشته باشند. سپس آن‌ها می‌توانند ببینند کدام کاربران و ایجنت‌ها آن استفاده را هدایت می‌کنند، وظایف پشت آن را درک کنند و هزینه تکمیل کار را مقایسه کنند.

با مستندات AI Gateway User Insights اطلاعات بیشتری کسب کنید. AI Gateway را در داشبورد کلودفلر باز کنید و از آنچه می‌آموزید برای تصمیم‌گیری هدفمندتر در مورد مدل و مسیریابی استفاده کنید.


منبع: blog.cloudflare.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.