شرکت شیائومی (Xiaomi) مدل CocktailASR-1 را که یک مدل تشخیص گفتار طراحیشده برای حل یکی از مشکلات دشوار در رونویسی صوتی است، منتشر و متنباز (Open-source) کرد: جدا کردن صدای یک فرد زمانی که چندین نفر همزمان در حال صحبت کردن هستند.
شرکت شیائومی (Xiaomi) این موضوع را «مسئله مهمانی کوکتل» مینامد. بیشتر مدلهای تشخیص گفتار زمانی که تنها یک نفر صحبت میکند به خوبی کار میکنند، اما زمانی که چندین صدا با یکدیگر همپوشانی دارند، کار بسیار دشوارتر میشود. این وضعیت میتواند منجر به متنهای مخدوش، جملات ادغامشده یا اختصاص یافتن بخشهایی از مکالمه به گوینده اشتباه شود.
این چالش مشابه مشکلی است که شرکت شیائومی (Xiaomi) با مدل تبدیل متن به گفتار OmniVoice به آن پرداخته بود، البته مدل CocktailASR-1 با جداسازی و رونویسی گفتار به جای تولید آن، در جهت مخالف عمل میکند.
نحوه عملکرد CocktailASR-1 شیائومی
برای استفاده از مدل CocktailASR-1، ابتدا باید یک کلیپ صوتی کوتاه از فردی که میخواهید ردیابی کنید ارائه دهید. این مدل از آن کلیپ به عنوان یک مرجع صوتی استفاده میکند و سپس در یک ضبط با چندین گوینده جستجو میکند تا فقط صحبتهای آن شخص را شناسایی و رونویسی کند.
شرکت شیائومی (Xiaomi) مدل CocktailASR-1 را بر اساس یک معماری مدل زبانی بزرگ (LLM) سرتاسر (End-to-end) ساخته است. این شرکت اعلام کرده که به نتایج پیشرفتهای در چندین بنچمارک تشخیص گفتار چندگوینده دست یافته و از رویکردهای موجود برای همان وظیفه پیشی گرفته است.
این مدل همچنین به مکالمات گروهی شلوغ محدود نمیشود. شرکت شیائومی (Xiaomi) میگوید با تنها یک گوینده، مدل CocktailASR-1 در سطحی مشابه با مدلهای استاندارد تشخیص گفتار خودکار (ASR) عمل میکند. این بدان معناست که کاربران مجبور نیستند برای به دست آوردن نتایج بهتر در صدای شلوغ، عملکرد تکگوینده را فدا کنند.
این مدل همچنین از حدس زدنهای غیرضروری جلوگیری میکند. اگر گوینده انتخابشده در یک ضبط ظاهر نشود، مدل به جای تلاش برای رونویسی صدای فرد دیگر، متن خالی برمیگرداند.
مدل CocktailASR-1 همچنین شامل یک حالت استدلال زنجیرهفکری است که به کاربران اجازه میدهد به جای دیدن تنها متن نهایی، استدلال مرتبط با یک رونویسی را بررسی کنند.
مدل CocktailASR-1 جدیدترین مورد در فهرست رو به رشدی از مدلهای هوش مصنوعی است که شرکت شیائومی (Xiaomi) آنها را متنباز کرده است. این مدل پس از انتشار مواردی مانند MiMo-V2-Flash و Xiaomi Robotics-0 عرضه میشود. این مدل اکنون روی پلتفرمهای گیتهاب (GitHub) و هاگینگ فیس (Hugging Face) برای توسعهدهندگان جهت آزمایش و کاوش در دسترس است.
منبع: gizmochina.com
