معرفی مدل تشخیص گفتار کوککتل‌ای‌اس‌آر-۱ شیائومی

شرکت شیائومی مدل تشخیص گفتار جدیدی به نام CocktailASR-1 را منتشر کرده که به‌طور ویژه برای محیط‌های شلوغ و پر از صداهای همزمان طراحی شده است.

تتیم تحریریه۲ دقیقه مطالعه۰ بازدید۸ روز پیش
معرفی مدل تشخیص گفتار کوککتل‌ای‌اس‌آر-۱ شیائومی

شرکت شیائومی (Xiaomi) مدل CocktailASR-1 را که یک مدل تشخیص گفتار طراحی‌شده برای حل یکی از مشکلات دشوار در رونویسی صوتی است، منتشر و متن‌باز (Open-source) کرد: جدا کردن صدای یک فرد زمانی که چندین نفر همزمان در حال صحبت کردن هستند.

شرکت شیائومی (Xiaomi) این موضوع را «مسئله مهمانی کوکتل» می‌نامد. بیشتر مدل‌های تشخیص گفتار زمانی که تنها یک نفر صحبت می‌کند به خوبی کار می‌کنند، اما زمانی که چندین صدا با یکدیگر همپوشانی دارند، کار بسیار دشوارتر می‌شود. این وضعیت می‌تواند منجر به متن‌های مخدوش، جملات ادغام‌شده یا اختصاص یافتن بخش‌هایی از مکالمه به گوینده اشتباه شود.

این چالش مشابه مشکلی است که شرکت شیائومی (Xiaomi) با مدل تبدیل متن به گفتار OmniVoice به آن پرداخته بود، البته مدل CocktailASR-1 با جداسازی و رونویسی گفتار به جای تولید آن، در جهت مخالف عمل می‌کند.

نحوه عملکرد CocktailASR-1 شیائومی

برای استفاده از مدل CocktailASR-1، ابتدا باید یک کلیپ صوتی کوتاه از فردی که می‌خواهید ردیابی کنید ارائه دهید. این مدل از آن کلیپ به عنوان یک مرجع صوتی استفاده می‌کند و سپس در یک ضبط با چندین گوینده جستجو می‌کند تا فقط صحبت‌های آن شخص را شناسایی و رونویسی کند.

شرکت شیائومی (Xiaomi) مدل CocktailASR-1 را بر اساس یک معماری مدل زبانی بزرگ (LLM) سرتاسر (End-to-end) ساخته است. این شرکت اعلام کرده که به نتایج پیشرفته‌ای در چندین بنچمارک تشخیص گفتار چندگوینده دست یافته و از رویکردهای موجود برای همان وظیفه پیشی گرفته است.

این مدل همچنین به مکالمات گروهی شلوغ محدود نمی‌شود. شرکت شیائومی (Xiaomi) می‌گوید با تنها یک گوینده، مدل CocktailASR-1 در سطحی مشابه با مدل‌های استاندارد تشخیص گفتار خودکار (ASR) عمل می‌کند. این بدان معناست که کاربران مجبور نیستند برای به دست آوردن نتایج بهتر در صدای شلوغ، عملکرد تک‌گوینده را فدا کنند.

این مدل همچنین از حدس زدن‌های غیرضروری جلوگیری می‌کند. اگر گوینده انتخاب‌شده در یک ضبط ظاهر نشود، مدل به جای تلاش برای رونویسی صدای فرد دیگر، متن خالی برمی‌گرداند.

مدل CocktailASR-1 همچنین شامل یک حالت استدلال زنجیره‌فکری است که به کاربران اجازه می‌دهد به جای دیدن تنها متن نهایی، استدلال مرتبط با یک رونویسی را بررسی کنند.

مدل CocktailASR-1 جدیدترین مورد در فهرست رو به رشدی از مدل‌های هوش مصنوعی است که شرکت شیائومی (Xiaomi) آن‌ها را متن‌باز کرده است. این مدل پس از انتشار مواردی مانند MiMo-V2-Flash و Xiaomi Robotics-0 عرضه می‌شود. این مدل اکنون روی پلتفرم‌های گیت‌هاب (GitHub) و هاگینگ فیس (Hugging Face) برای توسعه‌دهندگان جهت آزمایش و کاوش در دسترس است.


منبع: gizmochina.com

نظرات۰

برای نوشتن نظر، وارد حساب خود شوید.

ورود / ثبت‌نام

هنوز نظری ثبت نشده — اولین نفری باش که نظر می‌دهد.