شرکت گوگل (Google) بهتازگی قابلیت جدیدی را به سرویس صوتی جمنای (Gemini Audio) اضافه کرده است که به کاربران اجازه میدهد فایلهای صوتی خود را با دقتی بینظیر به متن تبدیل کنند. این ابزار جدید که با نام جمنای ۳.۵ ترنسکرایب (Gemini 3.5 Transcribe) شناخته میشود، بهطور خودکار کلمات پرکاربرد و اضافی نظیر «اهم» و «ام» را از متن نهایی حذف میکند تا خروجی بسیار تمیزتر و خواناتر باشد.
این مدل پیشرفته همچنین توانایی تشخیص اصطلاحات تخصصی و فنی را دارد و از بیش از ۸۵ زبان زنده دنیا پشتیبانی میکند. به گفته گوگل (Google)، این سیستم یک گام بزرگ رو به جلو نسبت به مدل قبلی یعنی چیپ ۳ (Chirp 3) محسوب میشود و نرخ خطای واژگانی را به شدت کاهش داده است. کاربران همچنین میتوانند به صورت طبیعی و تنها با استفاده از صدای خود، ویرایشهای لازم را روی متن پیادهسازی کنند.
معرفی این قابلیت در ادامه توسعه محصولات هوش مصنوعی این شرکت صورت میگیرد که پیش از این شاهد عرضه قابلیت ترجمه زنده جمنای ۳.۵ لایو (Gemini 3.5 Live Translate) بودهایم. با این حال، این رونمایی در حالی انجام میشود که کاربران همچنان منتظر انتشار مدل اصلی جمنای ۳.۵ پرو (Gemini 3.5 Pro) هستند که وعده عرضه آن داده شده بود اما با تاخیر مواجه شده است.
رقابت در بازار ابزارهای تبدیل گفتار به متن و هوش مصنوعی مولد بسیار داغ است و شرکتهایی مانند اپل (Apple)، مایکروسافت (Microsoft) و اوپنایآی (OpenAI) نیز محصولات مشابهی را عرضه کردهاند. قابلیت جدید گوگل (Google) با تمرکز بر دقت بالا، حذف نویزهای گفتاری و پشتیبانی گسترده از زبانها، میتواند استانداردهای جدیدی را در صنعت ضبط و مستندسازی جلسات و پادکستها ایجاد کند.
تأثیر این فناوری بر بازار تولید محتوا، خبرنگاری و ابزارهای بهرهوری بسیار چشمگیر خواهد بود. کاهش زمان ویرایش متنهای پیادهشده به کاربران اجازه میدهد روی تحلیل و پردازش اطلاعات تمرکز کنند و آینده روشنتری را برای تعامل صوتی انسان و ماشین رقم بزند.
