شرکت گوگل (Google) از مدل صوتی پیشرفته جدیدی رونمایی کرده است که تحولی بزرگ در زمینه تشخیص گفتار و تبدیل صدا به متن ایجاد میکند. این مدل جدید که با نام جمینای 3.5 ترنسکرایب (Gemini 3.5 Transcribe) معرفی شده، قادر است به شکلی بسیار دقیقتر از نسلهای قبلی، صدا را به متن تبدیل کند و از بیش از ۸۵ زبان دنیا به صورت خودکار پشتیبانی نماید.
این مدل هوش مصنوعی توانایی فوقالعادهای در ساختاردهی به صحبتهای نامنظم و پراکنده کاربران دارد. به گفته گوگل (Google)، سیستم جدید میتواند کلمات زائد را حذف کند، دستورات صوتی ویرایشی را اجرا نماید و واژگان سفارشی و املای خاص اصطلاحات را به خوبی یاد بگیرد. همچنین، این مدل در ثبت رشتههای الفبایی-عددی مانند شماره سفارشها و کدهای پستی بسیار دقیق عمل میکند و توانایی تفکیک گفتار تا سه گوینده مختلف را بر اساس مهر زمانی کلمات دارد.
فناوری تشخیص گفتار در دنیای فناوری سابقه طولانی دارد، اما ابزارهای قدیمیتر اغلب در درک لحنهای محاورهای، حذف کلمات اضافی و ساختاردهی به متنهای طولانی دچار مشکل بودند. شرکتهایی مانند اپل و مایکروسافت نیز روی دستیارهای صوتی و ابزارهای رونیسوری کار کردهاند، اما رویکرد جدید گوگل (Google) با تکیه بر مدلهای زبانی بزرگ و قابلیتهای ارکستراسیون، استانداردهای جدیدی را در دقت و سرعت پردازش صوتی تعریف کرده است.
یکی از جذابترین ویژگیهای این فناوری، قابلیت ادغام آن با مرورگر کروم (Chrome) است که به کاربران اجازه میدهد در هر فیلد متنی در وب به تایپ صوتی بپردازند. علاوه بر این، مدل جدید در پلتفرم توسعهدهندگان گوگل، برنامههایی مانند جیمیل، داکس و قابلیتهای لایو جیمینای (Gemini) نیز مورد استفاده قرار میگیرد.
عرضه این مدل تأثیر چشمگیری بر نحوه تعامل کاربران با ابزارهای دیجیتال و افزایش بهرهوری خواهد داشت. با توانایی تبدیل افکار پراکنده صوتی به متون کاملاً سازمانیافتگی، تولید محتوا، پاسخگویی به ایمیلها و مستندسازی بسیار سریعتر از گذشته انجام خواهد شد و توسعهدهندگان نیز میتوانند از طریق رابطهای برنامهنویسی (API) از این قدرت پردازشی بهرهمند شوند.
