2026-08-27 · AI 资讯
Google推出Gemini 3.5 Transcribe,嘈杂环境下的语音识别新标杆

Google正式发布了Gemini系列中语音转文字精度最高的模型——Gemini 3.5 Transcribe。该模型通过创新的技术架构,重点攻克了嘈杂环境、专业术语误读及自然口语冗余等行业痛点。在流式语音转写场景下,其平均词错误率(WER)已降至4.0%,非流式识别精度更达到2.6%。
新模型在功能设计上极具人性化,支持自动格式化、口语填充词(如“嗯”、“啊”)的智能过滤以及自定义词汇表的精准捕捉。此外,得益于Gemini全链路协作的特性,转写生成的文本能直接交由其他模型进行分析或图像生成,从而实现从语音输入到复杂任务执行的完整流转。
目前,Gemini 3.5 Transcribe已在Google AI Studio及相关API平台开放预览,并已集成至macOS平台的Gemini应用及Android系统的Gboard中。Google表示,未来还将把该功能引入Chrome浏览器,让语音输入无处不在。随着其与Waymo自动驾驶出租车等产品的深度接入,Google正在以极高的节奏构建全场景AI生态矩阵。
相关模型(97AI 可直接调用)
