塔斯娱乐资讯网

谷歌发布全新的语音识别模型 Gemini 3.5 Transcribe 语音识别

谷歌发布全新的语音识别模型 Gemini 3.5 Transcribe
语音识别的尽头,是意图重构。
这个模型在非流式处理下的词错率(WER)仅2.6%。不过,这只是技术参数的表象,这次发布背后真正的概念跃迁:语音转文字(STT)的底层逻辑,已经从“复刻声音”变成了“重构意图”。
以前的工具是纯粹的物理记录,你嘴瓢说一句“周二开会,不对,还是周三吧,呃,下午三点”,它就一字不落地打出来。但 Gemini 3.5 Transcribe 的核心功能是“智能转录”,换句话说,它自带了一个隐形的文字编辑。它能自动剔除语气词,识别你的自我纠正,最后直接输出格式整齐的“周三下午三点开会”。从功能特征到用户价值,这意味着机器不再仅仅充当打字员,而是变成了懂逻辑的速记秘书。
这有点类似于之前流行的语音输入法 Typeless 的能力,现在谷歌把那些工程化的做法直接内置到了模型里。
在多语言夹杂和三人以上的会议说话人分离场景下,现有的 AI 依然会吃力。但谷歌这次把模型直接塞进了安卓键盘和 macOS 的原生应用里。
当这种级别的意图提取能力成为系统级标配,那些还在靠“语音转文字”单点功能收订阅费的套壳创业公司,生存空间已经被彻底锁死。
当 AI 能够完美过滤掉你表达中的结巴、废话和语病,把你最粗糙的碎碎念转化为逻辑严密的精排文本时,你语言的包装外壳就彻底失效了。
未来,决定你表达价值的,不再是你的口才和发音标准程度,而是你脑子里到底有没有真正硬核的见识。
Gemini3.5