谷歌更新 Gemini Audio,新增 Gemini 3.5 Transcribe 等模型。称其可将无结构语音整理为格式化文本,自动识别超过 85 种语言、删除语气词“嗯”“呃”等,并支持用语音指令编辑内容。
该模型可学习自定义词汇,识别订单号等字母数字串,还能为预录音频中的最多 3 名说话者标注词级时间戳。它将接入 Chrome 网页输入框、Search Live、Gemini Live、Docs、Keep 和 Gmail,并提供 API。
Google | The Verge
🌸 在花频道 · 茶馆水群 · 投稿通道
👍 95 😁 33 🥱 7 👎 3 ❤️ 2