Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为 Gemini Enterprise 提供具备动态视觉化身的交互体验。
推荐理由:原文详细说明了实时视觉化身在异步工具调用和多语言同步上的技术实现,为企业构建具备连续在场感的智能体提供了具体参考。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力结合,为 Gemini Enterprise 提供具备动态视觉化身的交互体验。
推荐理由:原文详细说明了实时视觉化身在异步工具调用和多语言同步上的技术实现,为企业构建具备连续在场感的智能体提供了具体参考。
Simon Willison 发布了 Gemini 3.8 TTS Playground,这是一个用于测试 Google 新推出的 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts 模型的交互式界面。
推荐理由:作者基于新发布的 Gemini 3.8 TTS API 构建了可交互的测试工具,展示了多角色对话合成及自定义声音的具体用法。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持从自然语言提示生成自定义角色声音并逐行指导场景对话。
推荐理由:原文给出了两款新 TTS 模型的详细能力边界、基准排名及开放入口,读者可据此评估其在创意配音与规模化部署中的实际可用性。
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款新模型,旨在提升近实时推理能力以支持更复杂的语音交互任务。
推荐理由:原文披露了 Gemini 3.8 Live 系列在实时推理、多语言切换及后台工具调用上的具体能力升级与基准表现,为构建生产级语音智能体提供了明确的技术参考。
OpenAI 在 API 中推出 GPT-Live-1,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信功能。
推荐理由:原文说明了GPT-Live-1在API中支持全双工对话、自定义声音和电话功能,开发者可据此评估其在实时语音交互场景中的适用性。
Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中流式和非流式平均词错率分别为 4.0% 和 2.6%,支持超过 85 种语言及最多三个说话人的身份识别。
推荐理由:原文给出了新模型的流式与非流式词错率数据、多语言支持范围以及开发者 API 接入方式,读者可以据此评估其在实时交互场景中的实际表现。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。
推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。
Google DeepMind 推出最新文本转语音模型 Gemini 3.1 Flash TTS,支持通过嵌入自然语言命令的音频标签来精确控制声音风格、语速和表达方式。该模型在 Artificial Analysis TTS 排行榜上获得 1,211 的 Elo 分数,原生支持多说话人对话及 70 多种语言,所有生成音频均带有 SynthID 水印。
推荐理由:新模型引入自然语言音频标签以精细控制语速和风格,并在 Artificial Analysis 基准中取得高分。