跳到正文

#Google

今日 0 条
4月21日周二
4月16日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 推出最新文本转语音模型 Gemini 3.1 Flash TTS,支持通过嵌入自然语言命令的音频标签来精确控制声音风格、语速和表达方式。该模型在 Artificial Analysis TTS 排行榜上获得 1,211 的 Elo 分数,原生支持多说话人对话及 70 多种语言,所有生成音频均带有 SynthID 水印。

    推荐理由:新模型引入自然语言音频标签以精细控制语速和风格,并在 Artificial Analysis 基准中取得高分。

4月13日周一
  1. Google DeepMind75

    Google DeepMind 发布 Gemini Robotics-ER 1.6 增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是一款专为机器人设计的高层推理模型,显著提升了空间推理、多视角理解和成功检测能力。该模型新增了仪表读取功能,能结合视觉推理与代码执行精确解读压力表等工业仪器,并已通过 Gemini API 和 Google AI Studio 向开发者开放。

    推荐理由:新模型强化了空间推理与仪表读取能力,为机器人自主执行复杂物理任务提供了更可靠的感知基础。