跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 21–31 条 · 共 31 条
6月9日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。

    推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。

  2. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。

    推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。

6月8日周一
  1. Google DeepMind73

    Google DeepMind发布塞拉利昂AI辅助学习影响评估研究

    Google DeepMind公布了一项在塞拉利昂进行的预注册试验结果,显示使用Gemini驱动的Guided Learning工具使学生在八周内数学成绩提升0.258个标准差,相当于1.2至1.7年的典型学习进度。

    推荐理由:原文披露了塞拉利昂预注册试验的量化结果,展示了AI作为教学伙伴而非答案引擎的实际效能与行为改变。

5月18日周一
  1. Google DeepMind73

    Project Genie 新增 Street View 实景锚定功能并向 Google AI Ultra 用户开放

    Google DeepMind 在 Project Genie 中推出基于 Street View 的实景锚定能力,允许用户选择美国境内的真实地点作为生成世界的起点,并应用如“海洋世界”或“黑白电影”等风格进行创意重构。

    推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟世界能锚定现实地点,为智能体提供更具真实感的交互环境。

  2. Google DeepMind91

    Google DeepMind 发布 Gemini Omni Flash 模型

    Google DeepMind 推出 Gemini Omni 系列首个模型 Gemini Omni Flash,支持从图像、音频、视频和文本输入生成高质量视频,并允许通过自然语言进行多轮对话式编辑。

    推荐理由:原文展示了 Gemini Omni Flash 在视频生成与对话式编辑上的能力,并明确了其在多个 Google 产品中的落地入口。

5月17日周日
5月16日周六
  1. Google DeepMind70

    Google DeepMind 解析 WeatherNext 如何助力预测飓风 Melissa 登陆牙买加

    Google DeepMind 发布文章说明其 AI 气象模型 WeatherNext 协助美国国家飓风中心(NHC)提前五天以高置信度预测了飓风 Melissa 的增强与路径。

    推荐理由:原文通过具体案例展示了AI模型在极端天气预测中的实际效能,为理解技术如何辅助人类决策提供了清晰视角。

  2. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 发布 Gemini 3.5 系列并率先推出 3.5 Flash 模型,该模型主打智能体工作流与编码能力,已在 Terminal-Bench 2.1、GDPval-AA 和 MCP Atlas 等基准测试中超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:原文给出了新模型在智能体与编码基准上的具体分数及速度对比,读者可据此评估其实际性能表现。

4月30日周四
  1. Google DeepMind82

    Google DeepMind 发布 AI co-clinician 研究计划

    Google DeepMind 宣布启动 AI co-clinician 研究计划,旨在探索 AI 如何作为协作成员增强医生专业能力并提升护理质量。该研究在盲测评估中显示,AI co-clinician 在98个初级保健查询案例中有97例未出现关键错误,且在开放式药物知识问答上超越其他前沿模型。

    推荐理由:原文展示了AI在真实临床查询中零关键错误及多模态远程诊疗的模拟评估,为理解医疗AI从文本向实时交互演进提供了具体数据支撑。

4月17日周五
4月13日周一
  1. Google DeepMind75

    Google DeepMind 发布 Gemini Robotics-ER 1.6 增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是一款专为机器人设计的高层推理模型,显著提升了空间推理、多视角理解和成功检测能力。该模型新增了仪表读取功能,能结合视觉推理与代码执行精确解读压力表等工业仪器,并已通过 Gemini API 和 Google AI Studio 向开发者开放。

    推荐理由:新模型强化了空间推理与仪表读取能力,为机器人自主执行复杂物理任务提供了更可靠的感知基础。