跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 21–40 条 · 共 51 条
8月28日周五
  1. ComfyUI Blog68

    ComfyUI 上线 Gemini Omni 1.1 Flash:支持快速视频生成、编辑及 4K 输出

    ComfyUI 通过 Partner Nodes 正式接入 Google 的 Gemini Omni 1.1 Flash 模型。该节点在单个界面中提供文本转视频、图像转视频、参考图转视频、视频编辑和场景扩展功能,支持 360p 至 4K 分辨率输出,并为每个片段自动生成音频轨道。

    推荐理由:ComfyUI 集成 Gemini Omni 1.1 Flash,支持从文本到视频及指令式编辑,最高输出 4K 分辨率并自动生成音频。

8月27日周四
  1. Google DeepMind63

    Google DeepMind 试点全球首个双盲 AI 评估

    Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评估机制,旨在通过加密“盒子”隔离外部评估数据,防止模型在测试前接触题目导致的基准污染。该方案与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,目前已在 Gemini Flash Lite 模型上进行测试。

    推荐理由:原文介绍了利用加密环境防止基准污染的双盲评估方法,为验证前沿模型真实能力提供了新的技术路径。

  2. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中流式和非流式平均词错率分别为 4.0% 和 2.6%,支持超过 85 种语言及最多三个说话人的身份识别。

    推荐理由:原文给出了新模型的流式与非流式词错率数据、多语言支持范围以及开发者 API 接入方式,读者可以据此评估其在实时交互场景中的实际表现。

8月14日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash:面向编码与智能体的主力模型

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main (43.6% vs 34.4%) 和 DeepSWE v1.1 (65.3% vs 49.0%) 等基准测试中显著优于前代,并在 GDP.pdf 和 AutomationBench 上展现更强的推理能力。

    推荐理由:新模型在代码生成和复杂文档处理上显著提升,且价格减半,适合评估其在生产环境中的成本效益。

8月12日周三
  1. Google DeepMind82

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语AI应用于消费级产品,支持美国手语(ASL)到英语的实时转换。该模型基于超过10万小时、涵盖50多种手语的数据训练,通过MediaPipe Holistic提取人体姿态关键点而非原始视频以保护隐私,直接输出流式文本。

    推荐理由:原文给出了SL2T模型的技术原理、隐私保护机制及在Pixel 11上的落地入口,读者可以据此判断其如何改变聋人用户的输入体验。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 2 与 Cyclones 模型,气旋预测精度提升相当于十年气象进步

    Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其 Nature 论文显示该 AI 模型在气旋路径、强度和风结构预测上达到 SOTA,平均为预报员提供额外一天的预警时间,相当于过去十年的气象技术进步。

    推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。

7月30日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 正式发布 Gemini Robotics ER 2,这是其最新的高阶“具身推理”模型,旨在通过视频理解、任务编排和多机器人协作提升机器人在物理世界中的实用性。

    推荐理由:新模型通过视频理解实现任务进度追踪与多机器人协作,并公开了API接入入口及基准测试数据。

7月28日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Robotics 2 系列模型

    Google DeepMind 推出 Gemini Robotics 2 系列模型,赋予机器人全身智能控制、精细灵巧操作及多机协作能力。该系列包含用于视觉语言动作控制的 VLA 模型、作为高层大脑的 ER 推理模型以及支持快速适配新硬件的端侧模型。目前 ER 模型已在 Google AI Studio 上线,VLA 和端侧模型向早期合作伙伴开放。

    推荐理由:原文详细拆解了全身体控制、灵巧操作及多机协作的技术实现,为理解通用物理AI的落地路径提供了具体参考。

7月21日周二
7月17日周五
7月1日周三
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型

    Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。

    推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 内置计算机操作功能

    Gemini 3.5 Flash 现已将计算机操作(computer use)作为内置工具支持,此前该能力仅存在于独立的 Gemini 2.5 模型中。开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境进行感知、推理及行动的自定义智能体。

    推荐理由:原文说明了计算机操作能力从独立模型整合进主模型的变化,并给出了针对提示注入风险的安全措施与开发入口。

6月16日周二
  1. Google DeepMind65

    Google DeepMind 发布 AI Control Roadmap 以保障 AI Agent 安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI Agent 的纵深防御框架,将未信任的智能体视为潜在内部威胁。该方案基于 MITRE ATT&CK 构建威胁模型,通过可信 AI 监督、行为分析及分级响应机制(D1-D4/R1-R3)来应对模型能力增长带来的安全风险。

    推荐理由:原文公开了内部 AI 控制路线图及百万级智能体轨迹分析数据,为行业提供了可参考的纵深防御框架与实时监测实践。

6月11日周四
  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma:基于扩散的开源实验性文本生成模型

    Google DeepMind 发布 DiffusionGemma,这是一个基于 Apache 2.0 许可的 26B Mixture of Experts (MoE) 实验性开源模型,通过并行生成文本块实现最高 4 倍的推理加速。

    推荐理由:原文给出了扩散模型在本地推理中的速度优势与硬件适配细节,读者可据此评估其在实时交互场景下的可用性。

6月9日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。

    推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。

  2. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。

    推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。

6月8日周一
  1. Google DeepMind73

    Google DeepMind发布塞拉利昂AI辅助学习影响评估研究

    Google DeepMind公布了一项在塞拉利昂进行的预注册试验结果,显示使用Gemini驱动的Guided Learning工具使学生在八周内数学成绩提升0.258个标准差,相当于1.2至1.7年的典型学习进度。

    推荐理由:原文披露了塞拉利昂预注册试验的量化结果,展示了AI作为教学伙伴而非答案引擎的实际效能与行为改变。

5月18日周一
  1. Google DeepMind73

    Project Genie 新增 Street View 实景锚定功能并向 Google AI Ultra 用户开放

    Google DeepMind 在 Project Genie 中推出基于 Street View 的实景锚定能力,允许用户选择美国境内的真实地点作为生成世界的起点,并应用如“海洋世界”或“黑白电影”等风格进行创意重构。

    推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟世界能锚定现实地点,为智能体提供更具真实感的交互环境。

  2. Google DeepMind91

    Google DeepMind 发布 Gemini Omni Flash 模型

    Google DeepMind 推出 Gemini Omni 系列首个模型 Gemini Omni Flash,支持从图像、音频、视频和文本输入生成高质量视频,并允许通过自然语言进行多轮对话式编辑。

    推荐理由:原文展示了 Gemini Omni Flash 在视频生成与对话式编辑上的能力,并明确了其在多个 Google 产品中的落地入口。