跳到正文

#Google

今日 0 条
8月12日周三
  1. Google DeepMind82

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 推出大规模多语言手语转文本(SL2T)模型,首次将手语AI应用于消费级产品,支持美国手语(ASL)到英语的实时转换。该模型基于超过10万小时、涵盖50多种手语的数据训练,通过MediaPipe Holistic提取人体姿态关键点而非原始视频以保护隐私,直接输出流式文本。

    推荐理由:原文给出了SL2T模型的技术原理、隐私保护机制及在Pixel 11上的落地入口,读者可以据此判断其如何改变聋人用户的输入体验。

8月6日周四
  1. Google DeepMind90

    Google DeepMind 开源 WeatherNext 2 与 Cyclones 模型,气旋预测精度提升相当于十年气象进步

    Google DeepMind 宣布开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其 Nature 论文显示该 AI 模型在气旋路径、强度和风结构预测上达到 SOTA,平均为预报员提供额外一天的预警时间,相当于过去十年的气象技术进步。

    推荐理由:WeatherNext 在气旋预测中实现相当于十年气象进步的精度提升,并开源了模型权重与代码。

7月30日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 正式发布 Gemini Robotics ER 2,这是其最新的高阶“具身推理”模型,旨在通过视频理解、任务编排和多机器人协作提升机器人在物理世界中的实用性。

    推荐理由:新模型通过视频理解实现任务进度追踪与多机器人协作,并公开了API接入入口及基准测试数据。

  2. Google DeepMind57

    Google DeepMind 发布 Lyria 3.5 音乐生成模型并上线 Google Flow Music

    Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中向用户开放。该模型在音乐性、歌词质量、人声表现和创作控制四个方面进行了升级,包括生成更复杂的旋律结构、提高提示词遵循度、增强人声情感表达以及允许用户更轻松地控制输出节奏和时长。

7月28日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Robotics 2 系列模型

    Google DeepMind 推出 Gemini Robotics 2 系列模型,赋予机器人全身智能控制、精细灵巧操作及多机协作能力。该系列包含用于视觉语言动作控制的 VLA 模型、作为高层大脑的 ER 推理模型以及支持快速适配新硬件的端侧模型。目前 ER 模型已在 Google AI Studio 上线,VLA 和端侧模型向早期合作伙伴开放。

    推荐理由:原文详细拆解了全身体控制、灵巧操作及多机协作的技术实现,为理解通用物理AI的落地路径提供了具体参考。

7月22日周三
7月21日周二
7月17日周五
7月16日周四
7月13日周一
  1. Google DeepMind35

    Google DeepMind 推出 Gemini 驱动的 ATL Saathi 试点应用

    Google DeepMind 在印度启动 ATL Saathi 实时试点,这是一款基于 Gemini 3.5 Flash 模型的 Web 应用,旨在为 Atal Tinkering Labs 教师提供全天候规划与培训助手。该工具支持 8 种语言,利用 NotebookLM 整理课程并生成项目方案、接线图及安全指南,目前已在 100 所试点学校部署,助力将传统实验室转型为 AI 增强型发现实验室。

7月3日周五
7月1日周三
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型

    Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。

    推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 内置计算机操作功能

    Gemini 3.5 Flash 现已将计算机操作(computer use)作为内置工具支持,此前该能力仅存在于独立的 Gemini 2.5 模型中。开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境进行感知、推理及行动的自定义智能体。

    推荐理由:原文说明了计算机操作能力从独立模型整合进主模型的变化,并给出了针对提示注入风险的安全措施与开发入口。

6月17日周三
6月16日周二
  1. Google DeepMind65

    Google DeepMind 发布 AI Control Roadmap 以保障 AI Agent 安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI Agent 的纵深防御框架,将未信任的智能体视为潜在内部威胁。该方案基于 MITRE ATT&CK 构建威胁模型,通过可信 AI 监督、行为分析及分级响应机制(D1-D4/R1-R3)来应对模型能力增长带来的安全风险。

    推荐理由:原文公开了内部 AI 控制路线图及百万级智能体轨迹分析数据,为行业提供了可参考的纵深防御框架与实时监测实践。

6月11日周四
  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma:基于扩散的开源实验性文本生成模型

    Google DeepMind 发布 DiffusionGemma,这是一个基于 Apache 2.0 许可的 26B Mixture of Experts (MoE) 实验性开源模型,通过并行生成文本块实现最高 4 倍的推理加速。

    推荐理由:原文给出了扩散模型在本地推理中的速度优势与硬件适配细节,读者可据此评估其在实时交互场景下的可用性。

6月10日周三
6月9日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。

    推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。

  2. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。

    推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。

6月8日周一
  1. Google DeepMind73

    Google DeepMind发布塞拉利昂AI辅助学习影响评估研究

    Google DeepMind公布了一项在塞拉利昂进行的预注册试验结果,显示使用Gemini驱动的Guided Learning工具使学生在八周内数学成绩提升0.258个标准差,相当于1.2至1.7年的典型学习进度。

    推荐理由:原文披露了塞拉利昂预注册试验的量化结果,展示了AI作为教学伙伴而非答案引擎的实际效能与行为改变。

5月22日周五
5月19日周二
5月18日周一
  1. Google DeepMind73

    Project Genie 新增 Street View 实景锚定功能并向 Google AI Ultra 用户开放

    Google DeepMind 在 Project Genie 中推出基于 Street View 的实景锚定能力,允许用户选择美国境内的真实地点作为生成世界的起点,并应用如“海洋世界”或“黑白电影”等风格进行创意重构。

    推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟世界能锚定现实地点,为智能体提供更具真实感的交互环境。

  2. Google DeepMind91

    Google DeepMind 发布 Gemini Omni Flash 模型

    Google DeepMind 推出 Gemini Omni 系列首个模型 Gemini Omni Flash,支持从图像、音频、视频和文本输入生成高质量视频,并允许通过自然语言进行多轮对话式编辑。

    推荐理由:原文展示了 Gemini Omni Flash 在视频生成与对话式编辑上的能力,并明确了其在多个 Google 产品中的落地入口。

5月17日周日
5月16日周六
  1. Google DeepMind38

    Google DeepMind 与新加坡政府达成国家 AI 合作,推动医疗、教育及科研发展

    Google DeepMind 与新加坡政府启动国家 AI 合作伙伴关系,聚焦医疗、教育与科研领域。双方将部署 Gemini for Education 赋能教师,利用 AlphaFold 加速疫情研究,并开发基于 Gemma 的视障跑步助手。该合作旨在通过前沿 AI 技术提升公共服务质量,预计至 2040 年创造 33 亿新元经济价值。

  2. Google DeepMind34

    Calico 利用 Co-Scientist 推进衰老研究

    Calico Life Sciences 使用 Google DeepMind 的 Co-Scientist 模型整合衰老生物学文献,生成关于代谢调节整合应激反应(ISR)的新假设。该工具帮助研究人员从混杂数据中识别高价值科学线索,并优化实验设计以验证假设。相关实验已产生对健康与疾病具有重要意义的发现,团队计划发表结果。

  3. Google DeepMind65

    DeepMind发布Co-Scientist辅助发现肝纤维化重定位药物的研究

    斯坦福大学Gary Peltz团队利用Google DeepMind的Co-Scientist加速寻找治疗肝纤维化的重定位药物。相关研究发表于Advanced Science,Peltz让Co-Scientist提出三个候选药物并解释推理过程,同时自己基于文献选出两个候选。

    推荐理由:原文展示了Co-Scientist在药物重定位任务中的具体表现,对比了AI筛选与人类专家选药的实际实验结果。

  4. Google DeepMind70

    Google DeepMind 解析 WeatherNext 如何助力预测飓风 Melissa 登陆牙买加

    Google DeepMind 发布文章说明其 AI 气象模型 WeatherNext 协助美国国家飓风中心(NHC)提前五天以高置信度预测了飓风 Melissa 的增强与路径。

    推荐理由:原文通过具体案例展示了AI模型在极端天气预测中的实际效能,为理解技术如何辅助人类决策提供了清晰视角。

  5. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 发布 Gemini 3.5 系列并率先推出 3.5 Flash 模型,该模型主打智能体工作流与编码能力,已在 Terminal-Bench 2.1、GDPval-AA 和 MCP Atlas 等基准测试中超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:原文给出了新模型在智能体与编码基准上的具体分数及速度对比,读者可据此评估其实际性能表现。

5月12日周二
  1. Google DeepMind82

    Google DeepMind 推出 Co-Scientist 多智能体科研助手

    Google DeepMind 发布基于 Gemini 构建的多智能体 AI 系统 Co-Scientist,旨在通过迭代生成、辩论和演化假设来加速科学研究。该系统包含生成、反思、排名和演化等专用智能体,并引入类似 AlphaGo 的“想法锦标赛”机制对假设进行验证和排序。

    推荐理由:原文展示了多智能体协作生成假设的具体机制及在肝病、ALS等领域的实测案例,为科研人员评估AI辅助发现工具提供了可参考的落地场景。

5月6日周三
  1. Google DeepMind75

    Google DeepMind 发布 AlphaEvolve 年度影响报告:Gemini 驱动的智能体如何跨领域扩展价值

    Google DeepMind 发布 AlphaEvolve 一周年回顾,展示该 Gemini 驱动的编码智能体在数学、计算机科学及工业界的显著影响。在科研方面,它帮助将电网优化可行解率从 14% 提升至 88%,并在量子物理中使分子模拟误差降低 10 倍。

    推荐理由:AlphaEvolve 团队回顾其作为 Gemini 驱动的编码智能体在科学发现、基础设施优化及商业应用中的具体成效,展示了算法自进化对多领域的加速作用。

4月30日周四
  1. Google DeepMind82

    Google DeepMind 发布 AI co-clinician 研究计划

    Google DeepMind 宣布启动 AI co-clinician 研究计划,旨在探索 AI 如何作为协作成员增强医生专业能力并提升护理质量。该研究在盲测评估中显示,AI co-clinician 在98个初级保健查询案例中有97例未出现关键错误,且在开放式药物知识问答上超越其他前沿模型。

    推荐理由:原文展示了AI在真实临床查询中零关键错误及多模态远程诊疗的模拟评估,为理解医疗AI从文本向实时交互演进提供了具体数据支撑。

4月27日周一
4月22日周三
  1. Google DeepMind40

    Google DeepMind 提出 Decoupled DiLoCo:实现低带宽分布式 AI 训练

    Google DeepMind 推出 Decoupled DiLoCo 架构,支持在低带宽下跨数据中心进行弹性分布式 LLM 训练。该方案基于 Pathways 和 DiLoCo,通过异步计算隔离硬件故障影响,并在 Gemma 4 模型测试中保持同等 ML 性能。实验显示,使用 2-5 Gbps 网络训练 12B 参数模型的速度比传统同步方法快 20 倍以上,且兼容不同代际 TPU 混合训练。