跳到正文

全部动态

今日 0 条
7月28日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Robotics 2 系列模型

    Google DeepMind 推出 Gemini Robotics 2 系列模型,赋予机器人全身智能控制、精细灵巧操作及多机协作能力。该系列包含用于视觉语言动作控制的 VLA 模型、作为高层大脑的 ER 推理模型以及支持快速适配新硬件的端侧模型。目前 ER 模型已在 Google AI Studio 上线,VLA 和端侧模型向早期合作伙伴开放。

    推荐理由:原文详细拆解了全身体控制、灵巧操作及多机协作的技术实现,为理解通用物理AI的落地路径提供了具体参考。

7月21日周二
  1. Last Week in AI24

    Last Week in AI #251:Anthropic 发布 Claude Sonnet 5,Etched 获巨额订单,LongCat 2.0 开源

    Anthropic 推出 Claude Sonnet 5,主打限时折扣定价与增强的智能体编码能力,并部署了新的网络安全分类器。Etched 获得价值 10 亿美元的推理硬件需求,中国开源 LongCat 2.0 MoE 模型展示大规模训练效率。Google 同步上线 NotebookLM 视频摘要功能及 Nano Banana 2 Lite 图像生成器。

7月17日周五
7月16日周四
7月1日周三
  1. Google DeepMind78

    Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型

    Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。

    推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 内置计算机操作功能

    Gemini 3.5 Flash 现已将计算机操作(computer use)作为内置工具支持,此前该能力仅存在于独立的 Gemini 2.5 模型中。开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境进行感知、推理及行动的自定义智能体。

    推荐理由:原文说明了计算机操作能力从独立模型整合进主模型的变化,并给出了针对提示注入风险的安全措施与开发入口。

6月16日周二
  1. Google DeepMind65

    Google DeepMind 发布 AI Control Roadmap 以保障 AI Agent 安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI Agent 的纵深防御框架,将未信任的智能体视为潜在内部威胁。该方案基于 MITRE ATT&CK 构建威胁模型,通过可信 AI 监督、行为分析及分级响应机制(D1-D4/R1-R3)来应对模型能力增长带来的安全风险。

    推荐理由:原文公开了内部 AI 控制路线图及百万级智能体轨迹分析数据,为行业提供了可参考的纵深防御框架与实时监测实践。

6月13日周六
6月11日周四
  1. Google DeepMind82

    Google DeepMind 发布 DiffusionGemma:基于扩散的开源实验性文本生成模型

    Google DeepMind 发布 DiffusionGemma,这是一个基于 Apache 2.0 许可的 26B Mixture of Experts (MoE) 实验性开源模型,通过并行生成文本块实现最高 4 倍的推理加速。

    推荐理由:原文给出了扩散模型在本地推理中的速度优势与硬件适配细节,读者可据此评估其在实时交互场景下的可用性。

6月10日周三
6月9日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。

    推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。

  2. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。

    推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。

6月8日周一
  1. Google DeepMind73

    Google DeepMind发布塞拉利昂AI辅助学习影响评估研究

    Google DeepMind公布了一项在塞拉利昂进行的预注册试验结果,显示使用Gemini驱动的Guided Learning工具使学生在八周内数学成绩提升0.258个标准差,相当于1.2至1.7年的典型学习进度。

    推荐理由:原文披露了塞拉利昂预注册试验的量化结果,展示了AI作为教学伙伴而非答案引擎的实际效能与行为改变。

5月23日周六
5月19日周二
5月18日周一
  1. Google DeepMind73

    Project Genie 新增 Street View 实景锚定功能并向 Google AI Ultra 用户开放

    Google DeepMind 在 Project Genie 中推出基于 Street View 的实景锚定能力,允许用户选择美国境内的真实地点作为生成世界的起点,并应用如“海洋世界”或“黑白电影”等风格进行创意重构。

    推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟世界能锚定现实地点,为智能体提供更具真实感的交互环境。

  2. Google DeepMind91

    Google DeepMind 发布 Gemini Omni Flash 模型

    Google DeepMind 推出 Gemini Omni 系列首个模型 Gemini Omni Flash,支持从图像、音频、视频和文本输入生成高质量视频,并允许通过自然语言进行多轮对话式编辑。

    推荐理由:原文展示了 Gemini Omni Flash 在视频生成与对话式编辑上的能力,并明确了其在多个 Google 产品中的落地入口。

5月17日周日
5月16日周六
  1. Google DeepMind34

    Calico 利用 Co-Scientist 推进衰老研究

    Calico Life Sciences 使用 Google DeepMind 的 Co-Scientist 模型整合衰老生物学文献,生成关于代谢调节整合应激反应(ISR)的新假设。该工具帮助研究人员从混杂数据中识别高价值科学线索,并优化实验设计以验证假设。相关实验已产生对健康与疾病具有重要意义的发现,团队计划发表结果。

  2. Google DeepMind65

    DeepMind发布Co-Scientist辅助发现肝纤维化重定位药物的研究

    斯坦福大学Gary Peltz团队利用Google DeepMind的Co-Scientist加速寻找治疗肝纤维化的重定位药物。相关研究发表于Advanced Science,Peltz让Co-Scientist提出三个候选药物并解释推理过程,同时自己基于文献选出两个候选。

    推荐理由:原文展示了Co-Scientist在药物重定位任务中的具体表现,对比了AI筛选与人类专家选药的实际实验结果。

  3. Google DeepMind70

    Google DeepMind 解析 WeatherNext 如何助力预测飓风 Melissa 登陆牙买加

    Google DeepMind 发布文章说明其 AI 气象模型 WeatherNext 协助美国国家飓风中心(NHC)提前五天以高置信度预测了飓风 Melissa 的增强与路径。

    推荐理由:原文通过具体案例展示了AI模型在极端天气预测中的实际效能,为理解技术如何辅助人类决策提供了清晰视角。

  4. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 发布 Gemini 3.5 系列并率先推出 3.5 Flash 模型,该模型主打智能体工作流与编码能力,已在 Terminal-Bench 2.1、GDPval-AA 和 MCP Atlas 等基准测试中超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:原文给出了新模型在智能体与编码基准上的具体分数及速度对比,读者可据此评估其实际性能表现。

5月12日周二
  1. Google DeepMind82

    Google DeepMind 推出 Co-Scientist 多智能体科研助手

    Google DeepMind 发布基于 Gemini 构建的多智能体 AI 系统 Co-Scientist,旨在通过迭代生成、辩论和演化假设来加速科学研究。该系统包含生成、反思、排名和演化等专用智能体,并引入类似 AlphaGo 的“想法锦标赛”机制对假设进行验证和排序。

    推荐理由:原文展示了多智能体协作生成假设的具体机制及在肝病、ALS等领域的实测案例,为科研人员评估AI辅助发现工具提供了可参考的落地场景。

5月10日周日
  1. 宝玉的分享78

    英伟达Jim Fan宣告VLA时代结束并提出世界动作模型WAM

    英伟达机器人与AI研究组负责人Jim Fan在Sequoia AI Ascent 2026演讲中宣布VLA路线过时,提出以DreamZero为代表的世界动作模型(WAM)新范式。他指出VLA架构参数过度集中于语言而忽视物理动作,主张通过人类第一人称视频预训练和动作微调实现“底层同构”,并预测2040年前完成机器人终局。

    推荐理由:文章梳理了英伟达Jim Fan关于机器人范式从VLA转向WAM的演讲核心,提供了对遥操作数据局限及神经缩放定律的具体分析。

5月6日周三
  1. Google DeepMind75

    Google DeepMind 发布 AlphaEvolve 年度影响报告:Gemini 驱动的智能体如何跨领域扩展价值

    Google DeepMind 发布 AlphaEvolve 一周年回顾,展示该 Gemini 驱动的编码智能体在数学、计算机科学及工业界的显著影响。在科研方面,它帮助将电网优化可行解率从 14% 提升至 88%,并在量子物理中使分子模拟误差降低 10 倍。

    推荐理由:AlphaEvolve 团队回顾其作为 Gemini 驱动的编码智能体在科学发现、基础设施优化及商业应用中的具体成效,展示了算法自进化对多领域的加速作用。

5月4日周一
4月30日周四
  1. Google DeepMind82

    Google DeepMind 发布 AI co-clinician 研究计划

    Google DeepMind 宣布启动 AI co-clinician 研究计划,旨在探索 AI 如何作为协作成员增强医生专业能力并提升护理质量。该研究在盲测评估中显示,AI co-clinician 在98个初级保健查询案例中有97例未出现关键错误,且在开放式药物知识问答上超越其他前沿模型。

    推荐理由:原文展示了AI在真实临床查询中零关键错误及多模态远程诊疗的模拟评估,为理解医疗AI从文本向实时交互演进提供了具体数据支撑。

  2. 宝玉的分享78

    Demis Hassabis 谈 AGI 缺口、智能体现状与下一个科学突破

    Google DeepMind CEO Demis Hassabis 在 YC 访谈中指出,当前 AI 范式距离 AGI 仍有 50% 概率需要一两个关键突破,主要缺失在于持续学习、长程推理和记忆机制。

    推荐理由:Google DeepMind CEO 详细拆解了 AGI 缺失的关键拼图、智能体投入产出比争议以及科学发现的本质,为理解当前 AI 瓶颈提供了权威视角。

4月22日周三
  1. Google DeepMind40

    Google DeepMind 提出 Decoupled DiLoCo:实现低带宽分布式 AI 训练

    Google DeepMind 推出 Decoupled DiLoCo 架构,支持在低带宽下跨数据中心进行弹性分布式 LLM 训练。该方案基于 Pathways 和 DiLoCo,通过异步计算隔离硬件故障影响,并在 Gemma 4 模型测试中保持同等 ML 性能。实验显示,使用 2-5 Gbps 网络训练 12B 参数模型的速度比传统同步方法快 20 倍以上,且兼容不同代际 TPU 混合训练。

4月17日周五
  1. 宝玉的分享68

    黄仁勋在 Dwarkesh Patel 专访中阐述 Nvidia 战略:反对出口管制并解释 Anthropic 选择 TPU 的原因

    黄仁勋接受 Dwarkesh Patel 两小时专访,提出“输入是电子,输出是 Token”定义 Nvidia 使命,并强烈反对将 AI 芯片视为武器或实施对华出口管制。他承认早年未投资 Anthropic 导致其转向 TPU/Trainium 是特例而非趋势,强调 CUDA 护城河在于装机量与跨云生态,并指出能源政策比芯片产能更制约未来。

4月16日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 推出最新文本转语音模型 Gemini 3.1 Flash TTS,支持通过嵌入自然语言命令的音频标签来精确控制声音风格、语速和表达方式。该模型在 Artificial Analysis TTS 排行榜上获得 1,211 的 Elo 分数,原生支持多说话人对话及 70 多种语言,所有生成音频均带有 SynthID 水印。

    推荐理由:新模型引入自然语言音频标签以精细控制语速和风格,并在 Artificial Analysis 基准中取得高分。

4月15日周三
4月13日周一
  1. Google DeepMind75

    Google DeepMind 发布 Gemini Robotics-ER 1.6 增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是一款专为机器人设计的高层推理模型,显著提升了空间推理、多视角理解和成功检测能力。该模型新增了仪表读取功能,能结合视觉推理与代码执行精确解读压力表等工业仪器,并已通过 Gemini API 和 Google AI Studio 向开发者开放。

    推荐理由:新模型强化了空间推理与仪表读取能力,为机器人自主执行复杂物理任务提供了更可靠的感知基础。

4月1日周三