LWiAI Podcast #253:Opus 5、Gemini 3.6、Kimi K3 发布及 Hugging Face 被黑事件
Anthropic 发布 Claude Opus 5,Google 推出 Gemini 3.6/3.5 Flash,Moonshot AI 开源 2.8T 参数 Kimi K3。
Anthropic 发布 Claude Opus 5,Google 推出 Gemini 3.6/3.5 Flash,Moonshot AI 开源 2.8T 参数 Kimi K3。
MiniMax 发布第三代视频模型 H3,这是其首个开放权重的视频模型,已在 ComfyUI 中实现 Day-0 原生支持。该模型支持文本、图像、视频和音频输入,能生成最高 2K 分辨率、15 秒时长的视频,并同步生成原生立体声音频。通过剪枝调制权重、int8 量化及自定义内核等技术,H3 在 ComfyUI 中的显存占用降低 66%,使得 RTX 3060 等消费级 GPU 也能进行本地推理。
推荐理由:原文说明了 H3 的开放权重特性及在 ComfyUI 中的本地推理优化细节,读者可据此评估其在消费级硬件上的实际部署可行性。
Google DeepMind 正式发布 Gemini Robotics ER 2,这是其最新的高阶“具身推理”模型,旨在通过视频理解、任务编排和多机器人协作提升机器人在物理世界中的实用性。
推荐理由:新模型通过视频理解实现任务进度追踪与多机器人协作,并公开了API接入入口及基准测试数据。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,并即日起在 Google Flow Music 中向用户开放。该模型在音乐性、歌词质量、人声表现和创作控制四个方面进行了升级,包括生成更复杂的旋律结构、提高提示词遵循度、增强人声情感表达以及允许用户更轻松地控制输出节奏和时长。
Fable 5 之后,作者将 Coding Agent 使用角色从 Tech Lead 转为 Engineering Manager,不再细看代码而专注全局验收。通过 /goal 指令让 Agent 执行方案与测试,技术选型不再受限于个人技能树,如 BaoCut 项目改用 Rust 实现跨平台。此时人的瓶颈从写代码转变为想清楚需求,若构思不清则无法发挥 Agent 生产力。
Google DeepMind 推出 Gemini Robotics 2 系列模型,赋予机器人全身智能控制、精细灵巧操作及多机协作能力。该系列包含用于视觉语言动作控制的 VLA 模型、作为高层大脑的 ER 推理模型以及支持快速适配新硬件的端侧模型。目前 ER 模型已在 Google AI Studio 上线,VLA 和端侧模型向早期合作伙伴开放。
推荐理由:原文详细拆解了全身体控制、灵巧操作及多机协作的技术实现,为理解通用物理AI的落地路径提供了具体参考。
通用 Agent 将凭借 Skill 和 MCP 生态吃掉垂直应用,少数赢家通吃。模型能力与成本构成最终护城河,用户忠诚度低且易因更优模型切换。小团队应聚焦基于 Agent 的插件开发而非底层框架,普通用户越早使用越能提升效率。
Comfy 正式推出 Team 计划,将团队整合至单一共享工作区、统一积分池及一张账单中。该计划提供 $200 至 $2,500 的月度积分承诺档位,支持按量折扣最高达 20%,并内置管理员控制功能以简化计费与成员管理。
Google 宣布向 Genesis Mission 投入 4000 万美元的 AI tokens 和 credits,以加速科学发现前沿。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在提升 AI 智能体的构建效率与可靠性。
推荐理由:原文给出了三款新模型在效率、延迟和特定场景下的具体性能数据与定价,读者可以据此评估其在智能体工作流中的实际落地价值。
OpenAI 推出 GPT-5.6(含 Sol 和 Luna)并将桌面编码产品更名为 ChatGPT Work,SpaceX AI 发布低成本 Grok 4.5,Meta 上线 Muse Spark 1.1。中国开源模型占 OpenRouter 周 token 量超 30%,NVIDIA 发布 Nemotron-Labs-Diffusion 三模式语言模型。
Anthropic 推出 Claude Sonnet 5,主打限时折扣定价与增强的智能体编码能力,并部署了新的网络安全分类器。Etched 获得价值 10 亿美元的推理硬件需求,中国开源 LongCat 2.0 MoE 模型展示大规模训练效率。Google 同步上线 NotebookLM 视频摘要功能及 Nano Banana 2 Lite 图像生成器。
Anthropic 获准向特定机构发布 Mythos-5,OpenAI 推出仅限约 20 家获批组织访问的 GPT-5.6 “Sol”,Meta 面临模型审查压力。GLM 5.2 以 MIT 许可证开源并优化长上下文编码性能。此外,OpenAI 联合 Broadcom 在 TSMC 3nm 工艺上推出 Jalapeño 推理 ASIC,Groq 融资 6.5 亿美元转向 neocloud。
Anthropic 因政府命令切断 Fable 5 和 Mythos 5 访问权限,SpaceX 以约 $1.75T 估值完成 IPO 并斥资 $60B 收购 AI 编程初创公司 Cursor。ChatGPT 市场份额首次跌破 50%,Moonshot 发布 Kimi K2.7-Code,NVIDIA 推出 Nemotron 3 Ultra 等开源模型。
Anthropic 发布 Claude Fable 5,引发关于严格护栏与静默降级的争议。Apple 推出基于 Gemini 合作的 Siri AI,Google 上线 Gemini 3.5 Live Translate 并调整订阅价格。OpenAI 秘密提交 IPO 申请,Bezos 支持的 Prometheus 融资 120 亿美元,DeepSeek 寻求 70 亿美元外部融资。
Anthropic 发布 Claude Opus 4.8,提升基准分数并推出 Dynamic Workflows;Microsoft 展示基于 OpenClaw 的 Scout 助手及 MAI Thinking 1 等自研模型。
Google DeepMind 推出基于 Gemini 3.5 Flash 微调的轻量级网络安全模型 Gemini 3.5 Flash Cyber,旨在高效查找、验证和修补软件漏洞。
推荐理由:原文展示了轻量级模型在代码安全扫描中的成本与效率优势,并给出了通过多次调用提升发现率的工程实践。
Comfy Org 与伦敦艺术大学创意计算研究所(CCI)宣布建立 Creative Campus 合作伙伴关系,使 CCI 成为即将推出的 Comfy Education Initiative 的创始伙伴。CCI 师生将获得教育折扣、团队功能早期访问权及专属社区支持,其研究项目正利用 ComfyUI 开发符合版权规定的视听基础模型。
Google DeepMind 与 Isomorphic Labs 于 2026 年 7 月 16 日联合公布其生物韧性(bioresilience)方法,旨在通过防止模型滥用和利用 AI 技术增强社会对疫情等事件的抵御能力。
ComfyUI MCP 推出针对批量生成的新工具集,包括支持单次提交最多 50 个任务的 `submit_batch`、状态监控 `get_batch_status` 和结果收集 `get_batch_output`。
Google DeepMind 在印度启动 ATL Saathi 实时试点,这是一款基于 Gemini 3.5 Flash 模型的 Web 应用,旨在为 Atal Tinkering Labs 教师提供全天候规划与培训助手。该工具支持 8 种语言,利用 NotebookLM 整理课程并生成项目方案、接线图及安全指南,目前已在 100 所试点学校部署,助力将传统实验室转型为 AI 增强型发现实验室。
宝玉分享对 GitHub 热门项目 Caveman 的实测分析,该项目旨在让 AI 像原始人一样说话以节省 Token,README 声称能节省 65%。JetBrains 的测试显示,在 Claude Code 运行 86 个真实编程任务时,Caveman 实际仅节省 8.5% 的输出 Token,且未显著影响任务质量。
文章详细解析了 OpenAI 旗下 Chat、Work 和 Codex 三种模式的核心差异:Chat 用于问答,Work 面向跨应用知识工作并交付成品,Codex 专注代码仓库开发任务。
推荐理由:原文通过对比表格和场景举例,清晰拆解了 Chat、Work 和 Codex 的功能边界与额度机制,帮助读者快速建立正确的使用预期。
Claude Code 团队发布指南,将 AI 智能体循环定义为重复执行工作周期直至满足停止条件,并划分为回合制、目标导向、基于时间和主动式四种类型。文章针对每种循环给出了触发方式、停止条件及适用场景,例如使用 /goal 设定明确完成标准,或通过 /loop 和 /schedule 实现周期性任务自动化。
推荐理由:原文系统梳理了四种循环模式及其触发停止机制,提供了控制 Token 消耗与保障代码质量的具体操作建议。
Google DeepMind 与电影制作公司 A24 宣布建立首个专注于研究的合作伙伴关系,并伴随一项投资。双方将开展深度研发协作,让艺术家参与塑造未来工具,以弥合前沿技术与下一代娱乐之间的差距。
Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款新模型,现已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上线。
推荐理由:原文给出了两款新模型的定价、延迟指标及 API 接入方式,读者可据此评估其在高吞吐图像生成与视频编辑工作流中的实际成本效益。
Gemini 3.5 Flash 现已将计算机操作(computer use)作为内置工具支持,此前该能力仅存在于独立的 Gemini 2.5 模型中。开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境进行感知、推理及行动的自定义智能体。
推荐理由:原文说明了计算机操作能力从独立模型整合进主模型的变化,并给出了针对提示注入风险的安全措施与开发入口。
Google DeepMind 宣布与英国政府合作开发基于 Gemini 的 AI 规划原型,旨在将住宅规划申请的处理时间缩短 50%。该工具通过整合数据、识别本地政策、总结反馈和起草评估报告来辅助规划官员,但官员仍保留最终审批权并拥有完整的审计追踪记录。
Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI Agent 的纵深防御框架,将未信任的智能体视为潜在内部威胁。该方案基于 MITRE ATT&CK 构建威胁模型,通过可信 AI 监督、行为分析及分级响应机制(D1-D4/R1-R3)来应对模型能力增长带来的安全风险。
推荐理由:原文公开了内部 AI 控制路线图及百万级智能体轨迹分析数据,为行业提供了可参考的纵深防御框架与实时监测实践。
宝玉指出 Anthropic 推出的 Claude Design 能生成高完成度的可交互原型,而 OpenAI 的 Codex 尚未推出同类产品,核心原因在于 GPT-5.5 模型在系统架构设计和状态管理方面的能力不足。
Google DeepMind 发布 DiffusionGemma,这是一个基于 Apache 2.0 许可的 26B Mixture of Experts (MoE) 实验性开源模型,通过并行生成文本块实现最高 4 倍的推理加速。
推荐理由:原文给出了扩散模型在本地推理中的速度优势与硬件适配细节,读者可据此评估其在实时交互场景下的可用性。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org 宣布启动最高 $10M 的多智能体 AI 安全研究资助计划。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70 多种语言的近实时语音到语音翻译。该模型能自动检测语言并生成保留说话人语调、节奏和音高的流畅译文,通过持续生成语音而非等待说完来减少停顿。
推荐理由:原文展示了 Gemini 3.5 Live Translate 在连续流式翻译、保留语调及多端部署上的能力变化,为开发者与企业提供了实时语音交互的新方案。
Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。
推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。
Google DeepMind Accelerator 从欧洲选出15家机器人初创公司加入为期3个月的加速计划。入选者将获得密集导师指导、技术支援及 Gemini robotics models 访问权限,以将 AI 集成至核心产品。该计划旨在推动物流、医疗等领域的物理 AI 应用落地。
Google DeepMind公布了一项在塞拉利昂进行的预注册试验结果,显示使用Gemini驱动的Guided Learning工具使学生在八周内数学成绩提升0.258个标准差,相当于1.2至1.7年的典型学习进度。
推荐理由:原文披露了塞拉利昂预注册试验的量化结果,展示了AI作为教学伙伴而非答案引擎的实际效能与行为改变。
Elon Musk 在与 OpenAI 及 Sam Altman 的诉讼中败诉,涉案金额达 $150 Billion。Google 在 IO 2026 上更新其 Gemini app,旨在与 ChatGPT 和 Claude 竞争。此外,OpenAI 解决了 Erdős 相关问题。
Google I/O 发布 Gemini 3.5(含 Flash 版)、常驻智能体 Gemini Spark 及多模态视频模型 Gemini Omni。xAI 推出 Grok Build,Cursor Composer 2.5 以低成本匹配 Opus 4.7 和 GPT-5.5 基准。
DeepSeek 通过 MLA、DSA 及 mHC 等创新技术大幅压缩 KV 缓存,使 V4 Pro 在 1M 上下文下仅需 5.48GB HBM,远低于 GLM5 和 Qwen3。其战略旨在利用 NAND/LPDDR 存储替代算力,扶持中国硬件生态并冲击 1 万亿美元市值。
Google DeepMind 在亚太地区启动首个“AI for the Planet”加速器计划,旨在利用前沿 AI 解决气候、农业及能源等环境挑战。该为期三个月的项目面向初创公司、研究团队和非营利组织,提供专家指导及 Google AI 科学模型集成支持。项目将以新加坡线下训练营正式启动。