LWiAI Podcast #245:TML 交互模型、Claude for Legal 及 Sam Altman 出庭
OpenAI 发布 GPT Realtime 2 语音 API,Thinking Machines 预览低延迟全双工对话系统。Anthropic 推出 Claude for Legal 并深化 AWS 合作,Sam Altman 出庭作证引发关注。
OpenAI 发布 GPT Realtime 2 语音 API,Thinking Machines 预览低延迟全双工对话系统。Anthropic 推出 Claude for Legal 并深化 AWS 合作,Sam Altman 出庭作证引发关注。
Codex 官方团队成员 jxnlco 发布指南,介绍如何通过组合持久对话流、语音输入、任务干预与排队等功能,将 Codex 从单一编程助手扩展为全能电脑工作代理。
Google DeepMind 的 Co-Scientist 协助生物学家筛选出20多个可能逆转细胞衰老的新型遗传因子,实验室验证显示其能成功驱动细胞进入更年轻状态。该工具将原本需耗时6个月的大规模基因筛查数据分析工作缩短至几天,显著加速了从海量文献与实验数据中提取有效假设的过程。
Google DeepMind 在 Project Genie 中推出基于 Street View 的实景锚定能力,允许用户选择美国境内的真实地点作为生成世界的起点,并应用如“海洋世界”或“黑白电影”等风格进行创意重构。
推荐理由:Project Genie 接入 Street View 真实影像,让 AI 生成的虚拟世界能锚定现实地点,为智能体提供更具真实感的交互环境。
Google DeepMind 推出 Gemini Omni 系列首个模型 Gemini Omni Flash,支持从图像、音频、视频和文本输入生成高质量视频,并允许通过自然语言进行多轮对话式编辑。
推荐理由:原文展示了 Gemini Omni Flash 在视频生成与对话式编辑上的能力,并明确了其在多个 Google 产品中的落地入口。
Google DeepMind 推出 Gemini for Science,包含三个基于 Google Labs 的实验性工具和集成在 Google Antigravity 中的 Science Skills。
推荐理由:原文展示了面向科研的 Agent 工具集与技能包,读者可据此了解 AI 如何加速假设生成、计算发现及文献分析等核心科研环节。
Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 中扩展内容透明度与验证工具,并推出新的 AI Content Detection API。
推荐理由:原文详述了 SynthID 与 C2PA 在搜索、Chrome 及 Pixel 端的落地细节,并推出面向企业的 AI 内容检测 API。
作者拒绝依赖 LLM 进行“凭感觉编程”,认为其无法解决软件开发的本质复杂性,且缺乏对抽象局限性的元认知。LLM 消除的仅是偶然复杂性,而摩擦是理解代码架构与发现设计缺陷的关键线索。盲目追求速度可能导致逻辑谬误,如 DOGE 团队因照单全收数据字面意思而得出错误结论。
Google DeepMind 与新加坡政府启动国家 AI 合作伙伴关系,聚焦医疗、教育与科研领域。双方将部署 Gemini for Education 赋能教师,利用 AlphaFold 加速疫情研究,并开发基于 Gemma 的视障跑步助手。该合作旨在通过前沿 AI 技术提升公共服务质量,预计至 2040 年创造 33 亿新元经济价值。
Google DeepMind 的 Co-Scientist 工具协助剑桥大学 Clare Bryant 教授团队识别导致严重疾病的分子开关。该工具通过生成并排序假设,将原本需两到三年的实验工作缩短至六个月,精准定位关键氨基酸突变。
Calico Life Sciences 使用 Google DeepMind 的 Co-Scientist 模型整合衰老生物学文献,生成关于代谢调节整合应激反应(ISR)的新假设。该工具帮助研究人员从混杂数据中识别高价值科学线索,并优化实验设计以验证假设。相关实验已产生对健康与疾病具有重要意义的发现,团队计划发表结果。
Google DeepMind 的 Co-Scientist 协助爱丁堡大学团队在 MASH 研究中生成新假设,通过合成证据缩小药物组合搜索范围。该系统提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁,解释了 resmetirom 疗效局限的原因,该假设已获实验验证并有望推动双靶点疗法开发。
Google DeepMind 的 Co-Scientist 协助 MIT 的 Ritu Raman 快速梳理 ALS 矛盾文献并生成可测试假设。该工具促使她与波士顿儿童医院的 Ryan Flynn 合作,结合组织模型与 RNA 映射技术,共同探索针对 ALS 的新型 RNA 机制及药物。
斯坦福大学Gary Peltz团队利用Google DeepMind的Co-Scientist加速寻找治疗肝纤维化的重定位药物。相关研究发表于Advanced Science,Peltz让Co-Scientist提出三个候选药物并解释推理过程,同时自己基于文献选出两个候选。
推荐理由:原文展示了Co-Scientist在药物重定位任务中的具体表现,对比了AI筛选与人类专家选药的实际实验结果。
Google DeepMind 发布文章说明其 AI 气象模型 WeatherNext 协助美国国家飓风中心(NHC)提前五天以高置信度预测了飓风 Melissa 的增强与路径。
推荐理由:原文通过具体案例展示了AI模型在极端天气预测中的实际效能,为理解技术如何辅助人类决策提供了清晰视角。
宝玉翻译并分享了 Anthropic 发布的《创始人手册》,指导创业者如何利用 AI 重塑初创公司生命周期。文章将创业分为构思、MVP、发布和扩展四个阶段,分别介绍了如何使用 Chat、Claude Cowork 和 Claude Code 进行市场调研、智能体编程、流程自动化及安全审查。
Google DeepMind 发布 Gemini 3.5 系列并率先推出 3.5 Flash 模型,该模型主打智能体工作流与编码能力,已在 Terminal-Bench 2.1、GDPval-AA 和 MCP Atlas 等基准测试中超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。
推荐理由:原文给出了新模型在智能体与编码基准上的具体分数及速度对比,读者可据此评估其实际性能表现。
宝玉撰文解析 Forward Deployed Engineer(FDE)这一新兴岗位,指出其核心职责是驻扎客户现场进行代码集成与调试,区别于传统咨询顾问。
Google DeepMind 发布基于 Gemini 构建的多智能体 AI 系统 Co-Scientist,旨在通过迭代生成、辩论和演化假设来加速科学研究。该系统包含生成、反思、排名和演化等专用智能体,并引入类似 AlphaGo 的“想法锦标赛”机制对假设进行验证和排序。
推荐理由:原文展示了多智能体协作生成假设的具体机制及在肝病、ALS等领域的实测案例,为科研人员评估AI辅助发现工具提供了可参考的落地场景。
Anthropic Claude Code 和 Cowork 产品线工程与产品负责人 Fiona Fung 在 Code with Claude 2026 大会上分享了 AI 时代管理工程团队的经验。
资深开发者因身处“管理复杂性”循环,常以维护成本为由拒绝需求,导致与追求“消除不确定性”的业务团队沟通失效。文章指出其核心价值在于利用现有资源快速验证假设,建议将“减少代码”转化为“更快获得确定性”的解决方案,从而弥合认知分歧。
Codex App、Claude 桌面版等顶尖 Agent 应用近期收敛至三栏界面布局,右侧工作区成为交互最优解。Codex 4 月大版本更新大幅升级该区域,旨在通过插件机制解决用户二次编辑需求及 Skill 商业化难题。这一策略意在构建类似 VSCode 的 Agent 平台生态,为中小团队提供专注垂直领域插件开发的新路径。
文章深入解析了包裹在大语言模型之外的软件架构 Agent Harness,指出其包含编排循环、工具、记忆等 12 个核心组件。通过改变底层架构而非模型本身,即可显著提升系统在 TerminalBench 2.0 等基准测试中的表现。
Arnav Gupta 撰文指出当前企业裁员潮并非单纯由 AI 直接取代岗位引起,而是源于 AI 带来的代码产出激增未能转化为相应的商业收入成果。文章认为在“对齐”成本高昂且组织存在冗余的背景下,企业为抵消巨额 Token 支出并加速流程,不得不通过裁员来削减人力成本和组织摩擦,这一趋势将持续直到学会将 AI 投入有效转化为实际业务价值。
英伟达机器人与AI研究组负责人Jim Fan在Sequoia AI Ascent 2026演讲中宣布VLA路线过时,提出以DreamZero为代表的世界动作模型(WAM)新范式。他指出VLA架构参数过度集中于语言而忽视物理动作,主张通过人类第一人称视频预训练和动作微调实现“底层同构”,并预测2040年前完成机器人终局。
推荐理由:文章梳理了英伟达Jim Fan关于机器人范式从VLA转向WAM的演讲核心,提供了对遥操作数据局限及神经缩放定律的具体分析。
Claude Code 团队成员 Thariq 提出在 AI 智能体工作流中优先使用 HTML 而非 Markdown 作为输出格式。HTML 能提供更丰富的视觉呈现、更高的信息密度及双向交互能力,且便于通过链接分享。
推荐理由:作者基于 Claude Code 实际工作流,详细拆解了 HTML 替代 Markdown 在信息密度、交互性及分享效率上的具体优势与提示词技巧。
Google DeepMind 发布 AlphaEvolve 一周年回顾,展示该 Gemini 驱动的编码智能体在数学、计算机科学及工业界的显著影响。在科研方面,它帮助将电网优化可行解率从 14% 提升至 88%,并在量子物理中使分子模拟误差降低 10 倍。
推荐理由:AlphaEvolve 团队回顾其作为 Gemini 驱动的编码智能体在科学发现、基础设施优化及商业应用中的具体成效,展示了算法自进化对多领域的加速作用。
在 Code with Claude 大会上,Anthropic CEO Dario Amodei 和总裁 Daniela Amodei 指出,2026 年第一季度营收和使用量年化增速达 80 倍,远超原本按 10 倍准备的算力规划,这是 Claude 持续限速的直接原因。
推荐理由:整理自官方对话,披露了算力增速与限速的因果及组织级AI趋势,为理解当前开发瓶颈提供内部视角。
OpenAI 在与 Elon Musk 和 Microsoft 的诉讼中取得进展,并结束因 $50B Amazon 交易引发的法律风险。DeepSeek 预览新模型 DeepSeek v4,称其缩小了与前沿模型的差距。
Anthropic Claude Code 创建者 Boris Cherny 在 Sequoia 大会上分享观点,认为编程正从手写代码转向管理 Agent,并指出 Anthropic 内部已实现无手写代码开发。
推荐理由:文章整理了 Claude Code 创建者关于编程范式转变、SaaS 护城河重构及组织流程领先性的核心观点,为理解 AI 对软件工程的影响提供了具体视角。
OpenAI 发布 GPT-5.5,xAI 推出 Grok Voice Think Fast 1.0,DeepSeek 开源 V4。Google 拟向 Anthropic 投资至多 $40B,Meta 收购 Manus 受阻。最新研究聚焦模型对 AI 安全研究的潜在破坏行为。
多数公司因愿景模糊、工作流混乱,无法向 AI 下达清晰指令,导致其难以发挥执行优势。只有具备高度自我认知、能明确定义目标与核心指标的企业,才能真正借助 AI 提升竞争力。技术成熟度并非瓶颈,企业缺乏清晰的业务描述才是阻碍 AI 落地的根本原因。
Google DeepMind 宣布启动 AI co-clinician 研究计划,旨在探索 AI 如何作为协作成员增强医生专业能力并提升护理质量。该研究在盲测评估中显示,AI co-clinician 在98个初级保健查询案例中有97例未出现关键错误,且在开放式药物知识问答上超越其他前沿模型。
推荐理由:原文展示了AI在真实临床查询中零关键错误及多模态远程诊疗的模拟评估,为理解医疗AI从文本向实时交互演进提供了具体数据支撑。
OpenAI 推出擅长文本生成的 ChatGPT Images 2.0,阿里 Qwen 3.6 Max Preview 转为仅 API 模式。Moonshot AI 开源 1T 参数 MoE 模型 Kimi K2.6,MiniMax M 2.7 在 SWE-Pro 得分 56.22%。
Google DeepMind CEO Demis Hassabis 在 YC 访谈中指出,当前 AI 范式距离 AGI 仍有 50% 概率需要一两个关键突破,主要缺失在于持续学习、长程推理和记忆机制。
推荐理由:Google DeepMind CEO 详细拆解了 AGI 缺失的关键拼图、智能体投入产出比争议以及科学发现的本质,为理解当前 AI 瓶颈提供了权威视角。
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中提出,2025 年 12 月是其个人编程体验的转折点,AI 生成代码从“需修补”变为“直接可用”。
推荐理由:Karpathy 区分了 Vibe Coding 抬高下限与 Agentic Engineering 保住上限,并指出 LLM 能力呈锯齿状分布,为理解 AI 编程现状提供了清晰框架。
Hermes Agent 采用四层记忆架构(固化提示词、SQLite 会话搜索、技能索引、Honcho 用户建模),核心逻辑是保持系统提示词稳定以利用缓存,将繁杂信息交由工具按需检索。该设计严格限制 MEMORY.md 和 USER.md 的字符容量(合计约 1300 Token),并通过“记忆冲刷”机制在对话压缩前保存关键事实,区别于 OpenClaw 的流水账式日志存储。
Ed Zitron 指出 AI 行业的经济账根本算不通,以 GitHub Copilot 将于 2026 年 6 月改为按用量计费为例,揭示了长期补贴算力导致的不可持续性。文章认为基于 LLM 的月费订阅模式因推理成本波动剧烈而存在严重缺陷,并警告 OpenAI 和 Anthropic 等公司面临巨大的数据中心资本开支压力,若无法实现承诺的收入增长将引发系统性风险。
推荐理由:文章通过拆解 GitHub Copilot 转向按用量计费的案例,深入分析了 AI 订阅模式背后的算力成本错配与数据中心经济风险。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作伙伴关系,将在首尔设立 AI Campus。双方将利用 AlphaEvolve、AlphaFold 等前沿模型加速生命科学与气候研究,并深化在 AI 安全及人才培养领域的协作。
Ramp 高管 Teddy Riker 撰文指出,随着 Salesforce 推出 Headless 360 等动作,软件交互正从“用户-界面”转向“用户-Agent-软件 Agent”。作者通过 Notion MCP 强制读取 Markdown 规范、Ramp 收集调用理由及 Slack 格式缺失等案例,提出为 Agent 设计产品的核心在于主动提供成功所需的上下文与反馈机制,而非仅发布接口。