GPT-5.6 Sol 如何助力运行量子计算实验
MIT 研究人员利用 GPT-5.6 Sol 结合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该工作流展示了大模型在复杂科学实验自动化中的实际应用潜力。
MIT 研究人员利用 GPT-5.6 Sol 结合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该工作流展示了大模型在复杂科学实验自动化中的实际应用潜力。
Gergely Orosz 分析了 AI Agent 导致 Pull Request 数量激增后,工程团队如何应对代码审查压力的现状。文中总结了五种主要策略:由人类审查 AI 生成的审查意见、按变更风险等级分流处理、仅审查计划或测试而非具体实现、限制 AI 生成代码规模以及坚持全人工审查。
1Password 工程师利用 Codex 快速构建新功能及内部工具,使工程生产力提升 21%。该方案在确保代码达到生产就绪状态的同时,严格维持了高安全策略标准。
OpenAI 披露内部编码智能体正在重塑 AI 研究,提供关于智能体使用、实验速度及任务复杂性的早期数据。这些工具通过提升实验迭代效率,显著加速了前沿模型的研发进程。
OpenClaw 2.0版本发布,合并16000个PR且无代码审查,体现AI主导的开发模式。SolidJS创始人指出AI导致技术栈向React等主流方案单一化迁移。韩国计划向公民免费提供无限Token并分配512个英伟达B200芯片以推广本土大模型。
Meta 发布 Muse Spark 1.3,提升编码与智能体性能,正通过 Muse Code 和 API 逐步推出。Google 推出 Gemini 3.8 Flash,在保持 3.7 Flash 定价的同时优化多步推理能力,并发布用于漏洞检测的 Flash Cyber 变体。
Google DeepMind 推出 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,旨在提升智能体工作流与网络安全能力。
推荐理由:原文展示了新模型在长周期编码和网络安全领域的具体性能提升及成本优势,为评估其在复杂工作流中的实际价值提供了直接依据。
宝玉解读 Claude 博文《How Warp builds self-improving agents on Claude》,介绍 Warp 通过两个 Skill(基础审查与改进)结合人类 PR 评论实现 Agent 自我进化的方案。
Casey Muratori 指出软件性能常被行业忽视,主张在架构设计阶段即考虑性能,而非依赖后期 Profiler 优化。他建议开发者学习阅读汇编以理解 CPU 机制,并批评“过早优化是万恶之源”的观点导致架构缺陷难以修复。
金融科技平台 Ramp 开发了名为 Inspect 的内部背景编码智能体,目前其合并的 PR 中有 75% 由该工具发起。Inspect 基于 OpenCode 构建,运行在云端沙箱中,支持无限并发会话、内部数据源集成以及前后端变更验证。团队认为本地机器限制、前端工具需求及远程开发环境是促使他们放弃第三方产品并自研的关键原因。
宝玉分享其使用 Claude Code 和 Fable 5 为 BaoCut App 添加远程转录功能的完整复盘,提出 AI 原生开发本质是传统流程但执行主体变为 Agent。
AI 显著加速了大型代码库的框架迁移,Asana 利用 AI 在两周内完成了 Enzyme 测试框架的大规模重写。Airbnb 和 Uber 也分享了类似案例,表明 AI 非常适合处理此类迁移任务。
Addy Osmani 分享从构建 Chrome DevTools 到 AI 开发的职业路径,指出 AI 辅助编程的最大风险是“认知投降”,即开发者对问题理解的退化。他提倡通过“循环工程”实现人与智能体的相互增强,并强调软件工程师因具备问责能力而不可替代。
Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main (43.6% vs 34.4%) 和 DeepSWE v1.1 (65.3% vs 49.0%) 等基准测试中显著优于前代,并在 GDP.pdf 和 AutomationBench 上展现更强的推理能力。
推荐理由:新模型在代码生成和复杂文档处理上显著提升,且价格减半,适合评估其在生产环境中的成本效益。
Honeycomb CTO Charity Majors 认为 Opus 4.5 与 Claude Code 促使 AI 成为软件工程的代际变革,类比云计算对基础设施的影响。她指出代码生成经济已变,人类应聚焦验证系统而非代码审查,并主张工程需构建能安全发布未读代码的体系。
The Pragmatic Engineer 深度解析自营交易公司 Optiver 的软件工程体系,揭示其以最小化延迟为核心、自研硬件及内核级优化的技术栈。随着传统套利机会减少,AI 模型正取代单纯的低延迟成为新的竞争差异点。
Fable 5 之后,作者将 Coding Agent 使用角色从 Tech Lead 转为 Engineering Manager,不再细看代码而专注全局验收。通过 /goal 指令让 Agent 执行方案与测试,技术选型不再受限于个人技能树,如 BaoCut 项目改用 Rust 实现跨平台。此时人的瓶颈从写代码转变为想清楚需求,若构思不清则无法发挥 Agent 生产力。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在提升 AI 智能体的构建效率与可靠性。
推荐理由:原文给出了三款新模型在效率、延迟和特定场景下的具体性能数据与定价,读者可以据此评估其在智能体工作流中的实际落地价值。
Anthropic 推出 Claude Sonnet 5,主打限时折扣定价与增强的智能体编码能力,并部署了新的网络安全分类器。Etched 获得价值 10 亿美元的推理硬件需求,中国开源 LongCat 2.0 MoE 模型展示大规模训练效率。Google 同步上线 NotebookLM 视频摘要功能及 Nano Banana 2 Lite 图像生成器。
Anthropic 因政府命令切断 Fable 5 和 Mythos 5 访问权限,SpaceX 以约 $1.75T 估值完成 IPO 并斥资 $60B 收购 AI 编程初创公司 Cursor。ChatGPT 市场份额首次跌破 50%,Moonshot 发布 Kimi K2.7-Code,NVIDIA 推出 Nemotron 3 Ultra 等开源模型。
Google DeepMind 推出基于 Gemini 3.5 Flash 微调的轻量级网络安全模型 Gemini 3.5 Flash Cyber,旨在高效查找、验证和修补软件漏洞。
推荐理由:原文展示了轻量级模型在代码安全扫描中的成本与效率优势,并给出了通过多次调用提升发现率的工程实践。
宝玉分享对 GitHub 热门项目 Caveman 的实测分析,该项目旨在让 AI 像原始人一样说话以节省 Token,README 声称能节省 65%。JetBrains 的测试显示,在 Claude Code 运行 86 个真实编程任务时,Caveman 实际仅节省 8.5% 的输出 Token,且未显著影响任务质量。
Claude Code 团队发布指南,将 AI 智能体循环定义为重复执行工作周期直至满足停止条件,并划分为回合制、目标导向、基于时间和主动式四种类型。文章针对每种循环给出了触发方式、停止条件及适用场景,例如使用 /goal 设定明确完成标准,或通过 /loop 和 /schedule 实现周期性任务自动化。
推荐理由:原文系统梳理了四种循环模式及其触发停止机制,提供了控制 Token 消耗与保障代码质量的具体操作建议。
Codex 官方团队成员 jxnlco 发布指南,介绍如何通过组合持久对话流、语音输入、任务干预与排队等功能,将 Codex 从单一编程助手扩展为全能电脑工作代理。
作者拒绝依赖 LLM 进行“凭感觉编程”,认为其无法解决软件开发的本质复杂性,且缺乏对抽象局限性的元认知。LLM 消除的仅是偶然复杂性,而摩擦是理解代码架构与发现设计缺陷的关键线索。盲目追求速度可能导致逻辑谬误,如 DOGE 团队因照单全收数据字面意思而得出错误结论。
宝玉翻译并分享了 Anthropic 发布的《创始人手册》,指导创业者如何利用 AI 重塑初创公司生命周期。文章将创业分为构思、MVP、发布和扩展四个阶段,分别介绍了如何使用 Chat、Claude Cowork 和 Claude Code 进行市场调研、智能体编程、流程自动化及安全审查。
Google DeepMind 发布 Gemini 3.5 系列并率先推出 3.5 Flash 模型,该模型主打智能体工作流与编码能力,已在 Terminal-Bench 2.1、GDPval-AA 和 MCP Atlas 等基准测试中超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。
推荐理由:原文给出了新模型在智能体与编码基准上的具体分数及速度对比,读者可据此评估其实际性能表现。
Anthropic Claude Code 和 Cowork 产品线工程与产品负责人 Fiona Fung 在 Code with Claude 2026 大会上分享了 AI 时代管理工程团队的经验。
资深开发者因身处“管理复杂性”循环,常以维护成本为由拒绝需求,导致与追求“消除不确定性”的业务团队沟通失效。文章指出其核心价值在于利用现有资源快速验证假设,建议将“减少代码”转化为“更快获得确定性”的解决方案,从而弥合认知分歧。
Claude Code 团队成员 Thariq 提出在 AI 智能体工作流中优先使用 HTML 而非 Markdown 作为输出格式。HTML 能提供更丰富的视觉呈现、更高的信息密度及双向交互能力,且便于通过链接分享。
推荐理由:作者基于 Claude Code 实际工作流,详细拆解了 HTML 替代 Markdown 在信息密度、交互性及分享效率上的具体优势与提示词技巧。
Anthropic Claude Code 创建者 Boris Cherny 在 Sequoia 大会上分享观点,认为编程正从手写代码转向管理 Agent,并指出 Anthropic 内部已实现无手写代码开发。
推荐理由:文章整理了 Claude Code 创建者关于编程范式转变、SaaS 护城河重构及组织流程领先性的核心观点,为理解 AI 对软件工程的影响提供了具体视角。
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中提出,2025 年 12 月是其个人编程体验的转折点,AI 生成代码从“需修补”变为“直接可用”。
推荐理由:Karpathy 区分了 Vibe Coding 抬高下限与 Agentic Engineering 保住上限,并指出 LLM 能力呈锯齿状分布,为理解 AI 编程现状提供了清晰框架。
Vibe Coding 被比作中年男人的钓鱼,是一种合法且体面的独处方式。AI 大幅降低了编程门槛,让中年人无需苦学技术即可通过简单提示词快速生成工具,重获“我说了算”的创造快感与自我主宰体验。
宝玉分享《Why Your “AI-First” Strategy Is Probably Wrong》一文,认为 AI First 的本质是软件工程 First,人需从代码编写转向关键节点判断。
作者指出频繁开启新会话会触发全价上下文重建从而增加成本,建议理解提示缓存机制后优先在活跃会话中继续工作。文中详细说明了缓存前缀匹配与存活时间规则,提供了禁用 1M 上下文及设置自动压缩阈值的 JSON 配置代码。此外还列出了精简 CLAUDE.md、限制模型阅读范围及使用子智能体隔离上下文等六条操作规则以减少 Token 消耗。
推荐理由:原文基于提示缓存机制纠正了频繁开新会话的习惯,并给出了模型切换与上下文压缩的具体配置方法。
OpenAI Codex 团队产品负责人 Alexander Embiricos 和开发者体验负责人 Romain Huet 在访谈中透露,团队几乎不写产品规格文档,即使写也仅有约 10 个要点。
Sebastian Raschka 发布指南,结合其开源的 Mini Coding Agent 详细拆解了编程智能体(Coding Agent)的六大核心组件:实时代码仓库上下文、提示词形态与缓存复用、工具接入与调用、上下文瘦身、结构化会话记忆以及任务委派与受限子智能体。
针对 Claude Code 50 多万行泄漏源码,作者提出四步学习法:先跑起来、以点带线分析功能、动手二次开发、最后从零搭建架构。强调闭源优势在于隐藏防蒸馏逻辑与 /buddy 等彩蛋,Anthropic 回应称问题源于流程而非个人。
Notion联合创始人Simon Last在访谈中透露自2025年夏天起不再手写代码,并分享了Notion AI系统的演进历程。Notion的AI harness大约每六个月推倒重写一次,团队经历多次失败后于2026年2月发布可自主运行的Custom Agent。
推荐理由:访谈披露了Notion每六个月重写AI系统层的策略,以及从直接做事工具转向管理Agent平台的定位变化。
Anthropic Claude Code 团队工程师 Thariq Shihipar 分享了内部使用 Skills 加速开发的实战经验,梳理出九类常见 Skill 模式及编写最佳实践。
推荐理由:原文总结了 Anthropic 内部数百个 Skills 的分类体系与编写技巧,提供了从库参考到运维自动化的具体落地方法。