宝玉分享 AI 原生思维:像训练大模型一样训练自己
宝玉在腾讯学堂分享 AI 原生思维,提出做 AI 产品需盯着模型能力边界找需求,并通过高保真原型快速验证、围绕 Agent 重设工作流。他以自研字幕翻译 App BaoCut 为例,展示了从模拟人类字幕组到让 Agent 自主执行验收的迭代过程,强调人的角色应转向定义问题与结果验收。
宝玉在腾讯学堂分享 AI 原生思维,提出做 AI 产品需盯着模型能力边界找需求,并通过高保真原型快速验证、围绕 Agent 重设工作流。他以自研字幕翻译 App BaoCut 为例,展示了从模拟人类字幕组到让 Agent 自主执行验收的迭代过程,强调人的角色应转向定义问题与结果验收。
宝玉解读 Claude 博文《How Warp builds self-improving agents on Claude》,介绍 Warp 通过两个 Skill(基础审查与改进)结合人类 PR 评论实现 Agent 自我进化的方案。
Casey Muratori 指出软件性能常被行业忽视,主张在架构设计阶段即考虑性能,而非依赖后期 Profiler 优化。他建议开发者学习阅读汇编以理解 CPU 机制,并批评“过早优化是万恶之源”的观点导致架构缺陷难以修复。
金融科技平台 Ramp 开发了名为 Inspect 的内部背景编码智能体,目前其合并的 PR 中有 75% 由该工具发起。Inspect 基于 OpenCode 构建,运行在云端沙箱中,支持无限并发会话、内部数据源集成以及前后端变更验证。团队认为本地机器限制、前端工具需求及远程开发环境是促使他们放弃第三方产品并自研的关键原因。
宝玉分享其使用 Claude Code 和 Fable 5 为 BaoCut App 添加远程转录功能的完整复盘,提出 AI 原生开发本质是传统流程但执行主体变为 Agent。
AI 显著加速了大型代码库的框架迁移,Asana 利用 AI 在两周内完成了 Enzyme 测试框架的大规模重写。Airbnb 和 Uber 也分享了类似案例,表明 AI 非常适合处理此类迁移任务。
Addy Osmani 分享从构建 Chrome DevTools 到 AI 开发的职业路径,指出 AI 辅助编程的最大风险是“认知投降”,即开发者对问题理解的退化。他提倡通过“循环工程”实现人与智能体的相互增强,并强调软件工程师因具备问责能力而不可替代。
The Pragmatic Engineer 指出当前大量 CTO 和 VP of Engineering 等高层正选择离职或休整,主要源于对 AI 转型压力的应对失败及初创公司股权价值缩水。
Honeycomb CTO Charity Majors 认为 Opus 4.5 与 Claude Code 促使 AI 成为软件工程的代际变革,类比云计算对基础设施的影响。她指出代码生成经济已变,人类应聚焦验证系统而非代码审查,并主张工程需构建能安全发布未读代码的体系。
The Pragmatic Engineer 深度解析自营交易公司 Optiver 的软件工程体系,揭示其以最小化延迟为核心、自研硬件及内核级优化的技术栈。随着传统套利机会减少,AI 模型正取代单纯的低延迟成为新的竞争差异点。
Fable 5 之后,作者将 Coding Agent 使用角色从 Tech Lead 转为 Engineering Manager,不再细看代码而专注全局验收。通过 /goal 指令让 Agent 执行方案与测试,技术选型不再受限于个人技能树,如 BaoCut 项目改用 Rust 实现跨平台。此时人的瓶颈从写代码转变为想清楚需求,若构思不清则无法发挥 Agent 生产力。
宝玉分享对 GitHub 热门项目 Caveman 的实测分析,该项目旨在让 AI 像原始人一样说话以节省 Token,README 声称能节省 65%。JetBrains 的测试显示,在 Claude Code 运行 86 个真实编程任务时,Caveman 实际仅节省 8.5% 的输出 Token,且未显著影响任务质量。
Claude Code 团队发布指南,将 AI 智能体循环定义为重复执行工作周期直至满足停止条件,并划分为回合制、目标导向、基于时间和主动式四种类型。文章针对每种循环给出了触发方式、停止条件及适用场景,例如使用 /goal 设定明确完成标准,或通过 /loop 和 /schedule 实现周期性任务自动化。
推荐理由:原文系统梳理了四种循环模式及其触发停止机制,提供了控制 Token 消耗与保障代码质量的具体操作建议。
Codex 官方团队成员 jxnlco 发布指南,介绍如何通过组合持久对话流、语音输入、任务干预与排队等功能,将 Codex 从单一编程助手扩展为全能电脑工作代理。
作者拒绝依赖 LLM 进行“凭感觉编程”,认为其无法解决软件开发的本质复杂性,且缺乏对抽象局限性的元认知。LLM 消除的仅是偶然复杂性,而摩擦是理解代码架构与发现设计缺陷的关键线索。盲目追求速度可能导致逻辑谬误,如 DOGE 团队因照单全收数据字面意思而得出错误结论。
Anthropic Claude Code 和 Cowork 产品线工程与产品负责人 Fiona Fung 在 Code with Claude 2026 大会上分享了 AI 时代管理工程团队的经验。
资深开发者因身处“管理复杂性”循环,常以维护成本为由拒绝需求,导致与追求“消除不确定性”的业务团队沟通失效。文章指出其核心价值在于利用现有资源快速验证假设,建议将“减少代码”转化为“更快获得确定性”的解决方案,从而弥合认知分歧。
文章深入解析了包裹在大语言模型之外的软件架构 Agent Harness,指出其包含编排循环、工具、记忆等 12 个核心组件。通过改变底层架构而非模型本身,即可显著提升系统在 TerminalBench 2.0 等基准测试中的表现。
Claude Code 团队成员 Thariq 提出在 AI 智能体工作流中优先使用 HTML 而非 Markdown 作为输出格式。HTML 能提供更丰富的视觉呈现、更高的信息密度及双向交互能力,且便于通过链接分享。
推荐理由:作者基于 Claude Code 实际工作流,详细拆解了 HTML 替代 Markdown 在信息密度、交互性及分享效率上的具体优势与提示词技巧。
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中提出,2025 年 12 月是其个人编程体验的转折点,AI 生成代码从“需修补”变为“直接可用”。
推荐理由:Karpathy 区分了 Vibe Coding 抬高下限与 Agentic Engineering 保住上限,并指出 LLM 能力呈锯齿状分布,为理解 AI 编程现状提供了清晰框架。
Hermes Agent 采用四层记忆架构(固化提示词、SQLite 会话搜索、技能索引、Honcho 用户建模),核心逻辑是保持系统提示词稳定以利用缓存,将繁杂信息交由工具按需检索。该设计严格限制 MEMORY.md 和 USER.md 的字符容量(合计约 1300 Token),并通过“记忆冲刷”机制在对话压缩前保存关键事实,区别于 OpenClaw 的流水账式日志存储。
Vibe Coding 被比作中年男人的钓鱼,是一种合法且体面的独处方式。AI 大幅降低了编程门槛,让中年人无需苦学技术即可通过简单提示词快速生成工具,重获“我说了算”的创造快感与自我主宰体验。
宝玉分享《Why Your “AI-First” Strategy Is Probably Wrong》一文,认为 AI First 的本质是软件工程 First,人需从代码编写转向关键节点判断。
本文介绍了生成-验证者、调度-子智能体、智能体团队、消息总线和共享状态这五种多智能体协作模式。每种模式针对不同的任务结构(如质量评估、并行处理、事件驱动或高度协作)具有特定的优势与局限,例如调度模式易成信息瓶颈而共享状态需防范死循环。建议从最简单的“调度-子智能体”模式起步,根据实际瓶颈逐步演进,或在生产环境中混合使用多种模式以平衡协调成本与系统灵活性。
作者指出频繁开启新会话会触发全价上下文重建从而增加成本,建议理解提示缓存机制后优先在活跃会话中继续工作。文中详细说明了缓存前缀匹配与存活时间规则,提供了禁用 1M 上下文及设置自动压缩阈值的 JSON 配置代码。此外还列出了精简 CLAUDE.md、限制模型阅读范围及使用子智能体隔离上下文等六条操作规则以减少 Token 消耗。
推荐理由:原文基于提示缓存机制纠正了频繁开新会话的习惯,并给出了模型切换与上下文压缩的具体配置方法。
Sebastian Raschka 发布指南,结合其开源的 Mini Coding Agent 详细拆解了编程智能体(Coding Agent)的六大核心组件:实时代码仓库上下文、提示词形态与缓存复用、工具接入与调用、上下文瘦身、结构化会话记忆以及任务委派与受限子智能体。
针对 Claude Code 50 多万行泄漏源码,作者提出四步学习法:先跑起来、以点带线分析功能、动手二次开发、最后从零搭建架构。强调闭源优势在于隐藏防蒸馏逻辑与 /buddy 等彩蛋,Anthropic 回应称问题源于流程而非个人。
宝玉撰文分析飞书开源 lark-cli 的现象,指出在 AI Agent 时代,CLI 因具备自描述性、文本交互天然适配以及不占用上下文窗口等优势,正重新成为主流接口。
推荐理由:文章结合飞书 CLI 开源案例,深入剖析了 AI Agent 时代命令行工具回归的技术逻辑与产品设计要点。
宝玉提出用“离当前生产力的距离”和“知识保鲜期长短”两个维度构建四象限图,以辅助判断哪些 AI 新事物值得投入时间。该方法将信息分为直接跳过、维持地图感、动手试试和深度投入四类策略,并指出同一事物在不同阶段会在象限间移动,建议通过用户群体、背后投入和形态收敛三个信号判断其趋势。
Anthropic Claude Code 团队工程师 Thariq Shihipar 分享了内部使用 Skills 加速开发的实战经验,梳理出九类常见 Skill 模式及编写最佳实践。
推荐理由:原文总结了 Anthropic 内部数百个 Skills 的分类体系与编写技巧,提供了从库参考到运维自动化的具体落地方法。
文章提出了智能体工程(Agentic Engineering)的八个等级,涵盖从 Tab 补全、上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体到自主智能体团队的演进路径。