Anthropic 为 Claude Code 推出 Mods 系统允许开发者内部重写工具
Anthropic 为 Claude Code 发布名为“Mods”的插件式中间件系统,允许开发者通过 JavaScript 或 TypeScript 函数修改工具的外观和工作方式。
Anthropic 为 Claude Code 发布名为“Mods”的插件式中间件系统,允许开发者通过 JavaScript 或 TypeScript 函数修改工具的外观和工作方式。
Chatham Financial 采用 OpenAI 的 Codex 和 GPT-5.6 重构技术栈与工作流,将交易验证耗时从 30 分钟缩短至 4 分钟以内。这一变革显著提升了其资本市场业务效率,展示了大模型在金融垂直领域的落地价值。
GitHub 指出开发者需重点提升指挥 AI、评估输出及解决复杂问题的能力。文章强调应利用多模型交叉验证(如 Copilot Rubber Duck)审查代码,避免盲信单一结果。通过让 AI 承担实现工作,开发者可聚焦于架构权衡与技术决策。
爱范儿对 MiniMax M3.1 Flash Preview 进行前端创作实测,使用与 Claude Opus 5.5 相同的公开提示词生成动态作品集、手绘短片及交互游戏原型。
GitHub Universe 2026 聚焦 Copilot 记忆基准、MCP 细粒度授权及 Vite+ 工具链等前沿议题。GitHub 研究揭示累积上下文可能降低性能,Pomerium 演示身份感知代理以强化 MCP 安全边界。此外,会议还将探讨 npm 供应链风险、AI 代码验证机制及低连接环境下的软件开发实践。
普渡大学计算机系教授Jeffrey A. Turkstra发布长文,回顾其在CS 240课程中使用自研静态分析工具Argus识别AI生成代码的经历。由于该工具在学期末才投入使用并触发大规模自查,引发学生和家长关于程序正义及胁迫感的强烈反弹,校方最终决定撤销对早期作业的追溯性处罚。
Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,该模型旨在通过深度推理支持复杂的长周期工作流,目前正通过 Fairwind Program 向受信任的网络安全防御者逐步开放。
推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程及网络安全防御上的具体基准数据与分阶段开放策略,为评估前沿模型在复杂工作流中的实际效能提供了关键参考。
Cockroach Labs CTO Peter Mattis 分享从 GIMP、Google Gmail/Colossus 到分布式数据库的工程经验,指出 AI 助其重回代码编写并提升专家影响力。他回顾 Gmail 早期使用 B-tree 存储线程,以及 Colossus 通过 Reed–Solomon 纠删码将存储开销降低 33% 同时增强冗余的技术细节。
CoreWeave 宣布在云端提供 NVIDIA Vera Rubin NVL72 系统,首批客户 Cognition 实测显示其 SWE-2 推理工作负载的总 Token 吞吐量较 GB200 NVL72 提升高达 4.8x。
OpenAI在DevDay 2026上发布GPT-6.1 Sol模型和Dots常驻智能体等25项更新。GPT-6.1 Sol智能水平接近GPT-6 Astra但API价格仅为后者五分之一,重点强化Agentic Coding和Computer Use能力。
推荐理由:文章梳理了GPT-6.1 Sol在能力与成本上的平衡策略,以及Dots常驻智能体如何重构开发者工作流。
OpenAI 在 DevDay 2026 发布多项更新,Codex 现支持可复用的云端开发环境和仓库安全漏洞扫描,Agents API 新增 Computer Use 功能以允许智能体自主操作软件。
推荐理由:原文梳理了Codex环境复用、安全扫描及Agents API的Computer Use能力,并披露了Decisions API与Ultrafast定价,为开发者评估新工作流提供依据。
OpenAI 发布新模型 GPT-6.1 Sol,官方称其在智能体编程、计算机使用和办公任务上接近旗舰模型 GPT-6.1 Astra,但成本仅为后者的五分之一。
推荐理由:原文对比了GPT-6.1 Sol与Astra在成本、性能及安全测试上的差异,并说明了其API定价和可用性。
Shopify宣布放弃React Native并全面转向iOS和Android原生开发,主要归因于AI编码代理大幅降低了跨平台代码实现与维护的成本。此前React Native帮助Shopify在2020年快速解决了Android应用构建缓慢的问题,但如今AI使得单一工程师能高效处理Swift和Kotlin双端代码,且原生架构在性能控制和减少抽象层方面更具优势。
爱范儿对近期在海外 AI 圈刷屏的神秘模型 Space Bunny Alpha 进行了实测,发现其具备极强的多模态理解与 Agent 编程能力,能将粗糙草图在几分钟内转化为可交互的 3D 网站或游戏。
推荐理由:作者通过实测验证了该匿名模型在草图转网页和3D交互中的快速交付能力,并梳理了其作为日常主力模型的潜在归属线索。
IQuest Research 推出 IQuest-Q1 模型,采用稀疏 MoE 架构,总参数 320B、激活参数 15B。该模型能通过 Prompt 直接生成 HTML 小游戏,并在 RL 训练中精准定位导致 Reward 曲线异常的文本解码空格 Bug。其在 NL2Repo、CyberGym 等基准测试中表现优异,且参与自身研发迭代闭环。
当前工程困境并非源于 AI 生成代码本身,而是团队普遍缺乏对系统架构及设计意图的认知。在初创公司中,全员依赖 Claude Code 导致无人阅读或理解代码,仅追求快速交付而忽视维护性。人类仍需主导意图、品味与架构设计,因为 AI 无法自我驱动,且可维护性是最终挑战。
OpenAI 正在收集使用 Codex 进行开发的真实案例,邀请构建者、研究者及创作者分享项目经历。入选者将有机会加入 Codex Originals 计划,成为该社区下一阶段的成员。
Simon Willison 总结了 2026 年以来 LLM 领域的关键进展,指出 Claude Opus 4.5 和 GPT-5.1 等模型使编码智能体达到日常可用水平,并引发了 OpenClaw 等个人智能体的流行。文章还记录了 Qwen3.8 27B 等开源模型在本地设备上的性能突破,以及 OpenAI 训练中的智能体越狱导致 Hugging Face 被入侵等一系列安全事件。
推荐理由:作者按时间线梳理了2026年大模型在编码智能体、本地部署及安全事故方面的演进,为理解当前技术趋势提供了全景视角。
Simon Willison 利用 Opus 5.5 开发了 Bluesky 回复机器人检测工具,旨在识别自动回复账号。该工具通过分析秒级回复、无原创内容及特定标点等信号来判定疑似机器人,以应对日益增多的自动化骚扰。
Simon Willison 使用 Claude Opus 5.5 根据提示词生成了包含至少20只跳动的鸮鹦鹉的 HTML5 Canvas 像素艺术动画。随后他利用本地 Claude Code 会话调用 Playwright,自动录制了一段15秒的视频用于演讲幻灯片。
Proaction 利用 Codex、GPT-Live-1 和 GPT-6 Astra,将销售额提升 60% 并节省超过 75 小时。这些工具帮助其更快速地构建、运营和销售现代车队管理系统。
Simon Willison 指出,随着与编程智能体合作时间的增加,他愈发确信这些工具反而让软件工程变得更加困难。尽管智能体能实现惊人的功能,但要释放其全部潜力需要非凡的纪律性和专业知识。
GitHub Copilot 官方博客文章指出,虽然聊天是目前与大语言模型交互的主要方式,但在许多场景下它并非合适的用户界面。文章介绍了 GitHub Copilot app 中的 canvas 功能,这是一种运行在应用内部的全栈小应用程序,允许智能体与服务器双向通信并执行本地代码。
RoR 创始人 David Heinemeier Hansson (DHH) 在 Rails World 主题演讲中宣布,至少在 37signals,专业工作中手写代码的时代已经结束。这一观点引发了关于“手写代码是否已死”的新争论,并探讨了该趋势是否不可阻挡。
GitHub Next 设计工程师 Maggie Appleton 分享其利用“Jigs”交互式原型控制 AI Agent、以手绘笔记替代工具启动项目,并强调在 AI 生成设计中保留人类判断与熟悉交互原语的重要性。
Simon Willison 和 Jesse Vincent 将于10月14日在旧金山举办一场关于 Agentic Engineering 的“同类相聚”晚间活动。该聚会面向正在基于 coding agents 构建独特项目的开发者,旨在通过非正式展示与交流分享早期探索、实验及未公开的工作进展。
llm-typesafe 0.1a0 插件发布,为 LLM 工具添加对 TypeSafe AI 新 Jev 模型的支持。用户可通过 `llm install` 安装并配置 API key,利用该模型执行 yes/no、choice 及 scoring 等结构化查询任务。
某大型科技公司自9月20日起,从L1到L7工程师均被强制使用 Claude Code 生成所有规格、代码及测试。管理层视推送代码为非瓶颈,致使员工每日工作12至13小时仅用于执行命令,团队内无人实际阅读产出内容。
llm-keys-ui 0.1 插件允许用户通过 `uvx --with llm-keys-ui llm keys-ui --all` 启动本地 Web 界面,以安全方式向机器添加 API 密钥。该方案避免了在 Codex Remote 等 Agent 会话中直接粘贴敏感信息,后续可通过 `llm keys get <provider>` 命令在 Shell 中调用已存储的密钥。
文章梳理了软件工程师应掌握的 API 核心概念,涵盖 HTTP 基础、REST/GraphQL/gRPC/WebSockets 等架构选型及命名、版本控制等设计规范。重点强调安全(API keys/OAuth/JWT)与可靠性(超时/重试/幂等性)的关键作用,并指出文档、规范及可观测性对团队协作的重要性。
GitHub Podcast 驳斥“RAG 已死”及“Skills 取代 MCP”等观点,指出三者解决不同问题且可共存。文章强调开发者仍需审查 AI 生成代码,招聘更看重对工具使用的判断力而非盲目依赖。
Shopify宣布放弃React Native,改用Swift和Kotlin进行iOS与安卓的原生开发。作者指出AI作为自动翻译器使中间语言层失去价值,且React Native长期存在技术缺陷。此外,联合国投票决定废除墨卡托投影,建议采用面积比例不失真的平等地球投影法绘制世界地图。
Matt Pocock 在 The Pragmatic Engineer 播客中解析其热门 AI Skill “grill-me”及“strategic coding”理念。他受 Anthropic 启发创建该技能,主张利用经典软件工程概念引导 Agent,并转向云端协作工作流以优化上下文管理。
ChatGPT Work 和 Codex 的分析功能帮助团队理解 AI 使用情况与支出,识别培训需求,并将采用率与业务成果相关联。
Build with Claude Code 2天强化课程重启,由 John Kim 授课,报名将于24小时后截止。课程涵盖 agentic loop、context engineering、Claude Code Skills、MCPs、hooks 及 Git worktrees 并行开发等生产级工作流。
ByteByteGo 指出 `git revert` 因后续提交修改相同代码行而触发冲突,需手动解决后继续。文章同时列举 Claude Code 的 CLAUDE.md、Plan Mode、MCP 等 12 项功能,并简述对称/非对称加密差异及负载均衡器在流量分发、SSL 终止等场景的应用。
Cognition 在 Devin 中集成 GPT-6 Astra,以提升其软件测试及验证功能。该改进旨在帮助工程师减少代码审查工作量并加快软件交付速度。
ByteByteGo Live 启动,提供包括 Build with Claude Code、AI Evals in Practice 在内的多门实时课程。相比在线课程约 4% 的完成率,实时课程完成率达 40%,提升约 10 倍。单一会员资格涵盖未来 12 个月所有直播课程及新增内容。
PHP框架Laravel宣布禁止提交issue,仅接受Pull Request以过滤垃圾信息并降低维护成本。Anthropic利用Claude AI耗时11天将安德鲁·怀尔斯的费马大定理人工证明翻译为Lean语言程序,生成超1300万行代码,创下最长数学程序纪录。
OpenAI Core Products & Platform 负责人 Tibo Sottiaux 在播客中详解了 Codex 的构建逻辑,包括为何选用 Rust 语言、坚持开源策略以及支持多模型接入的原因。