跳到正文
10月3日 · 周六

最新精选

10月2日周五
  1. 量子位78

    openJiuwen发布X-Router自演进模型路由技术,实测减少50%以上Token消耗

    openJiuwen团队发布X-Router自演进模型路由技术,通过动态决策实现Agent请求的模型最优选择。实测数据显示,在PinchBench评测中开启Bandit自演进后,相比全云基线得分仅低0.66个百分点,但模型调用成本整体降低约44.6%;在Terminal-Bench测试中,cost focused模式下成本降低51.4%,成功率达Opus的95.2%。

    推荐理由:原文展示了智能路由在降低Token消耗的同时保持任务质量的具体实测数据,为Agent成本优化提供了可参考的技术路径。

9月30日周三
  1. The Decoder78

    DeepSeek 为华为 Ascend 芯片发布开源软件 TileLang

    DeepSeek 联合华为推出面向 Ascend 芯片的开源编程工具 TileLang,旨在构建独立于 CUDA 的软件生态。该语言由北京大学研究人员开发,被 DeepSeek 视为比 CUDA 更易用的通用编程语言。SemiAnalysis 分析指出,尽管 OpenAI 自研芯片测试显示 CUDA 优势减弱,但在智能体工作负载上 Nvidia 仍保持领先。

    推荐理由:报道梳理了 DeepSeek 与华为合作发布 TileLang 的背景,以及 SemiAnalysis 对 CUDA 护城河现状的评估。

  2. 量子位80

    DeepSeek发布DSec技术报告:面向大规模Agent训练的沙盒基础设施

    DeepSeek在知乎独家发布技术长文并公开arXiv论文,首次系统阐释了支撑DeepSeek-V4系列模型训练、评测与数据预处理的弹性计算基础设施DSec。该设施通过统一接入多种执行后端、分层可组合的环境、镜像按需加载及高密度资源管理等核心机制,解决了Agent训练中沙盒创建突发、状态持续保留及资源闲置等挑战。

    推荐理由:原文详细披露了支撑大规模智能体训练的沙盒基础设施DSec的技术细节与生产数据,为理解高效Agent训练环境提供了具体工程参考。

9月29日周二
  1. GitHub Blog73

    GitHub 开源 AI 安全智能体任务流:如何发现 24 个 Android 漏洞

    GitHub Security Lab 发布了开源的 Taskflow Agent,通过定制化的提示词工作流自动化 Android 应用的安全审计,目前已协助发现并报告了 24 个漏洞。

    推荐理由:GitHub Security Lab 开源了用于 Android 漏洞审计的 AI 任务流,提供了具体的 Prompt 设计思路和两个高危漏洞挖掘案例。

9月28日周一
  1. ByteByteGo78

    ByteByteGo 解析 Machine Payments Protocol (MPP):AI Agent 如何自主完成支付

    ByteByteGo 发布深度分析文章,解读由 Stripe 和 Tempo 共同发起的 Machine Payments Protocol (MPP),该协议旨在让 AI Agent 无需人类介入即可自主完成互联网支付。

    推荐理由:文章详细拆解了MPP协议的技术实现与微支付场景,为开发者提供了应对AI智能体成为主要客户时的技术准备思路。

9月25日周五
  1. GitHub Blog75

    GitHub Security Lab 发布 AI 驱动的 Taskflow Agent 用于自动化模糊测试

    GitHub Security Lab 发布了 Fuzzing Taskflow,这是一个针对 C/C++ 项目的自主模糊测试管道,由 GitHub Security Lab Taskflow Agent 框架驱动。

    推荐理由:GitHub Security Lab 开源了基于 LLM Agent 的自动化模糊测试流水线,展示了如何将人工覆盖率分析与崩溃分诊交给智能体执行。

9月22日周二
  1. PyTorch68

    vLLM 推出硬件无关模型层以兼顾前沿性能与多硬件兼容

    vLLM 引入新的“硬件无关”(HW agnostic)模型层,旨在解决内部实现变更导致与 fullgraph torch.compile 不兼容的问题,从而支持非 NVIDIA 加速器、旧款 GPU 及多样化模型。

    推荐理由:vLLM 引入硬件无关层以平衡前沿性能优化与多硬件兼容性,在 H100 上实现接近原生实现的吞吐量。

  2. PyTorch78

    Shopify 如何利用 PyTorch 和 vLLM 构建持续学习循环

    Shopify 通过 PyTorch 和 vLLM 建立持续学习循环,将生产失败数据转化为模型权重更新,使 GraphQL Agent 在超越前沿模型质量的同时降低 96% 的服务成本。该流程包括定义质量评估标准、校准 LLM 裁判、利用自动研究优化基线、通过监督微调和 GRPO 强化学习更新参数,以及使用 Gist 压缩技术减少提示词长度以提升推理速度。

    推荐理由:原文详细拆解了从定义质量到模型微调及提示词压缩的完整闭环,为构建自进化AI系统提供了可复用的工程路径。

  3. NVIDIA63

    NVIDIA 发布 Isaac ROS 5.0 推进智能体开源机器人开发

    NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包,旨在通过引入新的智能体工作流帮助人类和 AI Agent 共同构建机器人。

    推荐理由:NVIDIA 发布 Isaac ROS 5.0,引入支持 AI Agent 的工作流和 GPU 加速包,帮助开发者与智能体协作构建机器人应用。

  4. PyTorch60

    TinyTorch:从零构建 PyTorch 兼容的纯 Python 机器学习框架教程

    Harvard 与 ETH Zurich 的研究者发布 TinyTorch,这是一个允许用户从张量到 Transformer 逐步构建工作 ML 框架的开源课程。

    推荐理由:作者分享了构建教学版框架的完整方法论,包括 API 对齐、硬件下限设定及教师基础设施设计,为开源课程建设提供了可复用的工程经验。

9月15日周二
  1. The Pragmatic Engineer83

    Gergely Orosz 探访 OpenAI:Codex 如何重塑软件工程流程

    Gergely Orosz 通过实地访谈揭示 OpenAI 内部已全面转向以 Codex 为核心的“智能体软件工厂”,非工程团队使用率从 0% 飙升至 90%,IDE 使用量显著下降。文章详细描述了从上下文收集、智能体代码审查到自动部署的闭环流程,指出 PR 数量激增导致 CI/CD 负载增加约 10 倍,并探讨了原生移动端发布瓶颈及未来工程角色向产品判断力转变的趋势。

    推荐理由:作者实地探访 OpenAI,揭示了 Codex 如何取代 IDE 成为核心工具,以及智能体在代码审查、部署和监控中的自动化实践。

9月2日周三
  1. 宝玉的分享82

    Anthropic 发布高效电商 AI 智能体构建指南

    Anthropic 发布电商 AI 智能体构建指南,提出“单一模型+技能+工具”的核心架构以替代子智能体方案。文章详细阐述了通过提示词缓存、并行工具调用和 UI 组件工具化来降低延迟与成本的方法,并给出了跨会话记忆管理、代码层安全校验及非确定性系统评估的生产环境最佳实践。

    推荐理由:原文提供了电商智能体从架构设计到生产运维的完整工程指南,包含具体的延迟优化技巧与评估方法。

7月6日周一
  1. 宝玉的分享78

    Claude Code 团队详解 AI 智能体循环类型与实践指南

    Claude Code 团队发布指南,将 AI 智能体循环定义为重复执行工作周期直至满足停止条件,并划分为回合制、目标导向、基于时间和主动式四种类型。文章针对每种循环给出了触发方式、停止条件及适用场景,例如使用 /goal 设定明确完成标准,或通过 /loop 和 /schedule 实现周期性任务自动化。

    推荐理由:原文系统梳理了四种循环模式及其触发停止机制,提供了控制 Token 消耗与保障代码质量的具体操作建议。

5月8日周五
  1. 宝玉的分享78

    Claude Code 用户指南:为何用 HTML 替代 Markdown 作为 AI 输出格式

    Claude Code 团队成员 Thariq 提出在 AI 智能体工作流中优先使用 HTML 而非 Markdown 作为输出格式。HTML 能提供更丰富的视觉呈现、更高的信息密度及双向交互能力,且便于通过链接分享。

    推荐理由:作者基于 Claude Code 实际工作流,详细拆解了 HTML 替代 Markdown 在信息密度、交互性及分享效率上的具体优势与提示词技巧。

4月29日周三
  1. 宝玉的分享78

    Karpathy 访谈:Vibe Coding 只是开始,Agentic Engineering 才是关键

    Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中提出,2025 年 12 月是其个人编程体验的转折点,AI 生成代码从“需修补”变为“直接可用”。

    推荐理由:Karpathy 区分了 Vibe Coding 抬高下限与 Agentic Engineering 保住上限,并指出 LLM 能力呈锯齿状分布,为理解 AI 编程现状提供了清晰框架。

4月6日周一
  1. 宝玉的分享80

    Claude Code 省 Token 指南:慎用 1M 上下文,不开新会话或者总是开新会话都不对

    作者指出频繁开启新会话会触发全价上下文重建从而增加成本,建议理解提示缓存机制后优先在活跃会话中继续工作。文中详细说明了缓存前缀匹配与存活时间规则,提供了禁用 1M 上下文及设置自动压缩阈值的 JSON 配置代码。此外还列出了精简 CLAUDE.md、限制模型阅读范围及使用子智能体隔离上下文等六条操作规则以减少 Token 消耗。

    推荐理由:原文基于提示缓存机制纠正了频繁开新会话的习惯,并给出了模型切换与上下文压缩的具体配置方法。

3月28日周六
  1. 宝玉的分享78

    宝玉分析飞书 CLI 开源及 AI Agent 时代命令行工具回归原因

    宝玉撰文分析飞书开源 lark-cli 的现象,指出在 AI Agent 时代,CLI 因具备自描述性、文本交互天然适配以及不占用上下文窗口等优势,正重新成为主流接口。

    推荐理由:文章结合飞书 CLI 开源案例,深入剖析了 AI Agent 时代命令行工具回归的技术逻辑与产品设计要点。

3月17日周二
  1. 宝玉的分享78

    Anthropic Claude Code 团队分享 Skills 构建经验与分类体系

    Anthropic Claude Code 团队工程师 Thariq Shihipar 分享了内部使用 Skills 加速开发的实战经验,梳理出九类常见 Skill 模式及编写最佳实践。

    推荐理由:原文总结了 Anthropic 内部数百个 Skills 的分类体系与编写技巧,提供了从库参考到运维自动化的具体落地方法。

已经到底了