跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 41–60 条 · 共 68 条
9月2日周三
  1. Google AI68

    Google 启动 Fairwind 计划,向政府与企业开放高级 AI 网络防御能力

    Google 推出 Fairwind 计划,向政府、关键基础设施运营商及可信合作伙伴提供受限访问权限,利用其最先进的人工智能进行主动网络防御。该计划整合了 Gemini 3.8 Flash Cyber 模型与 CodeMender 框架,使防御者能够在安全的云环境中以代理规模自主发现、验证并修复代码漏洞,将原本需数周的手动修复过程缩短至几分钟。

    推荐理由:原文披露了面向政府与企业的受限访问计划,结合 Gemini 3.8 Flash Cyber 与 CodeMender 实现漏洞自动修复,展示了 AI 在主动网络防御中的具体落地路径。

  2. 宝玉的分享82

    Anthropic 发布高效电商 AI 智能体构建指南

    Anthropic 发布电商 AI 智能体构建指南,提出“单一模型+技能+工具”的核心架构以替代子智能体方案。文章详细阐述了通过提示词缓存、并行工具调用和 UI 组件工具化来降低延迟与成本的方法,并给出了跨会话记忆管理、代码层安全校验及非确定性系统评估的生产环境最佳实践。

    推荐理由:原文提供了电商智能体从架构设计到生产运维的完整工程指南,包含具体的延迟优化技巧与评估方法。

8月27日周四
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 发布最新语音转文字模型 Gemini 3.5 Transcribe,旨在实现精准且智能的实时转录。该模型在 Artificial Analysis 测试中流式和非流式平均词错率分别为 4.0% 和 2.6%,支持超过 85 种语言及最多三个说话人的身份识别。

    推荐理由:原文给出了新模型的流式与非流式词错率数据、多语言支持范围以及开发者 API 接入方式,读者可以据此评估其在实时交互场景中的实际表现。

8月14日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.7 Flash:面向编码与智能体的主力模型

    Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main (43.6% vs 34.4%) 和 DeepSWE v1.1 (65.3% vs 49.0%) 等基准测试中显著优于前代,并在 GDP.pdf 和 AutomationBench 上展现更强的推理能力。

    推荐理由:新模型在代码生成和复杂文档处理上显著提升,且价格减半,适合评估其在生产环境中的成本效益。

7月28日周二
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Robotics 2 系列模型

    Google DeepMind 推出 Gemini Robotics 2 系列模型,赋予机器人全身智能控制、精细灵巧操作及多机协作能力。该系列包含用于视觉语言动作控制的 VLA 模型、作为高层大脑的 ER 推理模型以及支持快速适配新硬件的端侧模型。目前 ER 模型已在 Google AI Studio 上线,VLA 和端侧模型向早期合作伙伴开放。

    推荐理由:原文详细拆解了全身体控制、灵巧操作及多机协作的技术实现,为理解通用物理AI的落地路径提供了具体参考。

7月21日周二
7月17日周五
7月11日周六
  1. 宝玉的分享82

    ChatGPT、Codex 与 Work 功能区别及额度机制详解

    文章详细解析了 OpenAI 旗下 Chat、Work 和 Codex 三种模式的核心差异:Chat 用于问答,Work 面向跨应用知识工作并交付成品,Codex 专注代码仓库开发任务。

    推荐理由:原文通过对比表格和场景举例,清晰拆解了 Chat、Work 和 Codex 的功能边界与额度机制,帮助读者快速建立正确的使用预期。

7月6日周一
  1. 宝玉的分享78

    Claude Code 团队详解 AI 智能体循环类型与实践指南

    Claude Code 团队发布指南,将 AI 智能体循环定义为重复执行工作周期直至满足停止条件,并划分为回合制、目标导向、基于时间和主动式四种类型。文章针对每种循环给出了触发方式、停止条件及适用场景,例如使用 /goal 设定明确完成标准,或通过 /loop 和 /schedule 实现周期性任务自动化。

    推荐理由:原文系统梳理了四种循环模式及其触发停止机制,提供了控制 Token 消耗与保障代码质量的具体操作建议。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 内置计算机操作功能

    Gemini 3.5 Flash 现已将计算机操作(computer use)作为内置工具支持,此前该能力仅存在于独立的 Gemini 2.5 模型中。开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面环境进行感知、推理及行动的自定义智能体。

    推荐理由:原文说明了计算机操作能力从独立模型整合进主模型的变化,并给出了针对提示注入风险的安全措施与开发入口。

6月16日周二
  1. Google DeepMind65

    Google DeepMind 发布 AI Control Roadmap 以保障 AI Agent 安全

    Google DeepMind 发布 AI Control Roadmap,提出针对内部 AI Agent 的纵深防御框架,将未信任的智能体视为潜在内部威胁。该方案基于 MITRE ATT&CK 构建威胁模型,通过可信 AI 监督、行为分析及分级响应机制(D1-D4/R1-R3)来应对模型能力增长带来的安全风险。

    推荐理由:原文公开了内部 AI 控制路线图及百万级智能体轨迹分析数据,为行业提供了可参考的纵深防御框架与实时监测实践。

6月9日周二
  1. Google DeepMind82

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,这是一款旨在在笔记本电脑上运行的高性能多模态模型。该模型采用统一的无编码器架构,视觉和音频输入直接流入 LLM 主干,无需传统独立编码器,从而降低延迟和内存占用。

    推荐理由:原文给出了无编码器统一架构和16GB显存本地运行门槛,读者可以据此判断其在笔记本上实现多模态智能体的可行性。

5月17日周日
5月16日周六
  1. Google DeepMind65

    DeepMind发布Co-Scientist辅助发现肝纤维化重定位药物的研究

    斯坦福大学Gary Peltz团队利用Google DeepMind的Co-Scientist加速寻找治疗肝纤维化的重定位药物。相关研究发表于Advanced Science,Peltz让Co-Scientist提出三个候选药物并解释推理过程,同时自己基于文献选出两个候选。

    推荐理由:原文展示了Co-Scientist在药物重定位任务中的具体表现,对比了AI筛选与人类专家选药的实际实验结果。

  2. Google DeepMind92

    Google DeepMind 发布 Gemini 3.5 Flash 模型

    Google DeepMind 发布 Gemini 3.5 系列并率先推出 3.5 Flash 模型,该模型主打智能体工作流与编码能力,已在 Terminal-Bench 2.1、GDPval-AA 和 MCP Atlas 等基准测试中超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:原文给出了新模型在智能体与编码基准上的具体分数及速度对比,读者可据此评估其实际性能表现。

5月12日周二
  1. Google DeepMind82

    Google DeepMind 推出 Co-Scientist 多智能体科研助手

    Google DeepMind 发布基于 Gemini 构建的多智能体 AI 系统 Co-Scientist,旨在通过迭代生成、辩论和演化假设来加速科学研究。该系统包含生成、反思、排名和演化等专用智能体,并引入类似 AlphaGo 的“想法锦标赛”机制对假设进行验证和排序。

    推荐理由:原文展示了多智能体协作生成假设的具体机制及在肝病、ALS等领域的实测案例,为科研人员评估AI辅助发现工具提供了可参考的落地场景。

5月8日周五
  1. 宝玉的分享78

    Claude Code 用户指南:为何用 HTML 替代 Markdown 作为 AI 输出格式

    Claude Code 团队成员 Thariq 提出在 AI 智能体工作流中优先使用 HTML 而非 Markdown 作为输出格式。HTML 能提供更丰富的视觉呈现、更高的信息密度及双向交互能力,且便于通过链接分享。

    推荐理由:作者基于 Claude Code 实际工作流,详细拆解了 HTML 替代 Markdown 在信息密度、交互性及分享效率上的具体优势与提示词技巧。

5月6日周三
  1. Google DeepMind75

    Google DeepMind 发布 AlphaEvolve 年度影响报告:Gemini 驱动的智能体如何跨领域扩展价值

    Google DeepMind 发布 AlphaEvolve 一周年回顾,展示该 Gemini 驱动的编码智能体在数学、计算机科学及工业界的显著影响。在科研方面,它帮助将电网优化可行解率从 14% 提升至 88%,并在量子物理中使分子模拟误差降低 10 倍。

    推荐理由:AlphaEvolve 团队回顾其作为 Gemini 驱动的编码智能体在科学发现、基础设施优化及商业应用中的具体成效,展示了算法自进化对多领域的加速作用。

  2. 宝玉的分享80

    Anthropic 高管对话:解释 Claude 限速原因并展望组织级 AI

    在 Code with Claude 大会上,Anthropic CEO Dario Amodei 和总裁 Daniela Amodei 指出,2026 年第一季度营收和使用量年化增速达 80 倍,远超原本按 10 倍准备的算力规划,这是 Claude 持续限速的直接原因。

    推荐理由:整理自官方对话,披露了算力增速与限速的因果及组织级AI趋势,为理解当前开发瓶颈提供内部视角。