MarkTechPost· Michal Sutter·· 5 小时前AI 评分40
NVIDIA 提出 PivotOPD 方法,提升多轮 AI Agent 从关键错误中恢复的能力
NVIDIA PivotOPD Teaches Multi-Turn AI Agents to Recover From Pivotal Mistakes
AI 导读
NVIDIA 联合普林斯顿大学等推出 PivotOPD,一种针对多轮 LLM Agent 的在线策略蒸馏方法。该方法在 Qwen3-1.7B/8B 模型上实现 72.7% 的关键错误恢复率,远超标准 OPD 的 20.3%,并在 ALFWorld 等基准测试中取得最佳平均成绩。PivotOPD 不增加推理成本,但依赖可重放环境且代码尚未开源。
来源:MarkTechPost · marktechpost.com