跳到正文
原文
量子位· henry·· 12 小时前精选AI 评分82

何恺明团队发布多模态视觉原生Harness框架VISTA

何恺明团队发布多模态Harness框架

AI 导读

何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生Harness框架VISTA,让多模态模型直接保存和回看原始画面以辅助推理,无需额外训练基础模型。

推荐理由

原文介绍了VISTA框架如何通过保留原始视觉记忆而非文字摘要来增强多模态模型的推理能力,并给出了在ARC-AGI-3等基准上的具体性能提升数据。

来源:量子位 · qbitai.com