Hacker News · AI· merksittich·· 1 天前AI 评分65
Epoch AI 发布 InnovationEval:前沿模型难以独立复现人类算法创新
Recent AI models struggled to match a human algorithmic innovation
AI 导读
Epoch AI 推出 InnovationEval 评估基准,旨在测试 AI 能否独立发现与人类研究者相当的机器学习技术创新。在针对 on-policy self-distillation (SDPO) 方法的端到端研发任务中,Claude Fable 5 和 GPT-5.6 Sol 等前沿模型即便消耗数千美元 GPU 算力,也未能取得接近人类水平的进展。
来源:Hacker News · AI · epoch.ai