热点事件持续更新
Jevman开源AI吃豆人基准测试
1 篇报道1 个报道来源22 小时前更新
先了解这件事
AI 综述
2026年10月9日,开发者在Hacker News上发布了名为Jevman的开源基准测试工具。该工具旨在评估AI模型在经典游戏《吃豆人》中的决策能力,通过HTTP端点让模型与幽灵进行对战。根据规则,每个参与测试的AI模型需完成100局游戏,且每一步决策必须在2秒内完成,若超时则触发备用规则以继续游戏。Jevman支持多种类型的模型参与排名,包括托管模型、微调模型以及本地运行的模型。此外,该工具强调可复现性,所有对局过程均可被验证和重现,为AI在实时策略游戏中的表现提供了标准化的评测环境。
AI 根据报道生成 · 1 小时前更新
最新进展10月9日 00:34
Jevman发布开源基准测试,评估AI在吃豆人游戏中限时决策能力。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- Hacker News · AIShow HN:Jevman 开源基准测试 AI 模型玩吃豆人
Jevman 是一个开源基准测试,让 AI 模型通过 HTTP 端点与经典幽灵对战吃豆人游戏。每个模型需进行 100 局游戏,每步决策限时 2 秒,超时则触发备用规则。该工具支持托管模型、微调模型及本地运行模型参与排名,所有对局均可复现验证。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。