跳到正文
热点事件持续更新

Jevman开源AI吃豆人基准测试

1 篇报道1 个报道来源22 小时前更新

先了解这件事

AI 综述

2026年10月9日,开发者在Hacker News上发布了名为Jevman的开源基准测试工具。该工具旨在评估AI模型在经典游戏《吃豆人》中的决策能力,通过HTTP端点让模型与幽灵进行对战。根据规则,每个参与测试的AI模型需完成100局游戏,且每一步决策必须在2秒内完成,若超时则触发备用规则以继续游戏。Jevman支持多种类型的模型参与排名,包括托管模型、微调模型以及本地运行的模型。此外,该工具强调可复现性,所有对局过程均可被验证和重现,为AI在实时策略游戏中的表现提供了标准化的评测环境。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Hacker News · AI
    Show HN:Jevman 开源基准测试 AI 模型玩吃豆人

    Jevman 是一个开源基准测试,让 AI 模型通过 HTTP 端点与经典幽灵对战吃豆人游戏。每个模型需进行 100 局游戏,每步决策限时 2 秒,超时则触发备用规则。该工具支持托管模型、微调模型及本地运行模型参与排名,所有对局均可复现验证。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。