跳到正文
热点事件持续更新

Qwen3.8-27B 英文单词加法基准测试结果

1 篇报道1 个报道来源19 小时前更新

先了解这件事

AI 综述

近期,开发者 Simon Willison 对 Qwen3.8-27B 模型进行了英文单词形式的整数加法基准测试。该实验基于 GPT-4o 的早期研究,在 DGX Spark 本地硬件上通过 Codex Remote (GPT-6 Astra) 复现。测试结果显示,当禁用推理功能时,模型以英文单词形式进行计算,数值准确率为 23.57%,格式合规率为 96.17%。然而,当启用 medium reasoning(中等推理)模式后,模型表现显著提升,在 169 次测试中正确回答了 167 次。这一对比突显了推理能力在处理此类非标准数字表示任务时的关键作用。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 英文单词加法基准测试

    Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时以英文单词形式进行整数加法,数值准确率为 23.57%,格式合规率 96.17%。启用 medium reasoning 后,169 次测试中 167 次正确。该实验基于 GPT-4o 早期研究,在 DGX Spark 本地硬件上通过 Codex Remote (GPT-6 Astra) 复现。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。