跳到正文
热点事件历史事件

Qwen3.8 27B 英文单词加法测试:禁用推理准确率 23.57%

1 篇报道1 个报道来源3 天前更新

先了解这件事

AI 综述

Simon Willison 在 DGX Spark 上测试本地 Qwen3.8-27B-Q4_K_M.gguf 模型能否仅用英文单词表达整数加法结果。禁用推理时,5,070 个用例的数值准确率为 23.57%,格式合规率 96.17%;准确率随位数增加明显下降,一至三位数操作数为 97.04%,十至十三位数降至 6.44%。 启用推理后,他改用每个格子只跑一次样本,在 169 个配对用例中答对 167 个。Willison 称这些是一次性测试,再跑一次结果会不同。

AI 根据报道生成 · 2 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 用英文单词做加法的基准测试

    Simon Willison 在 DGX Spark 上测试本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词表达整数加法结果,禁用推理时 5,070 个用例的数值准确率为 23.57%,格式合规率 96.17%,但准确率从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 个配对用例中答对 167 个。