跳到正文
热点事件观察中

Qwen3.8-27B英文单词加法表达评测:位数增加准确率骤降

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月5日,AI研究员Simon Willison在本地DGX Spark上对Qwen3.8-27B-Q4_K_M.gguf模型进行基准测试,考察其将正整数加法结果完全用英语单词表达的能力。测试采用无推理模式。结果显示,该模型整体数值准确率仅为23.57%,但格式合规率高达96.17%。值得注意的是,性能随操作数位数增加而急剧下降:1-3位数操作数时准确率达97.04%,而10-13位数操作数时准确率仅6.44%。测试表明,尽管模型在格式控制上表现良好,但在处理较大数字的英文单词转换时存在明显困难,位数增加导致准确率骤降超90个百分点。

AI 根据报道生成 · 5 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    本地 Qwen3.8 27B 模型用英语单词表达加法结果的基准测试

    Simon Willison 在本地 DGX Spark 上对 Qwen3.8-27B-Q4_K_M.gguf 进行了基准测试,考察其将正整数加法结果完全用英语单词表达的能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。