跳到正文
热点事件持续更新

Qwen3.8 27B 英文加法基准测试结果公布

1 篇报道1 个报道来源19 小时前更新

先了解这件事

AI 综述

2026年10月5日,Simon Willison 发布了一项针对 Qwen3.8-27B-Q4_K_M.gguf 模型的基准测试,考察其在推理功能关闭时能否用英文单词表达整数加法的结果。该实验受 GPT-4o 早期同类实验启发,在 DGX Spark 本地硬件上完成。测试结果显示,在 5,070 个样本中,数字准确率仅为 23.57%:一位到三位数的加法表现较好,准确率达 97.04%;而十位到十三位数的加法则大幅下降至 6.44%。此外,格式合规率为 96.17%,说明模型输出格式基本符合要求。作为对比,开启推理模式后,模型在 169 对测试中答对了 167 次。该实验表明,关闭推理时该模型在大数字英文加法任务上表现较差,但小数字和开启推理后表现良好。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 用英文单词做加法的测试

    一项基准测试考察 Qwen3.8-27B-Q4_K_M.gguf 在推理关闭时能否用英文单词表达整数加法结果。在 5,070 个样本中数字准确率仅 23.57%,一位到三位数可达 97.04%,十位到十三位数降至 6.44%,格式合规率 96.17%。开启推理后 169 对测试答对 167 次,实验受 GPT-4o 早期同类实验启发,在 DGX Spark 本地硬件上完成。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。