热点事件持续更新
Qwen3.8 27B 英文加法基准测试结果公布
1 篇报道1 个报道来源19 小时前更新
先了解这件事
AI 综述
2026年10月5日,Simon Willison 发布了一项针对 Qwen3.8-27B-Q4_K_M.gguf 模型的基准测试,考察其在推理功能关闭时能否用英文单词表达整数加法的结果。该实验受 GPT-4o 早期同类实验启发,在 DGX Spark 本地硬件上完成。测试结果显示,在 5,070 个样本中,数字准确率仅为 23.57%:一位到三位数的加法表现较好,准确率达 97.04%;而十位到十三位数的加法则大幅下降至 6.44%。此外,格式合规率为 96.17%,说明模型输出格式基本符合要求。作为对比,开启推理模式后,模型在 169 对测试中答对了 167 次。该实验表明,关闭推理时该模型在大数字英文加法任务上表现较差,但小数字和开启推理后表现良好。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 07:34
基准测试显示 Qwen3.8 27B 关闭推理时英文加法准确率仅23.57%,开启推理后近乎全对。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Simon WillisonQwen3.8 27B 用英文单词做加法的测试
一项基准测试考察 Qwen3.8-27B-Q4_K_M.gguf 在推理关闭时能否用英文单词表达整数加法结果。在 5,070 个样本中数字准确率仅 23.57%,一位到三位数可达 97.04%,十位到十三位数降至 6.44%,格式合规率 96.17%。开启推理后 169 对测试答对 167 次,实验受 GPT-4o 早期同类实验启发,在 DGX Spark 本地硬件上完成。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。