Qwen3.8-27B 用英文单词表达整数加法结果的测试
Qwen3.8-27B 的基准测试考察模型能否计算正整数之和,并仅用英文单词给出准确结果。禁用推理时,模型数值准确率为 23.57%;启用 medium reasoning 后,在 169 次单次测试中答对 167 次。
Qwen3.8-27B 的基准测试考察模型能否计算正整数之和,并仅用英文单词给出准确结果。禁用推理时,模型数值准确率为 23.57%;启用 medium reasoning 后,在 169 次单次测试中答对 167 次。
Anthropic Frontier Red Team 从内部 Binary Exploitation benchmark 中随机选取 100 项任务评估多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。