Qwen3.8-27B 用英文单词表达整数加法结果的测试
Qwen3.8-27B 的基准测试考察模型能否计算正整数之和,并仅用英文单词给出准确结果。禁用推理时,模型数值准确率为 23.57%;启用 medium reasoning 后,在 169 次单次测试中答对 167 次。
Qwen3.8-27B 的基准测试考察模型能否计算正整数之和,并仅用英文单词给出准确结果。禁用推理时,模型数值准确率为 23.57%;启用 medium reasoning 后,在 169 次单次测试中答对 167 次。
Anthropic Frontier Red Team 从内部 Binary Exploitation benchmark 中随机选取 100 项任务评估多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
NVIDIA 发布开源表格基础模型 Kumo Tabular,用于表格分类和回归,可根据带标签的上下文行在一次前向传播中预测新行,无需训练、调参或特征工程。模型有 28M 至 215M 参数的三种尺寸,以人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四项基准上排名第一。
推荐理由:文章交代了人工合成表格预训练的构建方式,并列出四项基准结果,便于了解该模型的训练设计与评测表现。