Reflection发布开放权重模型Beam,称其以更低推理算力比肩中国开源模型
Reflection AI公布首款前沿开放权重模型Beam,称其在高级推理基准上达到Z.ai的GLM-5.2水平,并以3-4x更少的推理算力超过领先的西方开放模型。
Reflection AI公布首款前沿开放权重模型Beam,称其在高级推理基准上达到Z.ai的GLM-5.2水平,并以3-4x更少的推理算力超过领先的西方开放模型。
OpenAI、Anthropic 等实验室过去一年宣布解决多项长期数学难题,其中包括一项千禧年大奖难题,但这些突破也引发数学界反弹。争议涉及研究成果是否使用了数学家的工作、证明是否充分,以及 AI 实验室如何避免重蹈覆辙。
Qwen3.8-27B 的基准测试考察模型能否计算正整数之和,并仅用英文单词给出准确结果。禁用推理时,模型数值准确率为 23.57%;启用 medium reasoning 后,在 169 次单次测试中答对 167 次。
OpenAI 发布 GPT-6 系列模型指南,帮助初创公司选择 GPT-6 模型并为生产环境准备工作流。指南还涉及调整推理力度、改进提示词与技能,以及协调工具。
AlphaGo 核心成员 Thore Graepel 认为,LLM 的链式推理仍是反复进行下一 token 预测,不等同于 AlphaGo 搜索未来局面的独立推理机制。文章指出,LLM 通常缺少可检查、持续更新的认知状态,知识与推理过程难以分离,思维链也可能事后编造;作者主张让系统显式记录信念、依据证据修正判断,并形成可审计的推理过程。
Latent Space 采访 MIT 的 Alex Zhang,讨论 RLM、GPU kernels、研究选题,以及 harness 如何帮助模型处理长上下文并提升跨任务组合泛化。Alex 介绍了 RLM 的上下文卸载、代码执行和递归调用子智能体机制,并认为学术研究者可以押注起初看似微小或古怪的问题;访谈还涉及多智能体系统、工具调用与模型能力过剩。
OpenAI 的 GPT-6 Astra Ultrafast 运行于 NVIDIA Blackwell GPU,现已通过 OpenAI API 向开发者提供,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:材料比较了 Astra Ultrafast 与 Standard 模式的生成速度,并联系编码智能体的多轮工具工作流,说明响应延迟如何影响交互节奏。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作和网络防御,目前通过 Fairwind Program 向政府用户及可信网络防御者开放有限预览。Google 称该模型在发布的 19 项基准中有 13 项排名第一,并通过 Long Decode Continuation 将输出扩展至最多 1M tokens;摘要所附基准表也显示,各项测试的结果并非均领先。
推荐理由:这篇汇总并列出 Argon 与 Astra、Claude Opus 5.5 等模型的多项基准结果,也交代了有限预览范围和长输出机制,便于同时了解性能比较与当前可用性。
Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。
推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。
NVIDIA 与 CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,并推出模型与智能体训练、评估和改进环境 CoreWeave Forge。
推荐理由:文章把 Vera Rubin 的生产部署、Vera CPU 测试和 Forge 的训练改进流程放在同一案例中,呈现从推理到持续优化的具体做法。
Google Research 提出 Diffusion Controller,将图像去噪过程建模为连续控制问题,统一图像生成的引导与微调方法。基于 Stable Diffusion v1.4 的实验使用 HPS-v2 评测;轻量附加网络在匹配人类偏好方面优于行业标准,完全解锁版本相较基线模型的胜率为 90%。
Google Research 提出 Retrieve-for-Train,用离线强化学习发现符合奖励目标的查询扩展方式,再将其蒸馏到轻量扩散检索器,以单次推理生成互补的子查询集合。该框架的扩散模型有 53.9M 参数,可直接把查询嵌入映射为完整目标嵌入集合,绕过文本 CoT 推理 token;训练还使用 Gemma3-4B 和 Qwen3-4B。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化、成本高效的语音交互和高复杂度任务。
推荐理由:两款模型分别面向规模化语音交互与高复杂度任务,并提供多项语音和智能体任务基准结果,便于比较其定位与性能表现。
Import AI 470 聚焦 SPADE 自动生成训练环境、Hawkeye 改进 GPU 内核,以及机器权利议题。SPADE 让 LLM 在生成可执行训练环境与尝试解决环境之间交替,并用 Qwen3 骨干模型测试;Qwen3-30B-A3B 在游戏环境套件中平均得分 58.3,较基础模型高 8.1。
Berkeley AI Research 的文章梳理了 Adaptive Parallel Reasoning(APR),即让模型在推理时自行决定是否并行、拆分多少线程以及如何协调。文章比较了固定并行与自适应方案,并解析 KV cache 聚合、训练方式和效率奖励设计,同时列出评测差异与部署中的开放问题。
推荐理由:文章梳理了 APR 与固定并行方案在任务拆分、KV cache 聚合和训练奖励上的差异,呈现了其效率目标与部署取舍。
Berkeley AI Research 介绍 GRASP,一种面向学习型世界模型的梯度规划器,旨在让长时域规划更稳健、更快。它将轨迹提升为虚拟状态以并行优化,在状态迭代中加入随机噪声,并重塑梯度以保留动作梯度、避开脆弱的状态输入梯度。
Berkeley AI Research 介绍 SPEX 和 ProxySPEX 两种算法,用于在大规模机器学习系统中识别影响模型行为的特征、训练数据和模型组件交互。