Reflection发布开放权重模型Beam,称其以更低推理算力比肩中国开源模型
Reflection AI公布首款前沿开放权重模型Beam,称其在高级推理基准上达到Z.ai的GLM-5.2水平,并以3-4x更少的推理算力超过领先的西方开放模型。
Reflection AI公布首款前沿开放权重模型Beam,称其在高级推理基准上达到Z.ai的GLM-5.2水平,并以3-4x更少的推理算力超过领先的西方开放模型。
Reka AI 发布 Rho-1 研究预览,这款 19-billion-parameter 全模态模型在单一神经网络中处理和生成文本、图像、视频及机器人控制动作。
Aleph Alpha 发布了 Kolibri,一款拥有 78B 参数的德英语言模型,采用 MoE 架构,每个 token 约激活 3B 参数。公司称,该模型在德语基准上得分为 71%,解码速度快于 GPT OSS A5B、Qwen 3.6 A3B 和 Gemma 4 A4B 等可比模型。
Qwen3.8-27B 的基准测试考察模型能否计算正整数之和,并仅用英文单词给出准确结果。禁用推理时,模型数值准确率为 23.57%;启用 medium reasoning 后,在 169 次单次测试中答对 167 次。
Asta 团队开源 AstaBrief 8B,这是一款根据研究问题和检索到的文献片段生成带引用报告的模型,也已作为 Asta 的 Fast 模式上线。该模型以 Qwen3-8B 为基础,开放模型权重和训练数据;在 Asta 全流程中,Fast 模式平均每份报告耗时 51.1 秒,Thinking 模式为 178.5 秒,约快 3.5 倍。
推荐理由:AstaBrief 的训练经验显示,筛除低引用密度样本比尝试更复杂的过滤组合更有效,为科学报告模型的数据筛选提供了具体参考。
OpenAI 的 GPT-6 Astra Ultrafast 运行于 NVIDIA Blackwell GPU,现已通过 OpenAI API 向开发者提供,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:材料比较了 Astra Ultrafast 与 Standard 模式的生成速度,并联系编码智能体的多轮工具工作流,说明响应延迟如何影响交互节奏。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作和网络防御,目前通过 Fairwind Program 向政府用户及可信网络防御者开放有限预览。Google 称该模型在发布的 19 项基准中有 13 项排名第一,并通过 Long Decode Continuation 将输出扩展至最多 1M tokens;摘要所附基准表也显示,各项测试的结果并非均领先。
推荐理由:这篇汇总并列出 Argon 与 Astra、Claude Opus 5.5 等模型的多项基准结果,也交代了有限预览范围和长输出机制,便于同时了解性能比较与当前可用性。
Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。
推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。
Anthropic Frontier Red Team 从内部 Binary Exploitation benchmark 中随机选取 100 项任务评估多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
NVIDIA 发布开源表格基础模型 Kumo Tabular,用于表格分类和回归,可根据带标签的上下文行在一次前向传播中预测新行,无需训练、调参或特征工程。模型有 28M 至 215M 参数的三种尺寸,以人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四项基准上排名第一。
推荐理由:文章交代了人工合成表格预训练的构建方式,并列出四项基准结果,便于了解该模型的训练设计与评测表现。
H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。
推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,分别侧重创意语音设计与高音量、成本高效的语音生成。
推荐理由:两款模型分别面向创意语音设计与高音量、成本效率场景,并提供逐句表演控制,呈现了语音生成在创作和规模化应用上的不同侧重。
Microsoft Research 发布 RetroChimera 逆合成研究,该模型结合 R-SMILES 2 与 NeuralLoc,并通过学习式集成重排两者提出的反应物预测。在多步合成路线评估中,RetroChimera 在十个具有挑战性的目标中成功完成九个,高于文中对比模型;其实现和权重已开源,也可通过 Microsoft Foundry 使用。
推荐理由:RetroChimera将两种互补的逆合成模型进行学习式重排,并以盲测和多步路线评估展示其表现,呈现了集成方法应对稀有反应的思路。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化、成本高效的语音交互和高复杂度任务。
推荐理由:两款模型分别面向规模化语音交互与高复杂度任务,并提供多项语音和智能体任务基准结果,便于比较其定位与性能表现。
Google DeepMind 和 Google Research 发布全球天气模型 WeatherNext 3,采用实时卫星观测生成逐小时预报,最高可达 5 公里分辨率。模型还加入降水与可再生能源相关预测;在中期全球预报评估中,降水 CRPS 相较基线最高改善 60%,并将接入 Search、Gemini、Google Maps 等产品。
推荐理由:WeatherNext 3 将实时卫星观测与气象站数据用于逐小时全球预报,并针对降水和可再生能源预测提供了具体指标与应用信息。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款开放权重病理研究模型,面向全切片表征学习和肿瘤微环境空间蛋白质组预测。
推荐理由:这组模型将病理基础模型的计算成本与队列规模联系起来,文中给出的性能和资源对比可帮助研究者评估大规模分析的可行性。
Microsoft Research 发布 Skala 1.1,并宣布其已接入 CP2K,正集成至 Psi4、FHI-aims、ORCA 和 VASP。Skala 1.1 的训练数据量是首个公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中有 32 个排名第一,平均加权误差为 2.8 kcal/mol;团队还发布了跟踪不同版本和软硬件平台计算性能的持续更新报告。
推荐理由:Skala 1.1 的精度提升与多软件集成同步推进,文中还介绍了持续更新的性能报告,呈现其走向计算化学工作流的路径。