跳到正文
今天10月6日周二2 条
10月5日周一
10月3日周六
10月2日周五
  1. MIT Technology Review · AI54

    AlphaGo 核心成员 Thore Graepel:LLM 并不具备真正推理能力

    AlphaGo 核心成员 Thore Graepel 认为,LLM 的链式推理仍是反复进行下一 token 预测,不等同于 AlphaGo 搜索未来局面的独立推理机制。文章指出,LLM 通常缺少可检查、持续更新的认知状态,知识与推理过程难以分离,思维链也可能事后编造;作者主张让系统显式记录信念、依据证据修正判断,并形成可审计的推理过程。

  2. Latent Space58

    Latent Space 访谈 MIT 的 Alex Zhang:研究选题、RLM 与智能体 harness

    Latent Space 采访 MIT 的 Alex Zhang,讨论 RLM、GPU kernels、研究选题,以及 harness 如何帮助模型处理长上下文并提升跨任务组合泛化。Alex 介绍了 RLM 的上下文卸载、代码执行和递归调用子智能体机制,并认为学术研究者可以押注起初看似微小或古怪的问题;访谈还涉及多智能体系统、工具调用与模型能力过剩。

  3. NVIDIA Blog80

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 运行于 NVIDIA Blackwell GPU,现已通过 OpenAI API 向开发者提供,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。

    推荐理由:材料比较了 Astra Ultrafast 与 Standard 模式的生成速度,并联系编码智能体的多轮工具工作流,说明响应延迟如何影响交互节奏。

10月1日周四
  1. Latent Space85

    Google DeepMind 发布 Gemini 4 Argon,支持通过 Long Decode Continuation 输出最多 1M tokens

    Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作和网络防御,目前通过 Fairwind Program 向政府用户及可信网络防御者开放有限预览。Google 称该模型在发布的 19 项基准中有 13 项排名第一,并通过 Long Decode Continuation 将输出扩展至最多 1M tokens;摘要所附基准表也显示,各项测试的结果并非均领先。

    推荐理由:这篇汇总并列出 Argon 与 Astra、Claude Opus 5.5 等模型的多项基准结果,也交代了有限预览范围和长输出机制,便于同时了解性能比较与当前可用性。

  2. Google DeepMind82

    Google 发布 Gemini 4 Argon,面向复杂工作流并分阶段开放

    Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。

    推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。

9月30日周三
9月16日周三
  1. Google Research48

    Google Research 的 Retrieve-for-Train:绕过推理瓶颈,加速复杂 AI 搜索

    Google Research 提出 Retrieve-for-Train,用离线强化学习发现符合奖励目标的查询扩展方式,再将其蒸馏到轻量扩散检索器,以单次推理生成互补的子查询集合。该框架的扩散模型有 53.9M 参数,可直接把查询嵌入映射为完整目标嵌入集合,绕过文本 CoT 推理 token;训练还使用 Gemma3-4B 和 Qwen3-4B。

  2. Google DeepMind84

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化、成本高效的语音交互和高复杂度任务。

    推荐理由:两款模型分别面向规模化语音交互与高复杂度任务,并提供多项语音和智能体任务基准结果,便于比较其定位与性能表现。

8月24日周一
5月8日周五
  1. Berkeley AI Research60

    Adaptive Parallel Reasoning 如何让推理模型动态安排并行计算

    Berkeley AI Research 的文章梳理了 Adaptive Parallel Reasoning(APR),即让模型在推理时自行决定是否并行、拆分多少线程以及如何协调。文章比较了固定并行与自适应方案,并解析 KV cache 聚合、训练方式和效率奖励设计,同时列出评测差异与部署中的开放问题。

    推荐理由:文章梳理了 APR 与固定并行方案在任务拆分、KV cache 聚合和训练奖励上的差异,呈现了其效率目标与部署取舍。

4月20日周一
3月13日周五