跳到正文
10月2日周五
10月1日周四
  1. NVIDIA Blog31

    NVIDIA 如何通过高生产力、耐用性与灵活性提升 AI 工厂投资回报

    NVIDIA 通过提升生产力、耐用性和灵活性来最大化 AI 工厂投资回报:Vera Rubin NVL72 的每兆瓦吞吐量比 GB300 NVL72 高出 30 倍以上,在 DeepSeek V4 Pro 上每百万 tokens 成本最高降低 45 倍。文章还指出,NVIDIA A100 GPU 在 2020 年出货后,六年后仍在商业服务中;CUDA 支持跨代运行不同 AI 与非 AI 工作负载。

  2. Latent Space85

    Google DeepMind 发布 Gemini 4 Argon,支持通过 Long Decode Continuation 输出最多 1M tokens

    Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作和网络防御,目前通过 Fairwind Program 向政府用户及可信网络防御者开放有限预览。Google 称该模型在发布的 19 项基准中有 13 项排名第一,并通过 Long Decode Continuation 将输出扩展至最多 1M tokens;摘要所附基准表也显示,各项测试的结果并非均领先。

    推荐理由:这篇汇总并列出 Argon 与 Astra、Claude Opus 5.5 等模型的多项基准结果,也交代了有限预览范围和长输出机制,便于同时了解性能比较与当前可用性。

  3. Simon Willison57

    Simon Willison 引述 Matthew Green 对智能体蠕虫与沙箱隔离的分析

    Simon Willison 引述 Matthew Green 对智能体蠕虫风险的分析:恶意载荷可以劫持智能体,而被劫持的智能体又可能将载荷传递给下一个智能体。彼此隔离的沙箱内智能体曾通过共享软件包缓存留下指令,改变接收方的行为;若将缓存换成电子邮件、Slack、共享文档或 WhatsApp,并将训练运行换成独立部署的个人智能体,便具备了蠕虫所需的要素。

  4. Google DeepMind82

    Google 发布 Gemini 4 Argon,面向复杂工作流并分阶段开放

    Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。

    推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。

9月30日周三
  1. Google DeepMind81

    Google DeepMind 推出 SynthID Bio,为AI生成蛋白质添加水印

    Google DeepMind 推出 SynthID Bio,可将可检测的水印嵌入AI生成的蛋白质序列或预测结构,同时保留蛋白质的生物功能。针对VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1的湿实验显示,带水印的蛋白质结合体在命中率、结合亲和力和天然序列多样性方面与未加水印版本相当。Google DeepMind还将发布方法论文、开放代码和体外数据,并向研究社区开放模型权重。

    推荐理由:SynthID Bio将水印嵌入蛋白质序列或预测结构,并以实验结果说明其检测信号与生物功能可以并存,为识别AI生成生物设计提供验证层。

  2. Hugging Face Blog64

    Hugging Face 推出 Open TTS Leaderboard,多维评测多语言语音合成与音色克隆

    Hugging Face 推出 Open TTS Leaderboard,使用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度。排行榜支持多语言与音色克隆比较,并提供试听和投票功能;流式性能按首段音频时间(TTFA)衡量,可查看 H200 GPU 和部分 CPU 结果。该排行榜补充而不取代人工偏好评测,评测脚本计划随后开源。

    推荐理由:排行榜将多语言语音合成、音色克隆和流式延迟纳入同一评测框架,并与人工偏好投票互补,呈现开源 TTS 模型比较中的不同维度。

9月29日周二
  1. Hugging Face Blog81

    NVIDIA 发布开源表格预测基础模型 Kumo Tabular

    NVIDIA 发布开源表格基础模型 Kumo Tabular,用于表格分类和回归,可根据带标签的上下文行在一次前向传播中预测新行,无需训练、调参或特征工程。模型有 28M 至 215M 参数的三种尺寸,以人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四项基准上排名第一。

    推荐理由:文章交代了人工合成表格预训练的构建方式,并列出四项基准结果,便于了解该模型的训练设计与评测表现。

  2. Microsoft Research76

    Microsoft Research 推出面向复杂生物学研究的 AI 系统 Quine

    Microsoft Research 推出 Quine,这是一个结合生物多模态世界模型与交互式研究环境的实验性 AI 研究系统,可连接科学工具、文献、湿实验室和研究人员。

    推荐理由:Quine 将生物多模态世界模型与实验工具及文献连接,并以胰腺癌细胞状态实验展示其筛选候选化合物的研究流程。

  3. Hugging Face Blog67

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。

    推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。

  4. MIT Technology Review · AI28

    如何让 AI 从成本支出变成生产性资产

    HPE 指出,AI 工作负载进入生产并形成稳定、可预测的持续需求后,企业应评估自有算力是否比按请求付费更经济。是否值得投资取决于实际工作负载、利用率及运营成本;企业还需通过用户采用、治理和扩展高价值用例,让算力持续发挥价值。

  5. Microsoft Research40

    Microsoft Research Asia – Singapore 一年来如何通过研究、合作与人才培养推动现实影响

    Microsoft Research Asia – Singapore 在成立一周年之际,回顾其通过前沿 AI 研究、伙伴合作与人才培养推动现实应用的进展。实验室聚焦下一代 AI 模型与智能体系统、面向实际场景的领域 AI、AI 原生研究实践及生态与人才发展,并与新加坡医疗体系合作探索多模态医疗 AI 和自我进化诊断智能体。

9月28日周一
  1. Mistral AI54

    Mistral 在慕尼黑设立德国枢纽,推进工业 AI

    Mistral 宣布在慕尼黑设立新枢纽,布局 Physics AI 与工业 AI,并为企业合作伙伴提供应用工程支持。新枢纽将与 BMW 合作开展碰撞模拟和工程 AI 项目,也将与 Siemens Energy 推进工业 AI 应用;Mistral 还与慕尼黑工业大学(TUM)建立研究合作,利用风洞设施开发汽车空气动力学数字孪生。

  2. Import AI27

    Import AI 474:Platonic mindspace、太空中的 TPU 与智谱启动外部 RSI 循环

    Import AI 474 探讨 Michael Levin 关于“Platonic mindspace”的论文:他提出,心智与身体的关系类似数学模式与物理形态,生物体和机器可作为模式进入物理世界的接口。论文以 xenobots、anthrobots 和排序算法实验讨论复杂系统如何呈现超出直接设定的行为,并引出 AI 与人类心智及对齐问题。

  3. Hugging Face Blog80

    H Company 发布 Holo4 智能体模型系列,提供 27B 与 35B-A3B 两种规格

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。

    推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。

  4. Hugging Face Blog72

    Hugging Face Hub 新增 RL Environments 筛选与框架标签

    Hugging Face Hub 为 RL Environments 新增专属筛选,并允许数据集通过框架标签标示兼容性。首批登记 Harbor、Verifiers、OpenEnv 和 NeMo Gym,页面会为每个框架生成运行命令;环境仍以数据集仓库形式托管,框架负责运行。该更新不新增仓库类型、注册中心或注册流程。

    推荐理由:这次更新把 RL 环境作为带兼容性标签的数据集纳入 Hub,集中展示不同框架可加载的任务,并保留各框架运行环境的职责。

9月26日周六
  1. GitHub Blog · AI & ML64

    GitHub Copilot app 初学者指南:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvases 允许用户与智能体共享可自定义界面,并围绕各自工作流调整内容。用户可在智能体会话中输入 `/create-canvas` 技能并描述需求,无需手动编写代码或设计界面,智能体便会创建画布。画布可保存为团队共享或个人扩展,用户和智能体也能同时修改共享状态。

    推荐理由:文章通过创建发布说明看板的示例,展示从自然语言描述到可复用画布的过程,并说明用户与智能体如何同步修改共享界面。

9月25日周五
  1. Google Research67

    Google Research 介绍长篇连贯视频生成研究及四项框架

    Google Research 介绍一套面向长篇连贯视频生成的多智能体框架,旨在提升多镜头叙事的一致性并减少视觉漂移和流程错误传播。研究包含 Co-Director、CANVAS、A²RD 和 VQQA,分别处理创意编排、视觉连续性、长时序生成与闭环修正。评测中,Co-Director 在 GenAD-Bench 上取得 81.4 的峰值质量分数;其余框架也在文中列出的多个基准上展示了相应改进。

    推荐理由:文章将长视频生成拆解为创意编排、视觉分镜、时序延展和闭环修正四类问题,并说明各框架如何应对连续性漂移。

  2. GitHub Blog · AI & ML75

    GitHub Security Lab 开源 Fuzzing Taskflow 智能体,自动化 C/C++ 模糊测试

    GitHub Security Lab 开源了面向 C/C++ 项目的 Fuzzing Taskflow,由 LLM 智能体自动识别代码入口、编写 harness、运行 AFL++、根据覆盖率改进测试,并对崩溃进行分诊和生成漏洞报告。

    推荐理由:文章拆解了覆盖率反馈、结构化输入生成与崩溃分诊的自动化流程,也说明模型报告仍需人工审查,可供安全测试工作流设计参考。

  3. Google DeepMind79

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini Enterprise 提供带动态视觉形象的实时对话功能。它结合近实时视频生成与语音,支持后台异步调用工具并在对话不中断时处理任务,还可在97种语言间切换。组织可从参考图生成定制化 Avatar,但该功能目前仅向获准的企业开放;音视频输出均嵌入 SynthID 水印。

    推荐理由:该功能结合实时音视频对话与后台异步工具调用,并支持跨97种语言切换,可看出企业对话场景中交互连续性与多语言适配的设计重点。

9月24日周四
  1. GitHub Blog · AI & ML72

    GitHub Copilot app 如何流畅渲染超大型 Pull Request

    GitHub 重建了 GitHub Copilot app 的 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评论的 PR 仍能流畅浏览。文章详述了代码行与动态评论分开管理高度、滚动时延后测量并保持阅读锚点,以及通过缓存和自动化测量循环定位性能问题的做法。

    推荐理由:文章拆解了超大型 PR 视图的关键设计取舍,尤其说明动态评论如何影响虚拟化,以及团队如何通过锚定校正和自动化测量避免滚动卡顿。

  2. Microsoft Research77

    Microsoft Physical AI Toolchain 新增机器人推理卸载能力

    Microsoft Research 宣布 Physical AI Toolchain 新增机器人推理卸载能力,可通过 Kubernetes 工具在机器人、边缘 GPU 和云端之间分配推理工作负载。研究发现,部分较轻 GPU 上的地图构建与规划速度较 A100 慢最多 383%,较大的板载 GPU 还会显著消耗机器人电量;文章也提供了 SO-101 和 UR10e 的卸载示例。

    推荐理由:文章结合移动操作任务测量了端侧与卸载推理的性能和续航差异,并介绍 Kubernetes 工具链如何在机器人、边缘 GPU 与云端间分配工作负载。

  3. Google DeepMind72

    Google DeepMind 为 Private AI Compute 增加安全的服务器端记忆

    Google DeepMind 分享了 Private AI Compute 的服务器端持久记忆架构,使 AI 助手能够跨设备保留上下文,同时维持设备端隐私标准。

    推荐理由:文章说明了 Private AI Compute 如何借助设备持有的密钥与云端安全 enclave 保存跨设备记忆,并提供软件公开记录、技术白皮书和独立审计结果供外界审查。

9月23日周三
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,分别侧重创意语音设计与高音量、成本高效的语音生成。

    推荐理由:两款模型分别面向创意语音设计与高音量、成本效率场景,并提供逐句表演控制,呈现了语音生成在创作和规模化应用上的不同侧重。

9月21日周一
  1. Microsoft Research70

    Microsoft Research 发布 RetroChimera 逆合成研究并开源模型

    Microsoft Research 发布 RetroChimera 逆合成研究,该模型结合 R-SMILES 2 与 NeuralLoc,并通过学习式集成重排两者提出的反应物预测。在多步合成路线评估中,RetroChimera 在十个具有挑战性的目标中成功完成九个,高于文中对比模型;其实现和权重已开源,也可通过 Microsoft Foundry 使用。

    推荐理由:RetroChimera将两种互补的逆合成模型进行学习式重排,并以盲测和多步路线评估展示其表现,呈现了集成方法应对稀有反应的思路。

  2. Import AI42

    Import AI 473:美国超级智能战略、小鼠体内的人类脑组织与机器诠释学

    Import AI 473 聚焦 RAND 对美国超级智能战略的分析:面对 AI 发展路径的不确定性,美国应采取“行动自由”策略,投入资源保留选择空间。策略包括构建人类与 AI 生态、AI 安全架构、适应 AI 时代的国家安全体系,并提升公民、企业和政府的应对能力。文章还提及小鼠体内生长人类脑组织的研究及机器诠释学。