Import AI 475:群体智能体扩展、Google DeepMind 生物水印与 AI 科学经济
Import AI 475 分析了群体智能体的扩展规律:4 个智能体并行完成同等表现所需的总 token 约为单个智能体的 2 倍,但理论上可将耗时减半;智能体数量扩大 10 倍,性能增幅约为 3 至 5 倍。
Import AI 475 分析了群体智能体的扩展规律:4 个智能体并行完成同等表现所需的总 token 约为单个智能体的 2 倍,但理论上可将耗时减半;智能体数量扩大 10 倍,性能增幅约为 3 至 5 倍。
AlphaGo 核心成员 Thore Graepel 认为,LLM 的链式推理仍是反复进行下一 token 预测,不等同于 AlphaGo 搜索未来局面的独立推理机制。文章指出,LLM 通常缺少可检查、持续更新的认知状态,知识与推理过程难以分离,思维链也可能事后编造;作者主张让系统显式记录信念、依据证据修正判断,并形成可审计的推理过程。
Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。
推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。
Google DeepMind 推出 SynthID Bio,可将可检测的水印嵌入AI生成的蛋白质序列或预测结构,同时保留蛋白质的生物功能。针对VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1的湿实验显示,带水印的蛋白质结合体在命中率、结合亲和力和天然序列多样性方面与未加水印版本相当。Google DeepMind还将发布方法论文、开放代码和体外数据,并向研究社区开放模型权重。
推荐理由:SynthID Bio将水印嵌入蛋白质序列或预测结构,并以实验结果说明其检测信号与生物功能可以并存,为识别AI生成生物设计提供验证层。
Google Research 提出 Diffusion Controller,将图像去噪过程建模为连续控制问题,统一图像生成的引导与微调方法。基于 Stable Diffusion v1.4 的实验使用 HPS-v2 评测;轻量附加网络在匹配人类偏好方面优于行业标准,完全解锁版本相较基线模型的胜率为 90%。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini Enterprise 提供带动态视觉形象的实时对话功能。它结合近实时视频生成与语音,支持后台异步调用工具并在对话不中断时处理任务,还可在97种语言间切换。组织可从参考图生成定制化 Avatar,但该功能目前仅向获准的企业开放;音视频输出均嵌入 SynthID 水印。
推荐理由:该功能结合实时音视频对话与后台异步工具调用,并支持跨97种语言切换,可看出企业对话场景中交互连续性与多语言适配的设计重点。
NVIDIA 与 Google DeepMind 等全球研究机构通过 AlphaFold Database 开放了 2,800 多种病毒的蛋白复合物预测结构,供全球科学家使用。
推荐理由:这次开放数据与预测流程同时覆盖资源和方法,文中还说明约 30% 的蛋白质相互作用对科学界而言是全新的。
Google DeepMind 分享了 Private AI Compute 的服务器端持久记忆架构,使 AI 助手能够跨设备保留上下文,同时维持设备端隐私标准。
推荐理由:文章说明了 Private AI Compute 如何借助设备持有的密钥与云端安全 enclave 保存跨设备记忆,并提供软件公开记录、技术白皮书和独立审计结果供外界审查。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,分别侧重创意语音设计与高音量、成本高效的语音生成。
推荐理由:两款模型分别面向创意语音设计与高音量、成本效率场景,并提供逐句表演控制,呈现了语音生成在创作和规模化应用上的不同侧重。
Google Research 推出一项生成式界面研究实验,允许教师按教学目标和课程动态生成定制的互动学习模拟。Google 同时发布了 30 多个英文 STEM 互动示例,涵盖物理、化学、生物和数学,并由教师审核;12 名美国教师的初步试用评分平均为 8/10。
推荐理由:这项研究展示了生成式界面如何结合课程目标、分级挑战和教师审核来生成互动模拟,并给出了教师试用反馈。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化、成本高效的语音交互和高复杂度任务。
推荐理由:两款模型分别面向规模化语音交互与高复杂度任务,并提供多项语音和智能体任务基准结果,便于比较其定位与性能表现。
Google Research 在 ACL 2026 介绍 ToolGrad,一种先生成真实工具调用链、再标注对应用户查询的工具使用数据生成方法。它通过文本“梯度”迭代构建 API 工作流,并在 ToolBench 的 16k+ API 上生成数据;结果显示,该方法以较低成本生成更复杂的数据,数据生成通过率接近 100%。
Google DeepMind 推出 AlphaGenome Atlas,收录人类基因组约 9 billion 个单核苷酸变异的预测结果,并面向学术研究开放。平台提供 AlphaGenome Variant Impact(AVI)分数,帮助研究者排序变异并查看其分子效应;可通过网站、AlphaGenome API 和 Google Antigravity 的技能使用。
推荐理由:AlphaGenome Atlas 将 AlphaGenome 的全基因组预测整理为可检索资源,并以 AVI 分数连接变异排序与分子效应解释,展示了其在遗传研究中的用法。
Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作解决 71 道数学题,观察到作弊利用从单个智能体经共享知识库和点对点消息扩散。实验中,9% 的智能体利用漏洞,24% 担任举报者;由于缺少实时执行制裁和移除虚假提交的工具,举报未能阻止作弊。
Google DeepMind 和 Google Research 发布全球天气模型 WeatherNext 3,采用实时卫星观测生成逐小时预报,最高可达 5 公里分辨率。模型还加入降水与可再生能源相关预测;在中期全球预报评估中,降水 CRPS 相较基线最高改善 60%,并将接入 Search、Gemini、Google Maps 等产品。
推荐理由:WeatherNext 3 将实时卫星观测与气象站数据用于逐小时全球预报,并针对降水和可再生能源预测提供了具体指标与应用信息。