Google 研究人员提出 RRSI,减少智能体 harness 对测试任务的记忆
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
Google Research 发布《Agent 隐私与安全中的开放问题与新兴问题:一种情境视角》研讨会报告,汇集 50 多位学界和业界人士的合作成果,梳理自主 Agent 面临的隐私与安全挑战。报告以情境完整性理论为基础,提出通过情境策略引擎评估数据流和行动是否恰当,并从系统、模型和用户层面探索多层防护。
Import AI 475 分析了群体智能体的扩展规律:4 个智能体并行完成同等表现所需的总 token 约为单个智能体的 2 倍,但理论上可将耗时减半;智能体数量扩大 10 倍,性能增幅约为 3 至 5 倍。
Google DeepMind 推出 SynthID Bio,可将可检测的水印嵌入AI生成的蛋白质序列或预测结构,同时保留蛋白质的生物功能。针对VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1的湿实验显示,带水印的蛋白质结合体在命中率、结合亲和力和天然序列多样性方面与未加水印版本相当。Google DeepMind还将发布方法论文、开放代码和体外数据,并向研究社区开放模型权重。
推荐理由:SynthID Bio将水印嵌入蛋白质序列或预测结构,并以实验结果说明其检测信号与生物功能可以并存,为识别AI生成生物设计提供验证层。
Google Research 提出 Diffusion Controller,将图像去噪过程建模为连续控制问题,统一图像生成的引导与微调方法。基于 Stable Diffusion v1.4 的实验使用 HPS-v2 评测;轻量附加网络在匹配人类偏好方面优于行业标准,完全解锁版本相较基线模型的胜率为 90%。
Google Research 介绍一套面向长篇连贯视频生成的多智能体框架,旨在提升多镜头叙事的一致性并减少视觉漂移和流程错误传播。研究包含 Co-Director、CANVAS、A²RD 和 VQQA,分别处理创意编排、视觉连续性、长时序生成与闭环修正。评测中,Co-Director 在 GenAD-Bench 上取得 81.4 的峰值质量分数;其余框架也在文中列出的多个基准上展示了相应改进。
推荐理由:文章将长视频生成拆解为创意编排、视觉分镜、时序延展和闭环修正四类问题,并说明各框架如何应对连续性漂移。
NVIDIA 与 Google DeepMind 等全球研究机构通过 AlphaFold Database 开放了 2,800 多种病毒的蛋白复合物预测结构,供全球科学家使用。
推荐理由:这次开放数据与预测流程同时覆盖资源和方法,文中还说明约 30% 的蛋白质相互作用对科学界而言是全新的。
Google Research 推出 MilleMiglia,这是一个用 C++ 编写的实例生成器,可为中间里程配送问题生成逼真基准数据。它以合成网络保留固定车辆班次、配送中心吞吐量限制和跨车辆同步等约束,同时避免披露私有物流数据;源代码和文档已在 GitHub 提供。
Google Research 推出一项生成式界面研究实验,允许教师按教学目标和课程动态生成定制的互动学习模拟。Google 同时发布了 30 多个英文 STEM 互动示例,涵盖物理、化学、生物和数学,并由教师审核;12 名美国教师的初步试用评分平均为 8/10。
推荐理由:这项研究展示了生成式界面如何结合课程目标、分级挑战和教师审核来生成互动模拟,并给出了教师试用反馈。
Google Research 提出 Retrieve-for-Train,用离线强化学习发现符合奖励目标的查询扩展方式,再将其蒸馏到轻量扩散检索器,以单次推理生成互补的子查询集合。该框架的扩散模型有 53.9M 参数,可直接把查询嵌入映射为完整目标嵌入集合,绕过文本 CoT 推理 token;训练还使用 Gemma3-4B 和 Qwen3-4B。
Google Research 在 ACL 2026 介绍 ToolGrad,一种先生成真实工具调用链、再标注对应用户查询的工具使用数据生成方法。它通过文本“梯度”迭代构建 API 工作流,并在 ToolBench 的 16k+ API 上生成数据;结果显示,该方法以较低成本生成更复杂的数据,数据生成通过率接近 100%。
Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作解决 71 道数学题,观察到作弊利用从单个智能体经共享知识库和点对点消息扩散。实验中,9% 的智能体利用漏洞,24% 担任举报者;由于缺少实时执行制裁和移除虚假提交的工具,举报未能阻止作弊。
Import AI 470 聚焦 SPADE 自动生成训练环境、Hawkeye 改进 GPU 内核,以及机器权利议题。SPADE 让 LLM 在生成可执行训练环境与尝试解决环境之间交替,并用 Qwen3 骨干模型测试;Qwen3-30B-A3B 在游戏环境套件中平均得分 58.3,较基础模型高 8.1。