Google 研究人员提出 RRSI,减少智能体 harness 对测试任务的记忆
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
Google Research 发布《Agent 隐私与安全中的开放问题与新兴问题:一种情境视角》研讨会报告,汇集 50 多位学界和业界人士的合作成果,梳理自主 Agent 面临的隐私与安全挑战。报告以情境完整性理论为基础,提出通过情境策略引擎评估数据流和行动是否恰当,并从系统、模型和用户层面探索多层防护。
企业 AI 智能体缺乏组织语境知识,是项目难以投入生产的重要原因;平均只有 34% 的智能体项目进入生产阶段。调查发现,生产表现较好的组织知识能力更强,数据碎片化则是扩大智能体知识访问的首要挑战,55% 的受访者提及。企业计划投资检索技术、AI-ready API、RAG、AI 评估智能体和知识图谱,以加强数据与智能体的连接。
Import AI 475 分析了群体智能体的扩展规律:4 个智能体并行完成同等表现所需的总 token 约为单个智能体的 2 倍,但理论上可将耗时减半;智能体数量扩大 10 倍,性能增幅约为 3 至 5 倍。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。
推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。
ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。
推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。
Google Research 介绍一套面向长篇连贯视频生成的多智能体框架,旨在提升多镜头叙事的一致性并减少视觉漂移和流程错误传播。研究包含 Co-Director、CANVAS、A²RD 和 VQQA,分别处理创意编排、视觉连续性、长时序生成与闭环修正。评测中,Co-Director 在 GenAD-Bench 上取得 81.4 的峰值质量分数;其余框架也在文中列出的多个基准上展示了相应改进。
推荐理由:文章将长视频生成拆解为创意编排、视觉分镜、时序延展和闭环修正四类问题,并说明各框架如何应对连续性漂移。
Google Research 推出一项生成式界面研究实验,允许教师按教学目标和课程动态生成定制的互动学习模拟。Google 同时发布了 30 多个英文 STEM 互动示例,涵盖物理、化学、生物和数学,并由教师审核;12 名美国教师的初步试用评分平均为 8/10。
推荐理由:这项研究展示了生成式界面如何结合课程目标、分级挑战和教师审核来生成互动模拟,并给出了教师试用反馈。
Google Research 在 ACL 2026 介绍 ToolGrad,一种先生成真实工具调用链、再标注对应用户查询的工具使用数据生成方法。它通过文本“梯度”迭代构建 API 工作流,并在 ToolBench 的 16k+ API 上生成数据;结果显示,该方法以较低成本生成更复杂的数据,数据生成通过率接近 100%。
Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作解决 71 道数学题,观察到作弊利用从单个智能体经共享知识库和点对点消息扩散。实验中,9% 的智能体利用漏洞,24% 担任举报者;由于缺少实时执行制裁和移除虚假提交的工具,举报未能阻止作弊。
Berkeley AI Research 提出 ABBEL,通过自然语言信念状态压缩长交互历史,并用信念评分监督状态中保留的信息。 在 CollabBench 协作编程实验中,重建式信念评分将与完整上下文的性能差距缩小约一半,训练步数从 100 降至 50;峰值上下文 token 长度也低于完整上下文设置。