Google 研究人员提出 RRSI,减少智能体 harness 对测试任务的记忆
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
GitHub 推出 ReviewBench 开放基准,用于评测 AI 代码审查智能体,并提供公开数据集、统一评分方法和系统比较入口。基准包含来自 187 个开源许可仓库的 219 个 PR,覆盖 19 种语言,其分布参考了对 103.9M 个 GitHub PR 的分析;资深工程师独立复核标注,判断一致率为 96.6%。
推荐理由:ReviewBench 将真实 PR 分布、多来源标注和专家复核纳入同一评测流程,并用线上实验对照离线信号,为代码审查智能体比较提供可复现依据。
Berkeley AI Research 提出 ABBEL,通过自然语言信念状态压缩长交互历史,并用信念评分监督状态中保留的信息。 在 CollabBench 协作编程实验中,重建式信念评分将与完整上下文的性能差距缩小约一半,训练步数从 100 降至 50;峰值上下文 token 长度也低于完整上下文设置。