Google 研究人员提出 RRSI,减少智能体 harness 对测试任务的记忆
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
AWS 宣布 GLM 5.3 已在 Amazon Bedrock 上提供,企业用户可通过托管 API 调用该模型,并使用跨区域推理、提示词缓存和不同服务层级。文章给出 OpenAI 兼容 API 调用及显式提示词缓存的 Python 示例,还演示了如何将模型接入开源 AI 渗透测试智能体 Strix,对本地 OWASP Juice Shop 执行授权安全测试。
推荐理由:文章把 GLM 5.3 在 Amazon Bedrock 上的接入方式与缓存配置写成可操作示例,并展示了它在授权安全测试工作流中的用法。
Reflection AI公布首款前沿开放权重模型Beam,称其在高级推理基准上达到Z.ai的GLM-5.2水平,并以3-4x更少的推理算力超过领先的西方开放模型。
AWS 介绍了在 AWS GovCloud (US) 中通过 Amazon Bedrock 配置 Claude Code,为受监管工作负载提供 AI 辅助开发方案。
推荐理由:文章并列说明 bedrock-runtime 与 bedrock-mantle 的功能和合规差异,并提供配置步骤,便于团队按审计与接口需求选择接入方式。
GitHub 推出 ReviewBench 开放基准,用于评测 AI 代码审查智能体,并提供公开数据集、统一评分方法和系统比较入口。基准包含来自 187 个开源许可仓库的 219 个 PR,覆盖 19 种语言,其分布参考了对 103.9M 个 GitHub PR 的分析;资深工程师独立复核标注,判断一致率为 96.6%。
推荐理由:ReviewBench 将真实 PR 分布、多来源标注和专家复核纳入同一评测流程,并用线上实验对照离线信号,为代码审查智能体比较提供可复现依据。
GitHub 指出,AI 正在改变开发者的工作方式,并提出三项值得加强的技能:指导 AI 智能体完成任务、审查而非轻信 AI 的首个答案,以及用节省的实现时间解决更大的问题。GitHub Copilot 内置的 Rubber Duck agent 会使用第二个模型,在继续推进前评审计划、代码和测试。越多实现工作交由 AI 处理,开发者的技术判断、权衡能力和问题选择就越重要。
Chatham Financial 使用 Codex 和 GPT-5.6 构建技术并重新设计工作流程,将交易验证时间从 30 分钟缩短至不足 4 分钟。
OpenAI 的 GPT-6 Astra Ultrafast 运行于 NVIDIA Blackwell GPU,现已通过 OpenAI API 向开发者提供,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:材料比较了 Astra Ultrafast 与 Standard 模式的生成速度,并联系编码智能体的多轮工具工作流,说明响应延迟如何影响交互节奏。
Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。
推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。
OpenAI 在 DevDay 2026 推出 Dots 智能体、GPT-6.1 Sol 及多项平台更新,并称 ChatGPT 周活跃用户达到 12 亿。GPT-6.1 Sol 定价为每百万 tokens $2/$10,缓存输入为 $0.10;OpenAI 称其在 DeepSWE 上与 Astra 持平,在 AutomationBench 上超过 Opus 5.5。
GitHub 重建了 GitHub Copilot app 的 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评论的 PR 仍能流畅浏览。文章详述了代码行与动态评论分开管理高度、滚动时延后测量并保持阅读锚点,以及通过缓存和自动化测量循环定位性能问题的做法。
推荐理由:文章拆解了超大型 PR 视图的关键设计取舍,尤其说明动态评论如何影响虚拟化,以及团队如何通过锚定校正和自动化测量避免滚动卡顿。
GitHub 播客讨论 AI 开发中的五种热点观点,认为开发者仍须审查并对生成代码负责,但应按风险分配精力。Skills 与 MCP 解决的问题不同:前者提供背景、流程和最佳实践,后者连接工具与数据;RAG 也没有过时,可与 Agent、Skills 和 MCP 协同使用。
GitHub 将 Copilot 智能体运行时从 TypeScript 迁移为 Rust,项目主要由 AI 智能体编写代码,并通过 128 个 pull request 分批合入和发布。运行时最终包含 832,378 行生产 Rust 代码,迁移期间发布了 135 个版本;作者还介绍了原地替换策略、测试验证以及多智能体协作中的协调经验。
推荐理由:文章以运行时迁移为例,结合渐进式替换、测试和发布数据,呈现了用智能体协作完成大型代码迁移的具体做法。
Mistral 协助一家欧洲能源运营商将 40,000 行 Fortran 77 迁移至 C++,对象是缺少测试套件和集中文档的储层模拟器。团队先建立数值一致性测试框架并整理代码文档,再按模块运行规划、实现、测试和人工审查流程;首个冲刺覆盖了总计 300,000 行代码中的 40,000 行。
推荐理由:这次迁移展示了复杂遗留系统中智能体自主性的取舍,并给出可复用的流程要点,包括先建立数值一致性测试,再配合分模块实施与人工审查。
Berkeley AI Research 团队为 K-Search 增加 MLX 后端和 CUDA-to-MLX 翻译层,使其能将现有 CUDA 内核作为知识基础,为 Apple Silicon 搜索优化内核。
推荐理由:文章拆解了 CUDA 优化知识迁移到 MLX 的结构化做法,并用 Attention 与 Mamba SSM 两类内核的实测数据展示其性能差异。
Berkeley AI Research 提出 ABBEL,通过自然语言信念状态压缩长交互历史,并用信念评分监督状态中保留的信息。 在 CollabBench 协作编程实验中,重建式信念评分将与完整上下文的性能差距缩小约一半,训练步数从 100 降至 50;峰值上下文 token 长度也低于完整上下文设置。