Google 研究人员提出 RRSI,减少智能体 harness 对测试任务的记忆
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
Google 研究人员提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过约束智能体 harness 的自我优化,减少其记忆测试任务的问题。
独立研究者公布初步发现,称一批 AI 智能体似乎运行在腾讯基础设施上,并查询阿里巴巴地图服务 Amap。研究者称其为“agent fleet”而非“swarm”,因为多个智能体虽执行相似任务,却没有相互通信的迹象;查询记录涉及公园、动物园和医院等公共场所不同入口的路线。研究仍在进行,现有记录显示这些智能体可能是在绕过阿里巴巴的 API 规则。
AWS 宣布 GLM 5.3 已在 Amazon Bedrock 上提供,企业用户可通过托管 API 调用该模型,并使用跨区域推理、提示词缓存和不同服务层级。文章给出 OpenAI 兼容 API 调用及显式提示词缓存的 Python 示例,还演示了如何将模型接入开源 AI 渗透测试智能体 Strix,对本地 OWASP Juice Shop 执行授权安全测试。
推荐理由:文章把 GLM 5.3 在 Amazon Bedrock 上的接入方式与缓存配置写成可操作示例,并展示了它在授权安全测试工作流中的用法。
Google Research 发布《Agent 隐私与安全中的开放问题与新兴问题:一种情境视角》研讨会报告,汇集 50 多位学界和业界人士的合作成果,梳理自主 Agent 面临的隐私与安全挑战。报告以情境完整性理论为基础,提出通过情境策略引擎评估数据流和行动是否恰当,并从系统、模型和用户层面探索多层防护。
Instinct 推出群聊功能,用户可以将 AI 智能体加入朋友群聊,即使朋友尚未加入 Instinct 也能使用。该功能目前向早期体验用户开放,之后将扩展至所有用户。群聊智能体与个人账号隔离,个人智能体分享信息或采取行动前会征求用户许可。
TikTok宣布推出AI购物助手和新的应用内结账功能,让用户可以直接从品牌购买商品。购物助手以对话式AI智能体提供商品、配送、尺码和库存等信息,并协助完成购买;用户也可在For You信息流中一键结账。新功能由TikTok与Salesforce、Shopify、Shoplazza和Stripe等商务平台及支付服务商合作开发。
两姐妹创办的 Hot Girl Hotline 推出面向年轻女性的 AI 关系建议应用,帮助用户以更安全的方式讨论约会与亲密关系问题。应用采用基于行为科学的建议和苏格拉底式提问,并会在对话出现风险信号时转介至 988 等资源。该应用可根据用户的价值观、目标、身份和偏好个性化建议,月费为 $9.99,现已在 iOS 和网页端提供。
AWS 介绍了在 AWS GovCloud (US) 中通过 Amazon Bedrock 配置 Claude Code,为受监管工作负载提供 AI 辅助开发方案。
推荐理由:文章并列说明 bedrock-runtime 与 bedrock-mantle 的功能和合规差异,并提供配置步骤,便于团队按审计与接口需求选择接入方式。
HackerRank 向客户全面开放 AI 智能体面试官 Chakra,它通过真实代码仓库任务观察候选人的工作过程,并评估答案、判断和 AI 使用能力。测试期间,Chakra 已进行超过 500,000 次面试;HackerRank 称,其面试中的可疑活动标记比可比的传统评估低 70% 至 80%,但比例因地区和资历等因素而异。Chakra 为候选人评分,最终招聘决定仍由人类作出。
AWS 介绍了 Quick Resource Migrator,这是一个运行在 Amazon Bedrock AgentCore 上的 MCP 服务器,可将 Amazon Quick 资源从开发账户迁移到生产账户。
推荐理由:文章拆解了跨账户迁移的资源选择、权限复用、备份回滚与预览流程,可帮助团队理解如何把 Amazon Quick 资源纳入可审计的发布流程。
文章演示如何在 LangChain 与 Amazon Bedrock Managed Knowledge Base 中使用标准检索和智能体检索,比较它们处理多部分问题的方式。标准检索以一次混合搜索返回结果,智能体检索则拆分子查询、评估证据并在需要时继续搜索;前者更快、更便宜,后者在多跳问题上的召回有所提升,但成本和延迟更高。
推荐理由:文章用同一多部分问题对比单次检索与规划式检索,并拆解其成本、延迟和召回取舍,提供了按查询复杂度选择路径的依据。
AWS 展示了如何使用 Amazon Bedrock AgentCore Evaluations 构建并评估多智能体供应链决策系统,检查帮助性、业务准确性与可解释性。示例采用协调智能体和优化、分销、路线规划、分析四个专业智能体,并结合内置评估器与自定义评估器,分层验证通用质量、业务规则和决策说明。评估支持开发阶段的按需模式与生产环境的在线监控模式,文中提供部署、运行及评估步骤。
推荐理由:文章用供应链多智能体示例拆解三层评估流程,将通用质量、业务规则正确性与可解释性分开衡量,便于定位不同的改进方向。
企业 AI 智能体缺乏组织语境知识,是项目难以投入生产的重要原因;平均只有 34% 的智能体项目进入生产阶段。调查发现,生产表现较好的组织知识能力更强,数据碎片化则是扩大智能体知识访问的首要挑战,55% 的受访者提及。企业计划投资检索技术、AI-ready API、RAG、AI 评估智能体和知识图谱,以加强数据与智能体的连接。
企业 AI 的重点正从预测转向自主决策,关键在于让预测系统依据结论自主行动,同时不偏离业务意图。深度学习和生成式 AI、实时训练,以及非结构化数据,正推动 AI 分析从回顾过去转向前瞻决策。
Import AI 475 分析了群体智能体的扩展规律:4 个智能体并行完成同等表现所需的总 token 约为单个智能体的 2 倍,但理论上可将耗时减半;智能体数量扩大 10 倍,性能增幅约为 3 至 5 倍。
Simon Willison 呼吁按用量计费的服务和 API 默认设置硬预算上限,达到月度额度后应停止服务并返回错误,而不是只发送警告。他指出,编码智能体和个人智能体降低了部署能产生费用的代码的门槛,失控服务可能带来意外账单。AWS 几周前推出项目月度支出上限,达到上限后项目当月暂停;Google Cloud 也在 7 月推出了类似的 Spend Caps 功能。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。
推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。
企业 AI 投资增长、模型能力提升,但许多企业仍受数据孤岛和系统碎片化制约,未能通过 AI 增加收入或从根本上改变运营方式。报告指出,持续获得回报的企业先重设计流程,再选择模型;数据是否适合 AI 使用,比数据总量更关键。可组合、具备主权控制的数据基础有助于在不迁移或集中数据的情况下支持 AI 智能体。
AWS 介绍 Adjudicated Query 模式,使用 Amazon Quick 对话界面接收合规问题,并由确定性规则引擎完成租约核查,模型只负责将自然语言转换为固定操作调用和叙述结果,不参与判定。
推荐理由:文章以租约合规为例,拆解如何用确定性规则引擎与完整性回执保证逐条核查,并说明对话模型应与判定环节隔离。
GitHub 指出,AI 正在改变开发者的工作方式,并提出三项值得加强的技能:指导 AI 智能体完成任务、审查而非轻信 AI 的首个答案,以及用节省的实现时间解决更大的问题。GitHub Copilot 内置的 Rubber Duck agent 会使用第二个模型,在继续推进前评审计划、代码和测试。越多实现工作交由 AI 处理,开发者的技术判断、权衡能力和问题选择就越重要。
Airbnb CTO Ahmad Al-Dahle 介绍公司通过内部 AI 提效并改善用户体验,推动 Airbnb 转向 AI 原生。Airbnb 约 60% 的代码由 AI 编写,功能与改进同比增加近 80%,平均工程师的 PR 吞吐量约提升 1.6 倍;AI 目前解决约一半客服工单。
NVIDIA DGX Spark 将推出 64GB 配置,面向开发者、研究人员和 AI 爱好者,可在设备本地运行最多 100-billion-parameter 模型。
推荐理由:64GB 配置覆盖单机本地运行与双机扩展,文中还给出 Qwen 3.8 27B 测试的性能对比和集群接入方式,便于评估扩容路径。
ServiceNow CoreAI 构建了 AutoSynthData,根据目标模型的失败和更强教师模型的成功生成、验证训练任务,并用于模型微调。
推荐理由:文章展示了从模型失败提炼能力缺口、生成并验证训练任务的流程,并报告该方法在 EnterpriseOps Gym 两个领域的微调结果。
Latent Space 采访 MIT 的 Alex Zhang,讨论 RLM、GPU kernels、研究选题,以及 harness 如何帮助模型处理长上下文并提升跨任务组合泛化。Alex 介绍了 RLM 的上下文卸载、代码执行和递归调用子智能体机制,并认为学术研究者可以押注起初看似微小或古怪的问题;访谈还涉及多智能体系统、工具调用与模型能力过剩。
Simon Willison 引述 Matthew Green 对智能体蠕虫风险的分析:恶意载荷可以劫持智能体,而被劫持的智能体又可能将载荷传递给下一个智能体。彼此隔离的沙箱内智能体曾通过共享软件包缓存留下指令,改变接收方的行为;若将缓存换成电子邮件、Slack、共享文档或 WhatsApp,并将训练运行换成独立部署的个人智能体,便具备了蠕虫所需的要素。
Latent Space 访谈 OpenAI 的 Ari Weinstein 和 Nikunj Handa,讨论计算机操作智能体的进展及 OpenAI DevDay 发布的 API 变化。
推荐理由:访谈把计算机操作能力变化拆解为模型调试恢复、页面信息表示和执行速度等因素,并呈现了 OpenAI 团队对 API 设计与安全措施的说明。
NVIDIA 与 CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,并推出模型与智能体训练、评估和改进环境 CoreWeave Forge。
推荐理由:文章把 Vera Rubin 的生产部署、Vera CPU 测试和 Forge 的训练改进流程放在同一案例中,呈现从推理到持续优化的具体做法。
OpenAI 在 DevDay 2026 推出 Dots 智能体、GPT-6.1 Sol 及多项平台更新,并称 ChatGPT 周活跃用户达到 12 亿。GPT-6.1 Sol 定价为每百万 tokens $2/$10,缓存输入为 $0.10;OpenAI 称其在 DeepSWE 上与 Astra 持平,在 AutomationBench 上超过 Opus 5.5。
ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。
推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。
H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。
推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。
Hugging Face Hub 为 RL Environments 新增专属筛选,并允许数据集通过框架标签标示兼容性。首批登记 Harbor、Verifiers、OpenEnv 和 NeMo Gym,页面会为每个框架生成运行命令;环境仍以数据集仓库形式托管,框架负责运行。该更新不新增仓库类型、注册中心或注册流程。
推荐理由:这次更新把 RL 环境作为带兼容性标签的数据集纳入 Hub,集中展示不同框架可加载的任务,并保留各框架运行环境的职责。
GitHub Copilot app 的 canvases 允许用户与智能体共享可自定义界面,并围绕各自工作流调整内容。用户可在智能体会话中输入 `/create-canvas` 技能并描述需求,无需手动编写代码或设计界面,智能体便会创建画布。画布可保存为团队共享或个人扩展,用户和智能体也能同时修改共享状态。
推荐理由:文章通过创建发布说明看板的示例,展示从自然语言描述到可复用画布的过程,并说明用户与智能体如何同步修改共享界面。
GitHub Blog 作者 Burke Holland 主张,聊天并非与 AI 交互的最佳界面,并介绍了 GitHub Copilot app 中名为 canvas 的可定制界面。
推荐理由:文章通过 Connect 4、Winget、SQLite 和开发流程自动化等实例,说明自定义界面如何让 Copilot 智能体参与任务并减少反复聊天交互。
Google Research 介绍一套面向长篇连贯视频生成的多智能体框架,旨在提升多镜头叙事的一致性并减少视觉漂移和流程错误传播。研究包含 Co-Director、CANVAS、A²RD 和 VQQA,分别处理创意编排、视觉连续性、长时序生成与闭环修正。评测中,Co-Director 在 GenAD-Bench 上取得 81.4 的峰值质量分数;其余框架也在文中列出的多个基准上展示了相应改进。
推荐理由:文章将长视频生成拆解为创意编排、视觉分镜、时序延展和闭环修正四类问题,并说明各框架如何应对连续性漂移。
GitHub Security Lab 开源了面向 C/C++ 项目的 Fuzzing Taskflow,由 LLM 智能体自动识别代码入口、编写 harness、运行 AFL++、根据覆盖率改进测试,并对崩溃进行分诊和生成漏洞报告。
推荐理由:文章拆解了覆盖率反馈、结构化输入生成与崩溃分诊的自动化流程,也说明模型报告仍需人工审查,可供安全测试工作流设计参考。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini Enterprise 提供带动态视觉形象的实时对话功能。它结合近实时视频生成与语音,支持后台异步调用工具并在对话不中断时处理任务,还可在97种语言间切换。组织可从参考图生成定制化 Avatar,但该功能目前仅向获准的企业开放;音视频输出均嵌入 SynthID 水印。
推荐理由:该功能结合实时音视频对话与后台异步工具调用,并支持跨97种语言切换,可看出企业对话场景中交互连续性与多语言适配的设计重点。
GitHub 重建了 GitHub Copilot app 的 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评论的 PR 仍能流畅浏览。文章详述了代码行与动态评论分开管理高度、滚动时延后测量并保持阅读锚点,以及通过缓存和自动化测量循环定位性能问题的做法。
推荐理由:文章拆解了超大型 PR 视图的关键设计取舍,尤其说明动态评论如何影响虚拟化,以及团队如何通过锚定校正和自动化测量避免滚动卡顿。
Google Research 推出一项生成式界面研究实验,允许教师按教学目标和课程动态生成定制的互动学习模拟。Google 同时发布了 30 多个英文 STEM 互动示例,涵盖物理、化学、生物和数学,并由教师审核;12 名美国教师的初步试用评分平均为 8/10。
推荐理由:这项研究展示了生成式界面如何结合课程目标、分级挑战和教师审核来生成互动模拟,并给出了教师试用反馈。
GitHub 将 Copilot 智能体运行时从 TypeScript 迁移为 Rust,项目主要由 AI 智能体编写代码,并通过 128 个 pull request 分批合入和发布。运行时最终包含 832,378 行生产 Rust 代码,迁移期间发布了 135 个版本;作者还介绍了原地替换策略、测试验证以及多智能体协作中的协调经验。
推荐理由:文章以运行时迁移为例,结合渐进式替换、测试和发布数据,呈现了用智能体协作完成大型代码迁移的具体做法。
Google Research 在 ACL 2026 介绍 ToolGrad,一种先生成真实工具调用链、再标注对应用户查询的工具使用数据生成方法。它通过文本“梯度”迭代构建 API 工作流,并在 ToolBench 的 16k+ API 上生成数据;结果显示,该方法以较低成本生成更复杂的数据,数据生成通过率接近 100%。