跳到正文
今天10月6日周二3 条
  1. AWS Machine Learning Blog78

    GLM 5.3 在 Amazon Bedrock 上线,支持缓存配置与 Strix 安全测试

    AWS 宣布 GLM 5.3 已在 Amazon Bedrock 上提供,企业用户可通过托管 API 调用该模型,并使用跨区域推理、提示词缓存和不同服务层级。文章给出 OpenAI 兼容 API 调用及显式提示词缓存的 Python 示例,还演示了如何将模型接入开源 AI 渗透测试智能体 Strix,对本地 OWASP Juice Shop 执行授权安全测试。

    推荐理由:文章把 GLM 5.3 在 Amazon Bedrock 上的接入方式与缓存配置写成可操作示例,并展示了它在授权安全测试工作流中的用法。

  2. Google Research47

    Agent 隐私与安全中的开放问题与新兴问题:一种情境视角

    Google Research 发布《Agent 隐私与安全中的开放问题与新兴问题:一种情境视角》研讨会报告,汇集 50 多位学界和业界人士的合作成果,梳理自主 Agent 面临的隐私与安全挑战。报告以情境完整性理论为基础,提出通过情境策略引擎评估数据流和行动是否恰当,并从系统、模型和用户层面探索多层防护。

10月5日周一
  1. AWS Machine Learning Blog71

    AWS 发布 Amazon Quick Resource Migrator,实现跨账户资源自动迁移

    AWS 介绍了 Quick Resource Migrator,这是一个运行在 Amazon Bedrock AgentCore 上的 MCP 服务器,可将 Amazon Quick 资源从开发账户迁移到生产账户。

    推荐理由:文章拆解了跨账户迁移的资源选择、权限复用、备份回滚与预览流程,可帮助团队理解如何把 Amazon Quick 资源纳入可审计的发布流程。

  2. AWS Machine Learning Blog62

    如何用 LangChain 和 Amazon Bedrock Knowledge Bases 实现智能体检索

    文章演示如何在 LangChain 与 Amazon Bedrock Managed Knowledge Base 中使用标准检索和智能体检索,比较它们处理多部分问题的方式。标准检索以一次混合搜索返回结果,智能体检索则拆分子查询、评估证据并在需要时继续搜索;前者更快、更便宜,后者在多跳问题上的召回有所提升,但成本和延迟更高。

    推荐理由:文章用同一多部分问题对比单次检索与规划式检索,并拆解其成本、延迟和召回取舍,提供了按查询复杂度选择路径的依据。

  3. AWS Machine Learning Blog61

    AWS 教程:使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与帮助性

    AWS 展示了如何使用 Amazon Bedrock AgentCore Evaluations 构建并评估多智能体供应链决策系统,检查帮助性、业务准确性与可解释性。示例采用协调智能体和优化、分销、路线规划、分析四个专业智能体,并结合内置评估器与自定义评估器,分层验证通用质量、业务规则和决策说明。评估支持开发阶段的按需模式与生产环境的在线监控模式,文中提供部署、运行及评估步骤。

    推荐理由:文章用供应链多智能体示例拆解三层评估流程,将通用质量、业务规则正确性与可解释性分开衡量,便于定位不同的改进方向。

10月4日周日
  1. Hugging Face Blog80

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测基准

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。

    推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。

10月2日周五
  1. AWS Machine Learning Blog76

    AWS 教程:用 Amazon Quick 与 Adjudicated Query 模式核查数万份租约合规性

    AWS 介绍 Adjudicated Query 模式,使用 Amazon Quick 对话界面接收合规问题,并由确定性规则引擎完成租约核查,模型只负责将自然语言转换为固定操作调用和叙述结果,不参与判定。

    推荐理由:文章以租约合规为例,拆解如何用确定性规则引擎与完整性回执保证逐条核查,并说明对话模型应与判定环节隔离。

  2. GitHub Blog · AI & ML40

    AI 正在改变开发者工作:GitHub 提出三项值得加强的技能

    GitHub 指出,AI 正在改变开发者的工作方式,并提出三项值得加强的技能:指导 AI 智能体完成任务、审查而非轻信 AI 的首个答案,以及用节省的实现时间解决更大的问题。GitHub Copilot 内置的 Rubber Duck agent 会使用第二个模型,在继续推进前评审计划、代码和测试。越多实现工作交由 AI 处理,开发者的技术判断、权衡能力和问题选择就越重要。

9月30日周三
9月29日周二
  1. Hugging Face Blog67

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。

    推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。

9月28日周一
  1. Hugging Face Blog80

    H Company 发布 Holo4 智能体模型系列,提供 27B 与 35B-A3B 两种规格

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。

    推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。

  2. Hugging Face Blog72

    Hugging Face Hub 新增 RL Environments 筛选与框架标签

    Hugging Face Hub 为 RL Environments 新增专属筛选,并允许数据集通过框架标签标示兼容性。首批登记 Harbor、Verifiers、OpenEnv 和 NeMo Gym,页面会为每个框架生成运行命令;环境仍以数据集仓库形式托管,框架负责运行。该更新不新增仓库类型、注册中心或注册流程。

    推荐理由:这次更新把 RL 环境作为带兼容性标签的数据集纳入 Hub,集中展示不同框架可加载的任务,并保留各框架运行环境的职责。

9月26日周六
  1. GitHub Blog · AI & ML64

    GitHub Copilot app 初学者指南:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvases 允许用户与智能体共享可自定义界面,并围绕各自工作流调整内容。用户可在智能体会话中输入 `/create-canvas` 技能并描述需求,无需手动编写代码或设计界面,智能体便会创建画布。画布可保存为团队共享或个人扩展,用户和智能体也能同时修改共享状态。

    推荐理由:文章通过创建发布说明看板的示例,展示从自然语言描述到可复用画布的过程,并说明用户与智能体如何同步修改共享界面。

9月25日周五
  1. Google Research67

    Google Research 介绍长篇连贯视频生成研究及四项框架

    Google Research 介绍一套面向长篇连贯视频生成的多智能体框架,旨在提升多镜头叙事的一致性并减少视觉漂移和流程错误传播。研究包含 Co-Director、CANVAS、A²RD 和 VQQA,分别处理创意编排、视觉连续性、长时序生成与闭环修正。评测中,Co-Director 在 GenAD-Bench 上取得 81.4 的峰值质量分数;其余框架也在文中列出的多个基准上展示了相应改进。

    推荐理由:文章将长视频生成拆解为创意编排、视觉分镜、时序延展和闭环修正四类问题,并说明各框架如何应对连续性漂移。

  2. GitHub Blog · AI & ML75

    GitHub Security Lab 开源 Fuzzing Taskflow 智能体,自动化 C/C++ 模糊测试

    GitHub Security Lab 开源了面向 C/C++ 项目的 Fuzzing Taskflow,由 LLM 智能体自动识别代码入口、编写 harness、运行 AFL++、根据覆盖率改进测试,并对崩溃进行分诊和生成漏洞报告。

    推荐理由:文章拆解了覆盖率反馈、结构化输入生成与崩溃分诊的自动化流程,也说明模型报告仍需人工审查,可供安全测试工作流设计参考。

  3. Google DeepMind79

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini Enterprise 提供带动态视觉形象的实时对话功能。它结合近实时视频生成与语音,支持后台异步调用工具并在对话不中断时处理任务,还可在97种语言间切换。组织可从参考图生成定制化 Avatar,但该功能目前仅向获准的企业开放;音视频输出均嵌入 SynthID 水印。

    推荐理由:该功能结合实时音视频对话与后台异步工具调用,并支持跨97种语言切换,可看出企业对话场景中交互连续性与多语言适配的设计重点。

9月24日周四
  1. GitHub Blog · AI & ML72

    GitHub Copilot app 如何流畅渲染超大型 Pull Request

    GitHub 重建了 GitHub Copilot app 的 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评论的 PR 仍能流畅浏览。文章详述了代码行与动态评论分开管理高度、滚动时延后测量并保持阅读锚点,以及通过缓存和自动化测量循环定位性能问题的做法。

    推荐理由:文章拆解了超大型 PR 视图的关键设计取舍,尤其说明动态评论如何影响虚拟化,以及团队如何通过锚定校正和自动化测量避免滚动卡顿。

9月18日周五
  1. Google Research72

    Google Research 推出面向教育的生成式界面互动学习模拟实验

    Google Research 推出一项生成式界面研究实验,允许教师按教学目标和课程动态生成定制的互动学习模拟。Google 同时发布了 30 多个英文 STEM 互动示例,涵盖物理、化学、生物和数学,并由教师审核;12 名美国教师的初步试用评分平均为 8/10。

    推荐理由:这项研究展示了生成式界面如何结合课程目标、分级挑战和教师审核来生成互动模拟,并给出了教师试用反馈。

9月17日周四
  1. GitHub Blog · AI & ML81

    GitHub Copilot 团队如何借助 Copilot 将运行时迁移到 Rust

    GitHub 将 Copilot 智能体运行时从 TypeScript 迁移为 Rust,项目主要由 AI 智能体编写代码,并通过 128 个 pull request 分批合入和发布。运行时最终包含 832,378 行生产 Rust 代码,迁移期间发布了 135 个版本;作者还介绍了原地替换策略、测试验证以及多智能体协作中的协调经验。

    推荐理由:文章以运行时迁移为例,结合渐进式替换、测试和发布数据,呈现了用智能体协作完成大型代码迁移的具体做法。

9月11日周五
  1. Google Research57

    Google Research 发布 ToolGrad,提升工具调用数据生成效率

    Google Research 在 ACL 2026 介绍 ToolGrad,一种先生成真实工具调用链、再标注对应用户查询的工具使用数据生成方法。它通过文本“梯度”迭代构建 API 工作流,并在 ToolBench 的 16k+ API 上生成数据;结果显示,该方法以较低成本生成更复杂的数据,数据生成通过率接近 100%。

9月9日周三
  1. Mistral AI62

    Mistral 分享用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++ 的实践

    Mistral 协助一家欧洲能源运营商将 40,000 行 Fortran 77 迁移至 C++,对象是缺少测试套件和集中文档的储层模拟器。团队先建立数值一致性测试框架并整理代码文档,再按模块运行规划、实现、测试和人工审查流程;首个冲刺覆盖了总计 300,000 行代码中的 40,000 行。

    推荐理由:这次迁移展示了复杂遗留系统中智能体自主性的取舍,并给出可复用的流程要点,包括先建立数值一致性测试,再配合分模块实施与人工审查。

7月26日周日
  1. Berkeley AI Research59

    ABBEL:通过更新信念状态实现高效长程交互

    Berkeley AI Research 提出 ABBEL,通过自然语言信念状态压缩长交互历史,并用信念评分监督状态中保留的信息。 在 CollabBench 协作编程实验中,重建式信念评分将与完整上下文的性能差距缩小约一半,训练步数从 100 降至 50;峰值上下文 token 长度也低于完整上下文设置。

7月7日周二
  1. Berkeley AI Research57

    Berkeley AI Research探讨近乎免费的智能如何改变数据系统与智能体

    Berkeley AI Research的这篇观点文章提出,随着知识工作所需的AI智能持续降价,数据系统将面临三类变化:为智能体的高并发探索式查询重新设计、支撑智能体群体的记忆与协作,以及由智能体按工作负载合成定制数据系统。文章还讨论了查询复用、结构化记忆、共享状态管理和验证生成系统正确性等研究方向。