跳到正文
今天10月6日周二9 条
  1. TechCrunch · AI52

    研究者追踪疑似运行于腾讯基础设施的中国 AI 智能体群

    独立研究者公布初步发现,称一批 AI 智能体似乎运行在腾讯基础设施上,并查询阿里巴巴地图服务 Amap。研究者称其为“agent fleet”而非“swarm”,因为多个智能体虽执行相似任务,却没有相互通信的迹象;查询记录涉及公园、动物园和医院等公共场所不同入口的路线。研究仍在进行,现有记录显示这些智能体可能是在绕过阿里巴巴的 API 规则。

  2. AWS Machine Learning Blog78

    GLM 5.3 在 Amazon Bedrock 上线,支持缓存配置与 Strix 安全测试

    AWS 宣布 GLM 5.3 已在 Amazon Bedrock 上提供,企业用户可通过托管 API 调用该模型,并使用跨区域推理、提示词缓存和不同服务层级。文章给出 OpenAI 兼容 API 调用及显式提示词缓存的 Python 示例,还演示了如何将模型接入开源 AI 渗透测试智能体 Strix,对本地 OWASP Juice Shop 执行授权安全测试。

    推荐理由:文章把 GLM 5.3 在 Amazon Bedrock 上的接入方式与缓存配置写成可操作示例,并展示了它在授权安全测试工作流中的用法。

  3. Google Research47

    Agent 隐私与安全中的开放问题与新兴问题:一种情境视角

    Google Research 发布《Agent 隐私与安全中的开放问题与新兴问题:一种情境视角》研讨会报告,汇集 50 多位学界和业界人士的合作成果,梳理自主 Agent 面临的隐私与安全挑战。报告以情境完整性理论为基础,提出通过情境策略引擎评估数据流和行动是否恰当,并从系统、模型和用户层面探索多层防护。

  4. TechCrunch · AI62

    TikTok推出AI购物助手和应用内一键结账

    TikTok宣布推出AI购物助手和新的应用内结账功能,让用户可以直接从品牌购买商品。购物助手以对话式AI智能体提供商品、配送、尺码和库存等信息,并协助完成购买;用户也可在For You信息流中一键结账。新功能由TikTok与Salesforce、Shopify、Shoplazza和Stripe等商务平台及支付服务商合作开发。

  5. TechCrunch · AI52

    Hot Girl Hotline 推出面向年轻女性的 AI 关系建议应用

    两姐妹创办的 Hot Girl Hotline 推出面向年轻女性的 AI 关系建议应用,帮助用户以更安全的方式讨论约会与亲密关系问题。应用采用基于行为科学的建议和苏格拉底式提问,并会在对话出现风险信号时转介至 988 等资源。该应用可根据用户的价值观、目标、身份和偏好个性化建议,月费为 $9.99,现已在 iOS 和网页端提供。

  6. TechCrunch · AI67

    HackerRank 向客户全面开放 AI 面试官 Chakra

    HackerRank 向客户全面开放 AI 智能体面试官 Chakra,它通过真实代码仓库任务观察候选人的工作过程,并评估答案、判断和 AI 使用能力。测试期间,Chakra 已进行超过 500,000 次面试;HackerRank 称,其面试中的可疑活动标记比可比的传统评估低 70% 至 80%,但比例因地区和资历等因素而异。Chakra 为候选人评分,最终招聘决定仍由人类作出。

10月5日周一
  1. AWS Machine Learning Blog71

    AWS 发布 Amazon Quick Resource Migrator,实现跨账户资源自动迁移

    AWS 介绍了 Quick Resource Migrator,这是一个运行在 Amazon Bedrock AgentCore 上的 MCP 服务器,可将 Amazon Quick 资源从开发账户迁移到生产账户。

    推荐理由:文章拆解了跨账户迁移的资源选择、权限复用、备份回滚与预览流程,可帮助团队理解如何把 Amazon Quick 资源纳入可审计的发布流程。

  2. AWS Machine Learning Blog62

    如何用 LangChain 和 Amazon Bedrock Knowledge Bases 实现智能体检索

    文章演示如何在 LangChain 与 Amazon Bedrock Managed Knowledge Base 中使用标准检索和智能体检索,比较它们处理多部分问题的方式。标准检索以一次混合搜索返回结果,智能体检索则拆分子查询、评估证据并在需要时继续搜索;前者更快、更便宜,后者在多跳问题上的召回有所提升,但成本和延迟更高。

    推荐理由:文章用同一多部分问题对比单次检索与规划式检索,并拆解其成本、延迟和召回取舍,提供了按查询复杂度选择路径的依据。

  3. AWS Machine Learning Blog61

    AWS 教程:使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与帮助性

    AWS 展示了如何使用 Amazon Bedrock AgentCore Evaluations 构建并评估多智能体供应链决策系统,检查帮助性、业务准确性与可解释性。示例采用协调智能体和优化、分销、路线规划、分析四个专业智能体,并结合内置评估器与自定义评估器,分层验证通用质量、业务规则和决策说明。评估支持开发阶段的按需模式与生产环境的在线监控模式,文中提供部署、运行及评估步骤。

    推荐理由:文章用供应链多智能体示例拆解三层评估流程,将通用质量、业务规则正确性与可解释性分开衡量,便于定位不同的改进方向。

  4. MIT Technology Review · AI34

    如何将 AI 智能体连接到企业知识

    企业 AI 智能体缺乏组织语境知识,是项目难以投入生产的重要原因;平均只有 34% 的智能体项目进入生产阶段。调查发现,生产表现较好的组织知识能力更强,数据碎片化则是扩大智能体知识访问的首要挑战,55% 的受访者提及。企业计划投资检索技术、AI-ready API、RAG、AI 评估智能体和知识图谱,以加强数据与智能体的连接。

10月4日周日
  1. Simon Willison61

    Simon Willison 呼吁按用量计费服务默认设置硬预算上限

    Simon Willison 呼吁按用量计费的服务和 API 默认设置硬预算上限,达到月度额度后应停止服务并返回错误,而不是只发送警告。他指出,编码智能体和个人智能体降低了部署能产生费用的代码的门槛,失控服务可能带来意外账单。AWS 几周前推出项目月度支出上限,达到上限后项目当月暂停;Google Cloud 也在 7 月推出了类似的 Spend Caps 功能。

  2. Hugging Face Blog80

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测基准

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。

    推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。

10月2日周五
  1. MIT Technology Review · AI20

    用自主 AI 重新定义企业智能

    企业 AI 投资增长、模型能力提升,但许多企业仍受数据孤岛和系统碎片化制约,未能通过 AI 增加收入或从根本上改变运营方式。报告指出,持续获得回报的企业先重设计流程,再选择模型;数据是否适合 AI 使用,比数据总量更关键。可组合、具备主权控制的数据基础有助于在不迁移或集中数据的情况下支持 AI 智能体。

  2. AWS Machine Learning Blog76

    AWS 教程:用 Amazon Quick 与 Adjudicated Query 模式核查数万份租约合规性

    AWS 介绍 Adjudicated Query 模式,使用 Amazon Quick 对话界面接收合规问题,并由确定性规则引擎完成租约核查,模型只负责将自然语言转换为固定操作调用和叙述结果,不参与判定。

    推荐理由:文章以租约合规为例,拆解如何用确定性规则引擎与完整性回执保证逐条核查,并说明对话模型应与判定环节隔离。

  3. GitHub Blog · AI & ML40

    AI 正在改变开发者工作:GitHub 提出三项值得加强的技能

    GitHub 指出,AI 正在改变开发者的工作方式,并提出三项值得加强的技能:指导 AI 智能体完成任务、审查而非轻信 AI 的首个答案,以及用节省的实现时间解决更大的问题。GitHub Copilot 内置的 Rubber Duck agent 会使用第二个模型,在继续推进前评审计划、代码和测试。越多实现工作交由 AI 处理,开发者的技术判断、权衡能力和问题选择就越重要。

  4. Latent Space58

    Latent Space 访谈 MIT 的 Alex Zhang:研究选题、RLM 与智能体 harness

    Latent Space 采访 MIT 的 Alex Zhang,讨论 RLM、GPU kernels、研究选题,以及 harness 如何帮助模型处理长上下文并提升跨任务组合泛化。Alex 介绍了 RLM 的上下文卸载、代码执行和递归调用子智能体机制,并认为学术研究者可以押注起初看似微小或古怪的问题;访谈还涉及多智能体系统、工具调用与模型能力过剩。

10月1日周四
  1. Simon Willison57

    Simon Willison 引述 Matthew Green 对智能体蠕虫与沙箱隔离的分析

    Simon Willison 引述 Matthew Green 对智能体蠕虫风险的分析:恶意载荷可以劫持智能体,而被劫持的智能体又可能将载荷传递给下一个智能体。彼此隔离的沙箱内智能体曾通过共享软件包缓存留下指令,改变接收方的行为;若将缓存换成电子邮件、Slack、共享文档或 WhatsApp,并将训练运行换成独立部署的个人智能体,便具备了蠕虫所需的要素。

9月30日周三
9月29日周二
  1. Hugging Face Blog67

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。

    推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。

9月28日周一
  1. Hugging Face Blog80

    H Company 发布 Holo4 智能体模型系列,提供 27B 与 35B-A3B 两种规格

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。

    推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。

  2. Hugging Face Blog72

    Hugging Face Hub 新增 RL Environments 筛选与框架标签

    Hugging Face Hub 为 RL Environments 新增专属筛选,并允许数据集通过框架标签标示兼容性。首批登记 Harbor、Verifiers、OpenEnv 和 NeMo Gym,页面会为每个框架生成运行命令;环境仍以数据集仓库形式托管,框架负责运行。该更新不新增仓库类型、注册中心或注册流程。

    推荐理由:这次更新把 RL 环境作为带兼容性标签的数据集纳入 Hub,集中展示不同框架可加载的任务,并保留各框架运行环境的职责。

9月26日周六
  1. GitHub Blog · AI & ML64

    GitHub Copilot app 初学者指南:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvases 允许用户与智能体共享可自定义界面,并围绕各自工作流调整内容。用户可在智能体会话中输入 `/create-canvas` 技能并描述需求,无需手动编写代码或设计界面,智能体便会创建画布。画布可保存为团队共享或个人扩展,用户和智能体也能同时修改共享状态。

    推荐理由:文章通过创建发布说明看板的示例,展示从自然语言描述到可复用画布的过程,并说明用户与智能体如何同步修改共享界面。

9月25日周五
  1. Google Research67

    Google Research 介绍长篇连贯视频生成研究及四项框架

    Google Research 介绍一套面向长篇连贯视频生成的多智能体框架,旨在提升多镜头叙事的一致性并减少视觉漂移和流程错误传播。研究包含 Co-Director、CANVAS、A²RD 和 VQQA,分别处理创意编排、视觉连续性、长时序生成与闭环修正。评测中,Co-Director 在 GenAD-Bench 上取得 81.4 的峰值质量分数;其余框架也在文中列出的多个基准上展示了相应改进。

    推荐理由:文章将长视频生成拆解为创意编排、视觉分镜、时序延展和闭环修正四类问题,并说明各框架如何应对连续性漂移。

  2. GitHub Blog · AI & ML75

    GitHub Security Lab 开源 Fuzzing Taskflow 智能体,自动化 C/C++ 模糊测试

    GitHub Security Lab 开源了面向 C/C++ 项目的 Fuzzing Taskflow,由 LLM 智能体自动识别代码入口、编写 harness、运行 AFL++、根据覆盖率改进测试,并对崩溃进行分诊和生成漏洞报告。

    推荐理由:文章拆解了覆盖率反馈、结构化输入生成与崩溃分诊的自动化流程,也说明模型报告仍需人工审查,可供安全测试工作流设计参考。

  3. Google DeepMind79

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini Enterprise 提供带动态视觉形象的实时对话功能。它结合近实时视频生成与语音,支持后台异步调用工具并在对话不中断时处理任务,还可在97种语言间切换。组织可从参考图生成定制化 Avatar,但该功能目前仅向获准的企业开放;音视频输出均嵌入 SynthID 水印。

    推荐理由:该功能结合实时音视频对话与后台异步工具调用,并支持跨97种语言切换,可看出企业对话场景中交互连续性与多语言适配的设计重点。

9月24日周四
  1. GitHub Blog · AI & ML72

    GitHub Copilot app 如何流畅渲染超大型 Pull Request

    GitHub 重建了 GitHub Copilot app 的 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评论的 PR 仍能流畅浏览。文章详述了代码行与动态评论分开管理高度、滚动时延后测量并保持阅读锚点,以及通过缓存和自动化测量循环定位性能问题的做法。

    推荐理由:文章拆解了超大型 PR 视图的关键设计取舍,尤其说明动态评论如何影响虚拟化,以及团队如何通过锚定校正和自动化测量避免滚动卡顿。

9月18日周五
  1. Google Research72

    Google Research 推出面向教育的生成式界面互动学习模拟实验

    Google Research 推出一项生成式界面研究实验,允许教师按教学目标和课程动态生成定制的互动学习模拟。Google 同时发布了 30 多个英文 STEM 互动示例,涵盖物理、化学、生物和数学,并由教师审核;12 名美国教师的初步试用评分平均为 8/10。

    推荐理由:这项研究展示了生成式界面如何结合课程目标、分级挑战和教师审核来生成互动模拟,并给出了教师试用反馈。

9月17日周四
  1. GitHub Blog · AI & ML81

    GitHub Copilot 团队如何借助 Copilot 将运行时迁移到 Rust

    GitHub 将 Copilot 智能体运行时从 TypeScript 迁移为 Rust,项目主要由 AI 智能体编写代码,并通过 128 个 pull request 分批合入和发布。运行时最终包含 832,378 行生产 Rust 代码,迁移期间发布了 135 个版本;作者还介绍了原地替换策略、测试验证以及多智能体协作中的协调经验。

    推荐理由:文章以运行时迁移为例,结合渐进式替换、测试和发布数据,呈现了用智能体协作完成大型代码迁移的具体做法。

9月11日周五
  1. Google Research57

    Google Research 发布 ToolGrad,提升工具调用数据生成效率

    Google Research 在 ACL 2026 介绍 ToolGrad,一种先生成真实工具调用链、再标注对应用户查询的工具使用数据生成方法。它通过文本“梯度”迭代构建 API 工作流,并在 ToolBench 的 16k+ API 上生成数据;结果显示,该方法以较低成本生成更复杂的数据,数据生成通过率接近 100%。