跳到正文
10月4日周日
  1. Hugging Face Blog80

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测基准

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。

    推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。

9月29日周二
  1. Hugging Face Blog67

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。

    推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。

9月11日周五
  1. Google Research57

    Google Research 发布 ToolGrad,提升工具调用数据生成效率

    Google Research 在 ACL 2026 介绍 ToolGrad,一种先生成真实工具调用链、再标注对应用户查询的工具使用数据生成方法。它通过文本“梯度”迭代构建 API 工作流,并在 ToolBench 的 16k+ API 上生成数据;结果显示,该方法以较低成本生成更复杂的数据,数据生成通过率接近 100%。