跳到正文
10月4日周日
  1. Hugging Face Blog80

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测基准

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。

    推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。

9月29日周二
  1. Hugging Face Blog67

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。

    推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。

9月21日周一
  1. Import AI42

    Import AI 473:美国超级智能战略、小鼠体内的人类脑组织与机器诠释学

    Import AI 473 聚焦 RAND 对美国超级智能战略的分析:面对 AI 发展路径的不确定性,美国应采取“行动自由”策略,投入资源保留选择空间。策略包括构建人类与 AI 生态、AI 安全架构、适应 AI 时代的国家安全体系,并提升公民、企业和政府的应对能力。文章还提及小鼠体内生长人类脑组织的研究及机器诠释学。