跳到正文
10月4日周日
  1. Hugging Face Blog80

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测基准

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。

    推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。

10月2日周五
  1. Hugging Face Blog70

    Asta 团队开源 AstaBrief 8B 科学报告生成模型

    Asta 团队开源 AstaBrief 8B,这是一款根据研究问题和检索到的文献片段生成带引用报告的模型,也已作为 Asta 的 Fast 模式上线。该模型以 Qwen3-8B 为基础,开放模型权重和训练数据;在 Asta 全流程中,Fast 模式平均每份报告耗时 51.1 秒,Thinking 模式为 178.5 秒,约快 3.5 倍。

    推荐理由:AstaBrief 的训练经验显示,筛除低引用密度样本比尝试更复杂的过滤组合更有效,为科学报告模型的数据筛选提供了具体参考。

9月30日周三
  1. Hugging Face Blog64

    Hugging Face 推出 Open TTS Leaderboard,多维评测多语言语音合成与音色克隆

    Hugging Face 推出 Open TTS Leaderboard,使用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度。排行榜支持多语言与音色克隆比较,并提供试听和投票功能;流式性能按首段音频时间(TTFA)衡量,可查看 H200 GPU 和部分 CPU 结果。该排行榜补充而不取代人工偏好评测,评测脚本计划随后开源。

    推荐理由:排行榜将多语言语音合成、音色克隆和流式延迟纳入同一评测框架,并与人工偏好投票互补,呈现开源 TTS 模型比较中的不同维度。

9月29日周二
  1. Hugging Face Blog67

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。

    推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。

9月28日周一
  1. Hugging Face Blog80

    H Company 发布 Holo4 智能体模型系列,提供 27B 与 35B-A3B 两种规格

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。

    推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。

  2. Hugging Face Blog72

    Hugging Face Hub 新增 RL Environments 筛选与框架标签

    Hugging Face Hub 为 RL Environments 新增专属筛选,并允许数据集通过框架标签标示兼容性。首批登记 Harbor、Verifiers、OpenEnv 和 NeMo Gym,页面会为每个框架生成运行命令;环境仍以数据集仓库形式托管,框架负责运行。该更新不新增仓库类型、注册中心或注册流程。

    推荐理由:这次更新把 RL 环境作为带兼容性标签的数据集纳入 Hub,集中展示不同框架可加载的任务,并保留各框架运行环境的职责。

8月25日周二