跳到正文
  1. GitHub Blog · AI & ML76

    GitHub 发布 ReviewBench 开放基准,评测 AI 代码审查智能体

    GitHub 推出 ReviewBench 开放基准,用于评测 AI 代码审查智能体,并提供公开数据集、统一评分方法和系统比较入口。基准包含来自 187 个开源许可仓库的 219 个 PR,覆盖 19 种语言,其分布参考了对 103.9M 个 GitHub PR 的分析;资深工程师独立复核标注,判断一致率为 96.6%。

    推荐理由:ReviewBench 将真实 PR 分布、多来源标注和专家复核纳入同一评测流程,并用线上实验对照离线信号,为代码审查智能体比较提供可复现依据。

  1. Hugging Face Blog80

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测基准

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。

    推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。

  1. Microsoft Research77

    Microsoft Physical AI Toolchain 新增机器人推理卸载能力

    Microsoft Research 宣布 Physical AI Toolchain 新增机器人推理卸载能力,可通过 Kubernetes 工具在机器人、边缘 GPU 和云端之间分配推理工作负载。研究发现,部分较轻 GPU 上的地图构建与规划速度较 A100 慢最多 383%,较大的板载 GPU 还会显著消耗机器人电量;文章也提供了 SO-101 和 UR10e 的卸载示例。

    推荐理由:文章结合移动操作任务测量了端侧与卸载推理的性能和续航差异,并介绍 Kubernetes 工具链如何在机器人、边缘 GPU 与云端间分配工作负载。

  1. Microsoft Research61

    MindTopo 基准揭示 VLM 的空间推理能力

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通、分离、顺序、包围和打结等拓扑关系的推理与规划能力。测试结果显示,模型在静态场景识别上的表现优于交互规划;规划错误常出现在模型已理解场景之后,包括未能追踪多步动作的后果或提出违反环境规则的动作。

    推荐理由:MindTopo将静态识别与交互规划放在同一基准中比较,揭示多模态模型在连续动作中维持拓扑关系时的表现落差。

已经到底了