跳到正文
  1. GitHub Blog · AI & ML76

    GitHub 发布 ReviewBench 开放基准,评测 AI 代码审查智能体

    GitHub 推出 ReviewBench 开放基准,用于评测 AI 代码审查智能体,并提供公开数据集、统一评分方法和系统比较入口。基准包含来自 187 个开源许可仓库的 219 个 PR,覆盖 19 种语言,其分布参考了对 103.9M 个 GitHub PR 的分析;资深工程师独立复核标注,判断一致率为 96.6%。

    推荐理由:ReviewBench 将真实 PR 分布、多来源标注和专家复核纳入同一评测流程,并用线上实验对照离线信号,为代码审查智能体比较提供可复现依据。

  1. Hugging Face Blog64

    Hugging Face 推出 Open TTS Leaderboard,多维评测多语言语音合成与音色克隆

    Hugging Face 推出 Open TTS Leaderboard,使用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度。排行榜支持多语言与音色克隆比较,并提供试听和投票功能;流式性能按首段音频时间(TTFA)衡量,可查看 H200 GPU 和部分 CPU 结果。该排行榜补充而不取代人工偏好评测,评测脚本计划随后开源。

    推荐理由:排行榜将多语言语音合成、音色克隆和流式延迟纳入同一评测框架,并与人工偏好投票互补,呈现开源 TTS 模型比较中的不同维度。

  1. Hugging Face Blog81

    NVIDIA 发布开源表格预测基础模型 Kumo Tabular

    NVIDIA 发布开源表格基础模型 Kumo Tabular,用于表格分类和回归,可根据带标签的上下文行在一次前向传播中预测新行,无需训练、调参或特征工程。模型有 28M 至 215M 参数的三种尺寸,以人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四项基准上排名第一。

    推荐理由:文章交代了人工合成表格预训练的构建方式,并列出四项基准结果,便于了解该模型的训练设计与评测表现。

已经到底了