跳到正文

技术方向

数据与训练 最新动态

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

10 条精选近 30 天 8 条共收录 22 条

更新

数据与训练的精选

10月2日周五第 1–10 条
  1. Hugging Face Blog70

    Asta 团队开源 AstaBrief 8B 科学报告生成模型

    Asta 团队开源 AstaBrief 8B,这是一款根据研究问题和检索到的文献片段生成带引用报告的模型,也已作为 Asta 的 Fast 模式上线。该模型以 Qwen3-8B 为基础,开放模型权重和训练数据;在 Asta 全流程中,Fast 模式平均每份报告耗时 51.1 秒,Thinking 模式为 178.5 秒,约快 3.5 倍。

    推荐理由:AstaBrief 的训练经验显示,筛除低引用密度样本比尝试更复杂的过滤组合更有效,为科学报告模型的数据筛选提供了具体参考。

9月30日周三
  1. Google DeepMind81

    Google DeepMind 推出 SynthID Bio,为AI生成蛋白质添加水印

    Google DeepMind 推出 SynthID Bio,可将可检测的水印嵌入AI生成的蛋白质序列或预测结构,同时保留蛋白质的生物功能。针对VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1的湿实验显示,带水印的蛋白质结合体在命中率、结合亲和力和天然序列多样性方面与未加水印版本相当。Google DeepMind还将发布方法论文、开放代码和体外数据,并向研究社区开放模型权重。

    推荐理由:SynthID Bio将水印嵌入蛋白质序列或预测结构,并以实验结果说明其检测信号与生物功能可以并存,为识别AI生成生物设计提供验证层。

9月29日周二
  1. Hugging Face Blog81

    NVIDIA 发布开源表格预测基础模型 Kumo Tabular

    NVIDIA 发布开源表格基础模型 Kumo Tabular,用于表格分类和回归,可根据带标签的上下文行在一次前向传播中预测新行,无需训练、调参或特征工程。模型有 28M 至 215M 参数的三种尺寸,以人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四项基准上排名第一。

    推荐理由:文章交代了人工合成表格预训练的构建方式,并列出四项基准结果,便于了解该模型的训练设计与评测表现。

  2. Microsoft Research76

    Microsoft Research 推出面向复杂生物学研究的 AI 系统 Quine

    Microsoft Research 推出 Quine,这是一个结合生物多模态世界模型与交互式研究环境的实验性 AI 研究系统,可连接科学工具、文献、湿实验室和研究人员。

    推荐理由:Quine 将生物多模态世界模型与实验工具及文献连接,并以胰腺癌细胞状态实验展示其筛选候选化合物的研究流程。

9月24日周四
9月21日周一
  1. Microsoft Research70

    Microsoft Research 发布 RetroChimera 逆合成研究并开源模型

    Microsoft Research 发布 RetroChimera 逆合成研究,该模型结合 R-SMILES 2 与 NeuralLoc,并通过学习式集成重排两者提出的反应物预测。在多步合成路线评估中,RetroChimera 在十个具有挑战性的目标中成功完成九个,高于文中对比模型;其实现和权重已开源,也可通过 Microsoft Foundry 使用。

    推荐理由:RetroChimera将两种互补的逆合成模型进行学习式重排,并以盲测和多步路线评估展示其表现,呈现了集成方法应对稀有反应的思路。

9月8日周二
  1. Google DeepMind87

    Google DeepMind 推出 AlphaGenome Atlas 基因组变异预测平台

    Google DeepMind 推出 AlphaGenome Atlas,收录人类基因组约 9 billion 个单核苷酸变异的预测结果,并面向学术研究开放。平台提供 AlphaGenome Variant Impact(AVI)分数,帮助研究者排序变异并查看其分子效应;可通过网站、AlphaGenome API 和 Google Antigravity 的技能使用。

    推荐理由:AlphaGenome Atlas 将 AlphaGenome 的全基因组预测整理为可检索资源,并以 AVI 分数连接变异排序与分子效应解释,展示了其在遗传研究中的用法。

9月1日周二
  1. Microsoft Research72

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 病理基础模型

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款开放权重病理研究模型,面向全切片表征学习和肿瘤微环境空间蛋白质组预测。

    推荐理由:这组模型将病理基础模型的计算成本与队列规模联系起来,文中给出的性能和资源对比可帮助研究者评估大规模分析的可行性。

8月21日周五
  1. Microsoft Research70

    Microsoft Research 扩大 Skala 接入范围,Skala 1.1 提升 DFT 精度

    Microsoft Research 发布 Skala 1.1,并宣布其已接入 CP2K,正集成至 Psi4、FHI-aims、ORCA 和 VASP。Skala 1.1 的训练数据量是首个公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中有 32 个排名第一,平均加权误差为 2.8 kcal/mol;团队还发布了跟踪不同版本和软硬件平台计算性能的持续更新报告。

    推荐理由:Skala 1.1 的精度提升与多软件集成同步推进,文中还介绍了持续更新的性能报告,呈现其走向计算化学工作流的路径。