跳到正文
今天10月6日周二1 条
10月5日周一
  1. NVIDIA Blog58

    NVIDIA介绍AI初创公司如何应对乳腺癌诊疗中的关键缺口

    NVIDIA介绍其Inception创业公司如何利用AI支持乳腺癌影像筛查、风险评估和治疗规划,覆盖诊疗流程中的多个环节。iSono Health的ATUSA可在每侧乳房约两分钟内完成自动化3D超声扫描;Ataraxis AI则使用病理切片和临床数据预测治疗反应与复发风险,其模型已在10多家机构和多项临床试验中验证,并投入临床使用。

  2. The Decoder62

    OpenAI 将在 ChatGPT 图像生成等待界面测试轮播广告

    OpenAI 将于本月晚些时候面向美国 ChatGPT 用户测试新的展示广告,在图像生成期间于生成图像下方显示轮播或一排产品图片。广告会标注为广告,并与生成图像分开。OpenAI 还在扩展广告衡量和品牌安全工具,包括接收转化数据、开展地域实验,以及让部分广告商设置否定关键词。

10月1日周四
  1. Google DeepMind82

    Google 发布 Gemini 4 Argon,面向复杂工作流并分阶段开放

    Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。

    推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。

9月29日周二
  1. Microsoft Research76

    Microsoft Research 推出面向复杂生物学研究的 AI 系统 Quine

    Microsoft Research 推出 Quine,这是一个结合生物多模态世界模型与交互式研究环境的实验性 AI 研究系统,可连接科学工具、文献、湿实验室和研究人员。

    推荐理由:Quine 将生物多模态世界模型与实验工具及文献连接,并以胰腺癌细胞状态实验展示其筛选候选化合物的研究流程。

9月28日周一
  1. Hugging Face Blog80

    H Company 发布 Holo4 智能体模型系列,提供 27B 与 35B-A3B 两种规格

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。

    推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。

9月25日周五
  1. Google DeepMind79

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini Enterprise 提供带动态视觉形象的实时对话功能。它结合近实时视频生成与语音,支持后台异步调用工具并在对话不中断时处理任务,还可在97种语言间切换。组织可从参考图生成定制化 Avatar,但该功能目前仅向获准的企业开放;音视频输出均嵌入 SynthID 水印。

    推荐理由:该功能结合实时音视频对话与后台异步工具调用,并支持跨97种语言切换,可看出企业对话场景中交互连续性与多语言适配的设计重点。

9月23日周三
  1. Google DeepMind83

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,分别侧重创意语音设计与高音量、成本高效的语音生成。

    推荐理由:两款模型分别面向创意语音设计与高音量、成本效率场景,并提供逐句表演控制,呈现了语音生成在创作和规模化应用上的不同侧重。

9月18日周五
  1. Google Research72

    Google Research 推出面向教育的生成式界面互动学习模拟实验

    Google Research 推出一项生成式界面研究实验,允许教师按教学目标和课程动态生成定制的互动学习模拟。Google 同时发布了 30 多个英文 STEM 互动示例,涵盖物理、化学、生物和数学,并由教师审核;12 名美国教师的初步试用评分平均为 8/10。

    推荐理由:这项研究展示了生成式界面如何结合课程目标、分级挑战和教师审核来生成互动模拟,并给出了教师试用反馈。

9月16日周三
  1. Mistral AI59

    Mistral 与 Mozilla 合作,让 Firefox Smart Window 由 Mistral 模型驱动

    Mistral 宣布与 Mozilla 合作,由 Mistral 模型驱动 Firefox Smart Window(beta),为浏览网页的用户提供 AI 助手。该助手可帮助用户理解复杂搜索、找回曾关闭的内容,并根据浏览器标签页整理信息;目前面向法国和北美用户,英国和德国预计今年晚些时候跟进。对话默认不会保存在 Mozilla 服务器上,Mistral 等合作方承诺零数据保留。

9月3日周四
  1. Google DeepMind83

    Google DeepMind 发布全球天气 AI 模型 WeatherNext 3

    Google DeepMind 和 Google Research 发布全球天气模型 WeatherNext 3,采用实时卫星观测生成逐小时预报,最高可达 5 公里分辨率。模型还加入降水与可再生能源相关预测;在中期全球预报评估中,降水 CRPS 相较基线最高改善 60%,并将接入 Search、Gemini、Google Maps 等产品。

    推荐理由:WeatherNext 3 将实时卫星观测与气象站数据用于逐小时全球预报,并针对降水和可再生能源预测提供了具体指标与应用信息。

9月1日周二
  1. Microsoft Research72

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 病理基础模型

    Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款开放权重病理研究模型,面向全切片表征学习和肿瘤微环境空间蛋白质组预测。

    推荐理由:这组模型将病理基础模型的计算成本与队列规模联系起来,文中给出的性能和资源对比可帮助研究者评估大规模分析的可行性。

8月13日周四
  1. Microsoft Research61

    MindTopo 基准揭示 VLM 的空间推理能力

    Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通、分离、顺序、包围和打结等拓扑关系的推理与规划能力。测试结果显示,模型在静态场景识别上的表现优于交互规划;规划错误常出现在模型已理解场景之后,包括未能追踪多步动作的后果或提出违反环境规则的动作。

    推荐理由:MindTopo将静态识别与交互规划放在同一基准中比较,揭示多模态模型在连续动作中维持拓扑关系时的表现落差。

1月10日周六
  1. Berkeley AI Research59

    Berkeley AI Research提出基于信息量评估与优化成像系统的方法

    Berkeley AI Research提出基于互信息直接评估和优化成像系统的方法,并将结果发表于 NeurIPS 2025 论文。该方法在彩色摄影、射电天文学、无透镜成像和显微成像四个领域检验了信息估计与下游表现的关系;其 IDEAL 方法通过梯度上升优化系统参数,无需在训练中反向传播解码器。