Google 发布 Gemini 4 Argon,面向复杂工作流并分阶段开放
Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。
推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。
Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。
推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。
Microsoft Research 推出 Quine,这是一个结合生物多模态世界模型与交互式研究环境的实验性 AI 研究系统,可连接科学工具、文献、湿实验室和研究人员。
推荐理由:Quine 将生物多模态世界模型与实验工具及文献连接,并以胰腺癌细胞状态实验展示其筛选候选化合物的研究流程。
H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。
推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini Enterprise 提供带动态视觉形象的实时对话功能。它结合近实时视频生成与语音,支持后台异步调用工具并在对话不中断时处理任务,还可在97种语言间切换。组织可从参考图生成定制化 Avatar,但该功能目前仅向获准的企业开放;音视频输出均嵌入 SynthID 水印。
推荐理由:该功能结合实时音视频对话与后台异步工具调用,并支持跨97种语言切换,可看出企业对话场景中交互连续性与多语言适配的设计重点。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,分别侧重创意语音设计与高音量、成本高效的语音生成。
推荐理由:两款模型分别面向创意语音设计与高音量、成本效率场景,并提供逐句表演控制,呈现了语音生成在创作和规模化应用上的不同侧重。
Google Research 推出一项生成式界面研究实验,允许教师按教学目标和课程动态生成定制的互动学习模拟。Google 同时发布了 30 多个英文 STEM 互动示例,涵盖物理、化学、生物和数学,并由教师审核;12 名美国教师的初步试用评分平均为 8/10。
推荐理由:这项研究展示了生成式界面如何结合课程目标、分级挑战和教师审核来生成互动模拟,并给出了教师试用反馈。
Google DeepMind 和 Google Research 发布全球天气模型 WeatherNext 3,采用实时卫星观测生成逐小时预报,最高可达 5 公里分辨率。模型还加入降水与可再生能源相关预测;在中期全球预报评估中,降水 CRPS 相较基线最高改善 60%,并将接入 Search、Gemini、Google Maps 等产品。
推荐理由:WeatherNext 3 将实时卫星观测与气象站数据用于逐小时全球预报,并针对降水和可再生能源预测提供了具体指标与应用信息。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款开放权重病理研究模型,面向全切片表征学习和肿瘤微环境空间蛋白质组预测。
推荐理由:这组模型将病理基础模型的计算成本与队列规模联系起来,文中给出的性能和资源对比可帮助研究者评估大规模分析的可行性。
Microsoft Research 推出 MindTopo 基准,用于评估多模态大语言模型对连通、分离、顺序、包围和打结等拓扑关系的推理与规划能力。测试结果显示,模型在静态场景识别上的表现优于交互规划;规划错误常出现在模型已理解场景之后,包括未能追踪多步动作的后果或提出违反环境规则的动作。
推荐理由:MindTopo将静态识别与交互规划放在同一基准中比较,揭示多模态模型在连续动作中维持拓扑关系时的表现落差。