跳到正文
今天10月6日周二4 条
  1. AWS Machine Learning Blog78

    GLM 5.3 在 Amazon Bedrock 上线,支持缓存配置与 Strix 安全测试

    AWS 宣布 GLM 5.3 已在 Amazon Bedrock 上提供,企业用户可通过托管 API 调用该模型,并使用跨区域推理、提示词缓存和不同服务层级。文章给出 OpenAI 兼容 API 调用及显式提示词缓存的 Python 示例,还演示了如何将模型接入开源 AI 渗透测试智能体 Strix,对本地 OWASP Juice Shop 执行授权安全测试。

    推荐理由:文章把 GLM 5.3 在 Amazon Bedrock 上的接入方式与缓存配置写成可操作示例,并展示了它在授权安全测试工作流中的用法。

  2. Google Research47

    Agent 隐私与安全中的开放问题与新兴问题:一种情境视角

    Google Research 发布《Agent 隐私与安全中的开放问题与新兴问题:一种情境视角》研讨会报告,汇集 50 多位学界和业界人士的合作成果,梳理自主 Agent 面临的隐私与安全挑战。报告以情境完整性理论为基础,提出通过情境策略引擎评估数据流和行动是否恰当,并从系统、模型和用户层面探索多层防护。

  3. AWS Machine Learning Blog69

    Amazon SageMaker 推出面向编码智能体的 aws-ai-ml skill

    Amazon SageMaker AI 推出 aws-ai-ml skill,可接入支持 MCP 的编码智能体,协助优化生成式 AI 推理。它能对端点进行基准测试、推荐部署配置、比较性能数据,并生成可检查和运行的 SageMaker Python SDK v3 代码;文章介绍了通过 Agent Toolkit for AWS 或 SageMaker Studio 安装和使用的方法。

    推荐理由:文章说明了如何将 aws-ai-ml skill 接入 MCP 兼容的编码智能体,并展示其基准测试、部署配置推荐与结果对比流程。

10月5日周一
  1. GitHub Blog · AI & ML76

    GitHub 发布 ReviewBench 开放基准,评测 AI 代码审查智能体

    GitHub 推出 ReviewBench 开放基准,用于评测 AI 代码审查智能体,并提供公开数据集、统一评分方法和系统比较入口。基准包含来自 187 个开源许可仓库的 219 个 PR,覆盖 19 种语言,其分布参考了对 103.9M 个 GitHub PR 的分析;资深工程师独立复核标注,判断一致率为 96.6%。

    推荐理由:ReviewBench 将真实 PR 分布、多来源标注和专家复核纳入同一评测流程,并用线上实验对照离线信号,为代码审查智能体比较提供可复现依据。

  2. AWS Machine Learning Blog71

    AWS 发布 Amazon Quick Resource Migrator,实现跨账户资源自动迁移

    AWS 介绍了 Quick Resource Migrator,这是一个运行在 Amazon Bedrock AgentCore 上的 MCP 服务器,可将 Amazon Quick 资源从开发账户迁移到生产账户。

    推荐理由:文章拆解了跨账户迁移的资源选择、权限复用、备份回滚与预览流程,可帮助团队理解如何把 Amazon Quick 资源纳入可审计的发布流程。

  3. AWS Machine Learning Blog62

    如何用 LangChain 和 Amazon Bedrock Knowledge Bases 实现智能体检索

    文章演示如何在 LangChain 与 Amazon Bedrock Managed Knowledge Base 中使用标准检索和智能体检索,比较它们处理多部分问题的方式。标准检索以一次混合搜索返回结果,智能体检索则拆分子查询、评估证据并在需要时继续搜索;前者更快、更便宜,后者在多跳问题上的召回有所提升,但成本和延迟更高。

    推荐理由:文章用同一多部分问题对比单次检索与规划式检索,并拆解其成本、延迟和召回取舍,提供了按查询复杂度选择路径的依据。

  4. AWS Machine Learning Blog61

    AWS 教程:使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与帮助性

    AWS 展示了如何使用 Amazon Bedrock AgentCore Evaluations 构建并评估多智能体供应链决策系统,检查帮助性、业务准确性与可解释性。示例采用协调智能体和优化、分销、路线规划、分析四个专业智能体,并结合内置评估器与自定义评估器,分层验证通用质量、业务规则和决策说明。评估支持开发阶段的按需模式与生产环境的在线监控模式,文中提供部署、运行及评估步骤。

    推荐理由:文章用供应链多智能体示例拆解三层评估流程,将通用质量、业务规则正确性与可解释性分开衡量,便于定位不同的改进方向。

  5. NVIDIA Blog58

    NVIDIA介绍AI初创公司如何应对乳腺癌诊疗中的关键缺口

    NVIDIA介绍其Inception创业公司如何利用AI支持乳腺癌影像筛查、风险评估和治疗规划,覆盖诊疗流程中的多个环节。iSono Health的ATUSA可在每侧乳房约两分钟内完成自动化3D超声扫描;Ataraxis AI则使用病理切片和临床数据预测治疗反应与复发风险,其模型已在10多家机构和多项临床试验中验证,并投入临床使用。

10月4日周日
  1. Hugging Face Blog80

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测基准

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。

    推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。

10月3日周六
10月2日周五
  1. AWS Machine Learning Blog76

    AWS 教程:用 Amazon Quick 与 Adjudicated Query 模式核查数万份租约合规性

    AWS 介绍 Adjudicated Query 模式,使用 Amazon Quick 对话界面接收合规问题,并由确定性规则引擎完成租约核查,模型只负责将自然语言转换为固定操作调用和叙述结果,不参与判定。

    推荐理由:文章以租约合规为例,拆解如何用确定性规则引擎与完整性回执保证逐条核查,并说明对话模型应与判定环节隔离。

  2. Hugging Face Blog70

    Asta 团队开源 AstaBrief 8B 科学报告生成模型

    Asta 团队开源 AstaBrief 8B,这是一款根据研究问题和检索到的文献片段生成带引用报告的模型,也已作为 Asta 的 Fast 模式上线。该模型以 Qwen3-8B 为基础,开放模型权重和训练数据;在 Asta 全流程中,Fast 模式平均每份报告耗时 51.1 秒,Thinking 模式为 178.5 秒,约快 3.5 倍。

    推荐理由:AstaBrief 的训练经验显示,筛除低引用密度样本比尝试更复杂的过滤组合更有效,为科学报告模型的数据筛选提供了具体参考。

  3. GitHub Blog · AI & ML40

    AI 正在改变开发者工作:GitHub 提出三项值得加强的技能

    GitHub 指出,AI 正在改变开发者的工作方式,并提出三项值得加强的技能:指导 AI 智能体完成任务、审查而非轻信 AI 的首个答案,以及用节省的实现时间解决更大的问题。GitHub Copilot 内置的 Rubber Duck agent 会使用第二个模型,在继续推进前评审计划、代码和测试。越多实现工作交由 AI 处理,开发者的技术判断、权衡能力和问题选择就越重要。

  4. Google Research79

    Google Research 介绍基于 TEE 的联邦学习系统,提升隐私保障与训练效率

    Google Research 介绍了新一代基于可信执行环境(TEE)的联邦学习(FL)系统,通过公开访问策略、可验证执行和差分隐私,增强数据匿名化的可审计性。Gboard 已用该系统部署英语和日语的下一个词预测模型,获得更强隐私保障和更高准确率,训练时间也较以往显著缩短。

    推荐理由:文章梳理了 TEE 如何把访问策略、可审计执行与差分隐私结合起来,并以 Gboard 部署说明这种架构的实际应用。

  5. NVIDIA Blog80

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 运行于 NVIDIA Blackwell GPU,现已通过 OpenAI API 向开发者提供,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。

    推荐理由:材料比较了 Astra Ultrafast 与 Standard 模式的生成速度,并联系编码智能体的多轮工具工作流,说明响应延迟如何影响交互节奏。

10月1日周四
  1. NVIDIA Blog31

    NVIDIA 如何通过高生产力、耐用性与灵活性提升 AI 工厂投资回报

    NVIDIA 通过提升生产力、耐用性和灵活性来最大化 AI 工厂投资回报:Vera Rubin NVL72 的每兆瓦吞吐量比 GB300 NVL72 高出 30 倍以上,在 DeepSeek V4 Pro 上每百万 tokens 成本最高降低 45 倍。文章还指出,NVIDIA A100 GPU 在 2020 年出货后,六年后仍在商业服务中;CUDA 支持跨代运行不同 AI 与非 AI 工作负载。

  2. Google DeepMind82

    Google 发布 Gemini 4 Argon,面向复杂工作流并分阶段开放

    Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。

    推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。

9月30日周三
  1. Google DeepMind81

    Google DeepMind 推出 SynthID Bio,为AI生成蛋白质添加水印

    Google DeepMind 推出 SynthID Bio,可将可检测的水印嵌入AI生成的蛋白质序列或预测结构,同时保留蛋白质的生物功能。针对VEGF-A、SARS-CoV-2刺突蛋白RBD和PD-L1的湿实验显示,带水印的蛋白质结合体在命中率、结合亲和力和天然序列多样性方面与未加水印版本相当。Google DeepMind还将发布方法论文、开放代码和体外数据,并向研究社区开放模型权重。

    推荐理由:SynthID Bio将水印嵌入蛋白质序列或预测结构,并以实验结果说明其检测信号与生物功能可以并存,为识别AI生成生物设计提供验证层。

  2. Hugging Face Blog64

    Hugging Face 推出 Open TTS Leaderboard,多维评测多语言语音合成与音色克隆

    Hugging Face 推出 Open TTS Leaderboard,使用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度。排行榜支持多语言与音色克隆比较,并提供试听和投票功能;流式性能按首段音频时间(TTFA)衡量,可查看 H200 GPU 和部分 CPU 结果。该排行榜补充而不取代人工偏好评测,评测脚本计划随后开源。

    推荐理由:排行榜将多语言语音合成、音色克隆和流式延迟纳入同一评测框架,并与人工偏好投票互补,呈现开源 TTS 模型比较中的不同维度。

9月29日周二
  1. Hugging Face Blog81

    NVIDIA 发布开源表格预测基础模型 Kumo Tabular

    NVIDIA 发布开源表格基础模型 Kumo Tabular,用于表格分类和回归,可根据带标签的上下文行在一次前向传播中预测新行,无需训练、调参或特征工程。模型有 28M 至 215M 参数的三种尺寸,以人工数据预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四项基准上排名第一。

    推荐理由:文章交代了人工合成表格预训练的构建方式,并列出四项基准结果,便于了解该模型的训练设计与评测表现。

  2. Microsoft Research76

    Microsoft Research 推出面向复杂生物学研究的 AI 系统 Quine

    Microsoft Research 推出 Quine,这是一个结合生物多模态世界模型与交互式研究环境的实验性 AI 研究系统,可连接科学工具、文献、湿实验室和研究人员。

    推荐理由:Quine 将生物多模态世界模型与实验工具及文献连接,并以胰腺癌细胞状态实验展示其筛选候选化合物的研究流程。

  3. Hugging Face Blog67

    ProvenanceGuard 论文提出面向 MCP 智能体的来源感知事实核验

    ProvenanceGuard 研究提出一种面向 MCP 智能体的生成后核验层,逐条检查回答中的主张是否得到其所指来源的支持,并输出来源判定及整体放行或拦截结果。在医疗智能体测试中,系统从 361 条主张中拦截了专家判定不应通过的 139 条中的 138 条,同时拦截了 67 条专家认为有支持的主张;对可识别来源的主张,来源判断准确率约为 86%。

    推荐理由:研究针对MCP智能体把事实归到错误来源的问题,展示逐条核验来源的流程及其在医疗记录数据上的测试结果。

  4. Microsoft Research40

    Microsoft Research Asia – Singapore 一年来如何通过研究、合作与人才培养推动现实影响

    Microsoft Research Asia – Singapore 在成立一周年之际,回顾其通过前沿 AI 研究、伙伴合作与人才培养推动现实应用的进展。实验室聚焦下一代 AI 模型与智能体系统、面向实际场景的领域 AI、AI 原生研究实践及生态与人才发展,并与新加坡医疗体系合作探索多模态医疗 AI 和自我进化诊断智能体。

9月28日周一
  1. Mistral AI54

    Mistral 在慕尼黑设立德国枢纽,推进工业 AI

    Mistral 宣布在慕尼黑设立新枢纽,布局 Physics AI 与工业 AI,并为企业合作伙伴提供应用工程支持。新枢纽将与 BMW 合作开展碰撞模拟和工程 AI 项目,也将与 Siemens Energy 推进工业 AI 应用;Mistral 还与慕尼黑工业大学(TUM)建立研究合作,利用风洞设施开发汽车空气动力学数字孪生。

  2. Hugging Face Blog80

    H Company 发布 Holo4 智能体模型系列,提供 27B 与 35B-A3B 两种规格

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两种规格,并在 H Models API 提供使用。模型可通过 GUI、代码、MCP 和 API 与软件交互,并针对桌面、网页、Android、代码沙盒及业务 API 等环境开展工作。H Company 还发布了 Holotron4 Nano,并开源模型权重及公开基准测试的执行轨迹。

    推荐理由:Holo4将GUI操作、代码执行与MCP或API工具调用纳入同一模型系列,并提供跨桌面、网页和Android等环境的使用方式。