跳到正文
  1. AWS Machine Learning Blog78

    GLM 5.3 在 Amazon Bedrock 上线,支持缓存配置与 Strix 安全测试

    AWS 宣布 GLM 5.3 已在 Amazon Bedrock 上提供,企业用户可通过托管 API 调用该模型,并使用跨区域推理、提示词缓存和不同服务层级。文章给出 OpenAI 兼容 API 调用及显式提示词缓存的 Python 示例,还演示了如何将模型接入开源 AI 渗透测试智能体 Strix,对本地 OWASP Juice Shop 执行授权安全测试。

    推荐理由:文章把 GLM 5.3 在 Amazon Bedrock 上的接入方式与缓存配置写成可操作示例,并展示了它在授权安全测试工作流中的用法。

  2. AWS Machine Learning Blog64

    AWS 教程:在 GovCloud 中通过 Amazon Bedrock 使用 Claude Code

    AWS 介绍了在 AWS GovCloud (US) 中通过 Amazon Bedrock 配置 Claude Code,为受监管工作负载提供 AI 辅助开发方案。

    推荐理由:文章并列说明 bedrock-runtime 与 bedrock-mantle 的功能和合规差异,并提供配置步骤,便于团队按审计与接口需求选择接入方式。

  3. AWS Machine Learning Blog69

    Amazon SageMaker 推出面向编码智能体的 aws-ai-ml skill

    Amazon SageMaker AI 推出 aws-ai-ml skill,可接入支持 MCP 的编码智能体,协助优化生成式 AI 推理。它能对端点进行基准测试、推荐部署配置、比较性能数据,并生成可检查和运行的 SageMaker Python SDK v3 代码;文章介绍了通过 Agent Toolkit for AWS 或 SageMaker Studio 安装和使用的方法。

    推荐理由:文章说明了如何将 aws-ai-ml skill 接入 MCP 兼容的编码智能体,并展示其基准测试、部署配置推荐与结果对比流程。

  1. AWS Machine Learning Blog71

    AWS 发布 Amazon Quick Resource Migrator,实现跨账户资源自动迁移

    AWS 介绍了 Quick Resource Migrator,这是一个运行在 Amazon Bedrock AgentCore 上的 MCP 服务器,可将 Amazon Quick 资源从开发账户迁移到生产账户。

    推荐理由:文章拆解了跨账户迁移的资源选择、权限复用、备份回滚与预览流程,可帮助团队理解如何把 Amazon Quick 资源纳入可审计的发布流程。

  2. AWS Machine Learning Blog62

    如何用 LangChain 和 Amazon Bedrock Knowledge Bases 实现智能体检索

    文章演示如何在 LangChain 与 Amazon Bedrock Managed Knowledge Base 中使用标准检索和智能体检索,比较它们处理多部分问题的方式。标准检索以一次混合搜索返回结果,智能体检索则拆分子查询、评估证据并在需要时继续搜索;前者更快、更便宜,后者在多跳问题上的召回有所提升,但成本和延迟更高。

    推荐理由:文章用同一多部分问题对比单次检索与规划式检索,并拆解其成本、延迟和召回取舍,提供了按查询复杂度选择路径的依据。

  3. AWS Machine Learning Blog61

    AWS 教程:使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与帮助性

    AWS 展示了如何使用 Amazon Bedrock AgentCore Evaluations 构建并评估多智能体供应链决策系统,检查帮助性、业务准确性与可解释性。示例采用协调智能体和优化、分销、路线规划、分析四个专业智能体,并结合内置评估器与自定义评估器,分层验证通用质量、业务规则和决策说明。评估支持开发阶段的按需模式与生产环境的在线监控模式,文中提供部署、运行及评估步骤。

    推荐理由:文章用供应链多智能体示例拆解三层评估流程,将通用质量、业务规则正确性与可解释性分开衡量,便于定位不同的改进方向。

  1. AWS Machine Learning Blog76

    AWS 教程:用 Amazon Quick 与 Adjudicated Query 模式核查数万份租约合规性

    AWS 介绍 Adjudicated Query 模式,使用 Amazon Quick 对话界面接收合规问题,并由确定性规则引擎完成租约核查,模型只负责将自然语言转换为固定操作调用和叙述结果,不参与判定。

    推荐理由:文章以租约合规为例,拆解如何用确定性规则引擎与完整性回执保证逐条核查,并说明对话模型应与判定环节隔离。

  2. Google Research79

    Google Research 介绍基于 TEE 的联邦学习系统,提升隐私保障与训练效率

    Google Research 介绍了新一代基于可信执行环境(TEE)的联邦学习(FL)系统,通过公开访问策略、可验证执行和差分隐私,增强数据匿名化的可审计性。Gboard 已用该系统部署英语和日语的下一个词预测模型,获得更强隐私保障和更高准确率,训练时间也较以往显著缩短。

    推荐理由:文章梳理了 TEE 如何把访问策略、可审计执行与差分隐私结合起来,并以 Gboard 部署说明这种架构的实际应用。

  3. NVIDIA Blog72

    NVIDIA DGX Spark 推出 64GB 配置,支持双机集群扩展

    NVIDIA DGX Spark 将推出 64GB 配置,面向开发者、研究人员和 AI 爱好者,可在设备本地运行最多 100-billion-parameter 模型。

    推荐理由:64GB 配置覆盖单机本地运行与双机扩展,文中还给出 Qwen 3.8 27B 测试的性能对比和集群接入方式,便于评估扩容路径。

  4. Hugging Face Blog69

    AutoSynthData 如何为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,根据目标模型的失败和更强教师模型的成功生成、验证训练任务,并用于模型微调。

    推荐理由:文章展示了从模型失败提炼能力缺口、生成并验证训练任务的流程,并报告该方法在 EnterpriseOps Gym 两个领域的微调结果。

  1. Latent Space77

    Latent Space 访谈解析 OpenAI 计算机操作进展与 Decisions API

    Latent Space 访谈 OpenAI 的 Ari Weinstein 和 Nikunj Handa,讨论计算机操作智能体的进展及 OpenAI DevDay 发布的 API 变化。

    推荐理由:访谈把计算机操作能力变化拆解为模型调试恢复、页面信息表示和执行速度等因素,并呈现了 OpenAI 团队对 API 设计与安全措施的说明。

  1. NVIDIA Blog76

    NVIDIA 与 CoreWeave 推出 Vera Rubin 云服务并发布 CoreWeave Forge

    NVIDIA 与 CoreWeave 宣布在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,并推出模型与智能体训练、评估和改进环境 CoreWeave Forge。

    推荐理由:文章把 Vera Rubin 的生产部署、Vera CPU 测试和 Forge 的训练改进流程放在同一案例中,呈现从推理到持续优化的具体做法。

  1. GitHub Blog · AI & ML62

    GitHub Copilot 的 canvas 如何突破聊天界面的限制

    GitHub Blog 作者 Burke Holland 主张,聊天并非与 AI 交互的最佳界面,并介绍了 GitHub Copilot app 中名为 canvas 的可定制界面。

    推荐理由:文章通过 Connect 4、Winget、SQLite 和开发流程自动化等实例,说明自定义界面如何让 Copilot 智能体参与任务并减少反复聊天交互。

  1. GitHub Blog · AI & ML72

    GitHub Copilot app 如何流畅渲染超大型 Pull Request

    GitHub 重建了 GitHub Copilot app 的 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评论的 PR 仍能流畅浏览。文章详述了代码行与动态评论分开管理高度、滚动时延后测量并保持阅读锚点,以及通过缓存和自动化测量循环定位性能问题的做法。

    推荐理由:文章拆解了超大型 PR 视图的关键设计取舍,尤其说明动态评论如何影响虚拟化,以及团队如何通过锚定校正和自动化测量避免滚动卡顿。

  2. Microsoft Research77

    Microsoft Physical AI Toolchain 新增机器人推理卸载能力

    Microsoft Research 宣布 Physical AI Toolchain 新增机器人推理卸载能力,可通过 Kubernetes 工具在机器人、边缘 GPU 和云端之间分配推理工作负载。研究发现,部分较轻 GPU 上的地图构建与规划速度较 A100 慢最多 383%,较大的板载 GPU 还会显著消耗机器人电量;文章也提供了 SO-101 和 UR10e 的卸载示例。

    推荐理由:文章结合移动操作任务测量了端侧与卸载推理的性能和续航差异,并介绍 Kubernetes 工具链如何在机器人、边缘 GPU 与云端间分配工作负载。

  3. Google DeepMind72

    Google DeepMind 为 Private AI Compute 增加安全的服务器端记忆

    Google DeepMind 分享了 Private AI Compute 的服务器端持久记忆架构,使 AI 助手能够跨设备保留上下文,同时维持设备端隐私标准。

    推荐理由:文章说明了 Private AI Compute 如何借助设备持有的密钥与云端安全 enclave 保存跨设备记忆,并提供软件公开记录、技术白皮书和独立审计结果供外界审查。

  1. GitHub Blog · AI & ML81

    GitHub Copilot 团队如何借助 Copilot 将运行时迁移到 Rust

    GitHub 将 Copilot 智能体运行时从 TypeScript 迁移为 Rust,项目主要由 AI 智能体编写代码,并通过 128 个 pull request 分批合入和发布。运行时最终包含 832,378 行生产 Rust 代码,迁移期间发布了 135 个版本;作者还介绍了原地替换策略、测试验证以及多智能体协作中的协调经验。

    推荐理由:文章以运行时迁移为例,结合渐进式替换、测试和发布数据,呈现了用智能体协作完成大型代码迁移的具体做法。

  1. Microsoft Research70

    Microsoft Research 扩大 Skala 接入范围,Skala 1.1 提升 DFT 精度

    Microsoft Research 发布 Skala 1.1,并宣布其已接入 CP2K,正集成至 Psi4、FHI-aims、ORCA 和 VASP。Skala 1.1 的训练数据量是首个公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中有 32 个排名第一,平均加权误差为 2.8 kcal/mol;团队还发布了跟踪不同版本和软硬件平台计算性能的持续更新报告。

    推荐理由:Skala 1.1 的精度提升与多软件集成同步推进,文中还介绍了持续更新的性能报告,呈现其走向计算化学工作流的路径。

  1. Mistral AI73

    Mistral 推出区域推理端点、优先服务等级并扩展第三方开放模型支持

    Mistral 宣布三项推进 AI 主权的举措,包括增强区域推理与服务可靠性、支持第三方开放模型,以及汇集企业和机构承诺以保障欧洲长期算力。Mistral Regional Endpoints 已全面开放,客户可选择在欧洲或美国进行推理;Mistral Priority Tier 处于公开预览阶段,为关键任务提供承诺服务等级和正常运行时间 SLA。

    推荐理由:文章把区域推理、第三方开放模型接入与欧洲算力承诺放在同一框架中,具体说明了企业获得区域合规和模型选择的路径。