跳到正文
今天10月6日周二2 条
  1. AWS Machine Learning Blog78

    GLM 5.3 在 Amazon Bedrock 上线,支持缓存配置与 Strix 安全测试

    AWS 宣布 GLM 5.3 已在 Amazon Bedrock 上提供,企业用户可通过托管 API 调用该模型,并使用跨区域推理、提示词缓存和不同服务层级。文章给出 OpenAI 兼容 API 调用及显式提示词缓存的 Python 示例,还演示了如何将模型接入开源 AI 渗透测试智能体 Strix,对本地 OWASP Juice Shop 执行授权安全测试。

    推荐理由:文章把 GLM 5.3 在 Amazon Bedrock 上的接入方式与缓存配置写成可操作示例,并展示了它在授权安全测试工作流中的用法。

10月5日周一
  1. GitHub Blog · AI & ML76

    GitHub 发布 ReviewBench 开放基准,评测 AI 代码审查智能体

    GitHub 推出 ReviewBench 开放基准,用于评测 AI 代码审查智能体,并提供公开数据集、统一评分方法和系统比较入口。基准包含来自 187 个开源许可仓库的 219 个 PR,覆盖 19 种语言,其分布参考了对 103.9M 个 GitHub PR 的分析;资深工程师独立复核标注,判断一致率为 96.6%。

    推荐理由:ReviewBench 将真实 PR 分布、多来源标注和专家复核纳入同一评测流程,并用线上实验对照离线信号,为代码审查智能体比较提供可复现依据。

10月2日周五
  1. GitHub Blog · AI & ML40

    AI 正在改变开发者工作:GitHub 提出三项值得加强的技能

    GitHub 指出,AI 正在改变开发者的工作方式,并提出三项值得加强的技能:指导 AI 智能体完成任务、审查而非轻信 AI 的首个答案,以及用节省的实现时间解决更大的问题。GitHub Copilot 内置的 Rubber Duck agent 会使用第二个模型,在继续推进前评审计划、代码和测试。越多实现工作交由 AI 处理,开发者的技术判断、权衡能力和问题选择就越重要。

  2. NVIDIA Blog80

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 运行于 NVIDIA Blackwell GPU,现已通过 OpenAI API 向开发者提供,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。

    推荐理由:材料比较了 Astra Ultrafast 与 Standard 模式的生成速度,并联系编码智能体的多轮工具工作流,说明响应延迟如何影响交互节奏。

10月1日周四
  1. Google DeepMind82

    Google 发布 Gemini 4 Argon,面向复杂工作流并分阶段开放

    Google 宣布推出前沿模型 Gemini 4 Argon,面向软件工程、企业知识工作和网络安全等复杂工作流,现正通过 Fairwind Program 向可信网络防御人员分阶段开放。

    推荐理由:1M tokens 的输出上限与分阶段开放安排,呈现了 Gemini 4 Argon 在长流程任务能力和前沿模型发布管控上的两项具体变化。

9月24日周四
  1. GitHub Blog · AI & ML72

    GitHub Copilot app 如何流畅渲染超大型 Pull Request

    GitHub 重建了 GitHub Copilot app 的 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评论的 PR 仍能流畅浏览。文章详述了代码行与动态评论分开管理高度、滚动时延后测量并保持阅读锚点,以及通过缓存和自动化测量循环定位性能问题的做法。

    推荐理由:文章拆解了超大型 PR 视图的关键设计取舍,尤其说明动态评论如何影响虚拟化,以及团队如何通过锚定校正和自动化测量避免滚动卡顿。

9月18日周五
  1. GitHub Blog · AI & ML46

    该不该读 AI 生成的代码、RAG 是否已死、Skills 是否取代了 MCP?GitHub 播客解析 AI 热点观点

    GitHub 播客讨论 AI 开发中的五种热点观点,认为开发者仍须审查并对生成代码负责,但应按风险分配精力。Skills 与 MCP 解决的问题不同:前者提供背景、流程和最佳实践,后者连接工具与数据;RAG 也没有过时,可与 Agent、Skills 和 MCP 协同使用。

9月17日周四
  1. GitHub Blog · AI & ML81

    GitHub Copilot 团队如何借助 Copilot 将运行时迁移到 Rust

    GitHub 将 Copilot 智能体运行时从 TypeScript 迁移为 Rust,项目主要由 AI 智能体编写代码,并通过 128 个 pull request 分批合入和发布。运行时最终包含 832,378 行生产 Rust 代码,迁移期间发布了 135 个版本;作者还介绍了原地替换策略、测试验证以及多智能体协作中的协调经验。

    推荐理由:文章以运行时迁移为例,结合渐进式替换、测试和发布数据,呈现了用智能体协作完成大型代码迁移的具体做法。

9月9日周三
  1. Mistral AI62

    Mistral 分享用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++ 的实践

    Mistral 协助一家欧洲能源运营商将 40,000 行 Fortran 77 迁移至 C++,对象是缺少测试套件和集中文档的储层模拟器。团队先建立数值一致性测试框架并整理代码文档,再按模块运行规划、实现、测试和人工审查流程;首个冲刺覆盖了总计 300,000 行代码中的 40,000 行。

    推荐理由:这次迁移展示了复杂遗留系统中智能体自主性的取舍,并给出可复用的流程要点,包括先建立数值一致性测试,再配合分模块实施与人工审查。

7月29日周三
7月26日周日
  1. Berkeley AI Research59

    ABBEL:通过更新信念状态实现高效长程交互

    Berkeley AI Research 提出 ABBEL,通过自然语言信念状态压缩长交互历史,并用信念评分监督状态中保留的信息。 在 CollabBench 协作编程实验中,重建式信念评分将与完整上下文的性能差距缩小约一半,训练步数从 100 降至 50;峰值上下文 token 长度也低于完整上下文设置。