跳到正文
今天10月6日周二2 条
  1. AWS Machine Learning Blog69

    Amazon SageMaker 推出面向编码智能体的 aws-ai-ml skill

    Amazon SageMaker AI 推出 aws-ai-ml skill,可接入支持 MCP 的编码智能体,协助优化生成式 AI 推理。它能对端点进行基准测试、推荐部署配置、比较性能数据,并生成可检查和运行的 SageMaker Python SDK v3 代码;文章介绍了通过 Agent Toolkit for AWS 或 SageMaker Studio 安装和使用的方法。

    推荐理由:文章说明了如何将 aws-ai-ml skill 接入 MCP 兼容的编码智能体,并展示其基准测试、部署配置推荐与结果对比流程。

10月5日周一
  1. AWS Machine Learning Blog71

    AWS 发布 Amazon Quick Resource Migrator,实现跨账户资源自动迁移

    AWS 介绍了 Quick Resource Migrator,这是一个运行在 Amazon Bedrock AgentCore 上的 MCP 服务器,可将 Amazon Quick 资源从开发账户迁移到生产账户。

    推荐理由:文章拆解了跨账户迁移的资源选择、权限复用、备份回滚与预览流程,可帮助团队理解如何把 Amazon Quick 资源纳入可审计的发布流程。

  2. AWS Machine Learning Blog62

    如何用 LangChain 和 Amazon Bedrock Knowledge Bases 实现智能体检索

    文章演示如何在 LangChain 与 Amazon Bedrock Managed Knowledge Base 中使用标准检索和智能体检索,比较它们处理多部分问题的方式。标准检索以一次混合搜索返回结果,智能体检索则拆分子查询、评估证据并在需要时继续搜索;前者更快、更便宜,后者在多跳问题上的召回有所提升,但成本和延迟更高。

    推荐理由:文章用同一多部分问题对比单次检索与规划式检索,并拆解其成本、延迟和召回取舍,提供了按查询复杂度选择路径的依据。

  3. AWS Machine Learning Blog61

    AWS 教程:使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与帮助性

    AWS 展示了如何使用 Amazon Bedrock AgentCore Evaluations 构建并评估多智能体供应链决策系统,检查帮助性、业务准确性与可解释性。示例采用协调智能体和优化、分销、路线规划、分析四个专业智能体,并结合内置评估器与自定义评估器,分层验证通用质量、业务规则和决策说明。评估支持开发阶段的按需模式与生产环境的在线监控模式,文中提供部署、运行及评估步骤。

    推荐理由:文章用供应链多智能体示例拆解三层评估流程,将通用质量、业务规则正确性与可解释性分开衡量,便于定位不同的改进方向。

10月4日周日
  1. Simon Willison10

    Simon Willison 发送 9 月赞助者专属月度通讯

    Simon Willison 已发送 9 月版赞助者专属月度通讯,赞助者或现在开始赞助的人可以访问。内容涵盖 Fable 类模型、价格战、3D 图形与 Blender、LLM 与数学、意外网络攻击、Datasette 漏洞,以及他当月使用的工具和软件发布;每月支付 $10 可提前一个月阅读免费版。

10月3日周六
10月2日周五
  1. AWS Machine Learning Blog76

    AWS 教程:用 Amazon Quick 与 Adjudicated Query 模式核查数万份租约合规性

    AWS 介绍 Adjudicated Query 模式,使用 Amazon Quick 对话界面接收合规问题,并由确定性规则引擎完成租约核查,模型只负责将自然语言转换为固定操作调用和叙述结果,不参与判定。

    推荐理由:文章以租约合规为例,拆解如何用确定性规则引擎与完整性回执保证逐条核查,并说明对话模型应与判定环节隔离。

  2. GitHub Blog · AI & ML40

    AI 正在改变开发者工作:GitHub 提出三项值得加强的技能

    GitHub 指出,AI 正在改变开发者的工作方式,并提出三项值得加强的技能:指导 AI 智能体完成任务、审查而非轻信 AI 的首个答案,以及用节省的实现时间解决更大的问题。GitHub Copilot 内置的 Rubber Duck agent 会使用第二个模型,在继续推进前评审计划、代码和测试。越多实现工作交由 AI 处理,开发者的技术判断、权衡能力和问题选择就越重要。

9月26日周六
  1. GitHub Blog · AI & ML64

    GitHub Copilot app 初学者指南:如何用 canvases 构建自定义工作流

    GitHub Copilot app 的 canvases 允许用户与智能体共享可自定义界面,并围绕各自工作流调整内容。用户可在智能体会话中输入 `/create-canvas` 技能并描述需求,无需手动编写代码或设计界面,智能体便会创建画布。画布可保存为团队共享或个人扩展,用户和智能体也能同时修改共享状态。

    推荐理由:文章通过创建发布说明看板的示例,展示从自然语言描述到可复用画布的过程,并说明用户与智能体如何同步修改共享界面。

9月25日周五
  1. GitHub Blog · AI & ML75

    GitHub Security Lab 开源 Fuzzing Taskflow 智能体,自动化 C/C++ 模糊测试

    GitHub Security Lab 开源了面向 C/C++ 项目的 Fuzzing Taskflow,由 LLM 智能体自动识别代码入口、编写 harness、运行 AFL++、根据覆盖率改进测试,并对崩溃进行分诊和生成漏洞报告。

    推荐理由:文章拆解了覆盖率反馈、结构化输入生成与崩溃分诊的自动化流程,也说明模型报告仍需人工审查,可供安全测试工作流设计参考。

9月24日周四
  1. GitHub Blog · AI & ML72

    GitHub Copilot app 如何流畅渲染超大型 Pull Request

    GitHub 重建了 GitHub Copilot app 的 Pull Request 视图,使包含 2,200 个文件、超过 100 万行变更和 400 多条行内评论的 PR 仍能流畅浏览。文章详述了代码行与动态评论分开管理高度、滚动时延后测量并保持阅读锚点,以及通过缓存和自动化测量循环定位性能问题的做法。

    推荐理由:文章拆解了超大型 PR 视图的关键设计取舍,尤其说明动态评论如何影响虚拟化,以及团队如何通过锚定校正和自动化测量避免滚动卡顿。

9月18日周五
  1. GitHub Blog · AI & ML46

    该不该读 AI 生成的代码、RAG 是否已死、Skills 是否取代了 MCP?GitHub 播客解析 AI 热点观点

    GitHub 播客讨论 AI 开发中的五种热点观点,认为开发者仍须审查并对生成代码负责,但应按风险分配精力。Skills 与 MCP 解决的问题不同:前者提供背景、流程和最佳实践,后者连接工具与数据;RAG 也没有过时,可与 Agent、Skills 和 MCP 协同使用。

9月17日周四
  1. GitHub Blog · AI & ML81

    GitHub Copilot 团队如何借助 Copilot 将运行时迁移到 Rust

    GitHub 将 Copilot 智能体运行时从 TypeScript 迁移为 Rust,项目主要由 AI 智能体编写代码,并通过 128 个 pull request 分批合入和发布。运行时最终包含 832,378 行生产 Rust 代码,迁移期间发布了 135 个版本;作者还介绍了原地替换策略、测试验证以及多智能体协作中的协调经验。

    推荐理由:文章以运行时迁移为例,结合渐进式替换、测试和发布数据,呈现了用智能体协作完成大型代码迁移的具体做法。

9月9日周三
  1. Mistral AI62

    Mistral 分享用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++ 的实践

    Mistral 协助一家欧洲能源运营商将 40,000 行 Fortran 77 迁移至 C++,对象是缺少测试套件和集中文档的储层模拟器。团队先建立数值一致性测试框架并整理代码文档,再按模块运行规划、实现、测试和人工审查流程;首个冲刺覆盖了总计 300,000 行代码中的 40,000 行。

    推荐理由:这次迁移展示了复杂遗留系统中智能体自主性的取舍,并给出可复用的流程要点,包括先建立数值一致性测试,再配合分模块实施与人工审查。

7月29日周三
5月8日周五
  1. Berkeley AI Research60

    Adaptive Parallel Reasoning 如何让推理模型动态安排并行计算

    Berkeley AI Research 的文章梳理了 Adaptive Parallel Reasoning(APR),即让模型在推理时自行决定是否并行、拆分多少线程以及如何协调。文章比较了固定并行与自适应方案,并解析 KV cache 聚合、训练方式和效率奖励设计,同时列出评测差异与部署中的开放问题。

    推荐理由:文章梳理了 APR 与固定并行方案在任务拆分、KV cache 聚合和训练奖励上的差异,呈现了其效率目标与部署取舍。

4月20日周一
3月13日周五