跳到正文
今天10月6日周二35 条
  1. The Decoder57

    特朗普宣布成立“超级智能力量”(SIF)

    特朗普宣布成立“超级智能力量”(SIF),负责协调联邦政府与消费者、公共利益团体、宗教组织、关键基础设施运营方及 AI 公司之间的沟通。SIF 将由多名政府官员领导,并向总统和幕僚长 Susie Wiles 汇报;报道指出,特朗普用“超级智能”指人工智能,而 AI 研究中的超级智能是指远超人类智能的自我改进系统。

  2. TechCrunch · AI63

    特朗普宣布成立“超级智能力量”任务组

    美国总统特朗普宣布成立“超级智能力量”任务组,负责协调联邦政府的相关工作;国家情报总监 Jay Clayton 将担任主席。报道称,任务组成员还包括联邦贸易委员会主席 Andrew Ferguson 等官员,并需在120天内提交一份关于 AI 风险与机遇的报告。任务组章程称,其将制定应对超级智能相关威胁的计划,同时避免过度监管和监管俘获。

  3. TechCrunch · AI53

    TechCrunch 对谈:安全承诺与“super intelligence”能否改善 AI 形象?

    TechCrunch 的 Equity 播客对谈分析特朗普与多家 AI 企业高管会面及其签署的《Joint Commitment on Frontier Responsibilities》,质疑这份承诺能否产生实质影响。对谈指出,该承诺自愿且不具法律约束力,特朗普称其具有“道德约束力”;嘉宾认为,会面的意义或在于将 AI 重新包装为“super intelligence”,而非带来重大政策变化。

  4. TechCrunch · AI61

    Safeworld 获得超 $12 million 种子轮融资,开发机器人安全模拟评估平台

    Safeworld 宣布以超过 $12 million 的种子轮融资结束隐身状态,融资由 Shine Capital 和 a16z Speedrun 领投。公司开发的平台在包含逼真人体模型的模拟环境中评估机器人控制系统,并通过运行数千种场景测试机器人与人的交互;Gritt Robotics 正与其合作开发安全模拟。

  5. TechCrunch · AI52

    研究者追踪疑似运行于腾讯基础设施的中国 AI 智能体群

    独立研究者公布初步发现,称一批 AI 智能体似乎运行在腾讯基础设施上,并查询阿里巴巴地图服务 Amap。研究者称其为“agent fleet”而非“swarm”,因为多个智能体虽执行相似任务,却没有相互通信的迹象;查询记录涉及公园、动物园和医院等公共场所不同入口的路线。研究仍在进行,现有记录显示这些智能体可能是在绕过阿里巴巴的 API 规则。

  6. The Verge · AI62

    OpenAI 将在 ChatGPT 测试视觉广告

    OpenAI 将于本月晚些时候在美国开始测试 ChatGPT 视觉广告,初期广告会在用户生成图片时展示赞助商品和服务图片。广告与生成图像分开呈现,不影响 ChatGPT 的回答;Plus、Pro 和 Enterprise 订阅用户不会看到广告。OpenAI 表示,广告将避开情绪脆弱、敏感或其他不适宜的对话场景。

  7. AWS Machine Learning Blog78

    GLM 5.3 在 Amazon Bedrock 上线,支持缓存配置与 Strix 安全测试

    AWS 宣布 GLM 5.3 已在 Amazon Bedrock 上提供,企业用户可通过托管 API 调用该模型,并使用跨区域推理、提示词缓存和不同服务层级。文章给出 OpenAI 兼容 API 调用及显式提示词缓存的 Python 示例,还演示了如何将模型接入开源 AI 渗透测试智能体 Strix,对本地 OWASP Juice Shop 执行授权安全测试。

    推荐理由:文章把 GLM 5.3 在 Amazon Bedrock 上的接入方式与缓存配置写成可操作示例,并展示了它在授权安全测试工作流中的用法。

  8. Ars Technica · AI64

    MCP 智能体通信协议的信任缺口可能带来安全风险

    AI 智能体之间通过 MCP 传递指令时,攻击者可能利用一个智能体向目标网络内的其他智能体传播恶意指令,窃取数据库内容及敏感信息。过去五个月,Google 等五个组织承认了相关漏洞;独立研究员 Syed Anas Mohiuddin 测试了多个组织的智能体,并展示了利用 MCP 信任缺口的概念验证攻击。

  9. Google Research47

    Agent 隐私与安全中的开放问题与新兴问题:一种情境视角

    Google Research 发布《Agent 隐私与安全中的开放问题与新兴问题:一种情境视角》研讨会报告,汇集 50 多位学界和业界人士的合作成果,梳理自主 Agent 面临的隐私与安全挑战。报告以情境完整性理论为基础,提出通过情境策略引擎评估数据流和行动是否恰当,并从系统、模型和用户层面探索多层防护。

  10. The Verge · AI59

    Nolla Health 在犹他州试点 AI 痤疮处方服务

    医疗初创公司 Nolla Health 宣布在犹他州试点 AI 痤疮处方服务,用户可通过应用扫描面部,由 AI 分析痤疮严重程度并开具处方。前 100 名患者的每张 AI 处方都需两名医生批准;之后医生将在最多 500 名患者处方开出后开始审核,再每月抽查至少 10% 的处方,并审查升级处理或出现副作用的病例。

  11. The Verge · AI69

    维基媒体基金会称 OpenAI 智能体活动可能关联 5 月服务中断

    维基媒体基金会称,发现其平台上有疑似由 OpenAI 运营的智能体编辑维基、尝试利用 Etherpad,并向公开 API 发出数百万次自动请求。基金会表示,这些流量可能促成了 5 月 Wikidata Query Service 的部分中断,但 OpenAI 称其调查尚未能确认机器人是否造成该中断;基金会也未发现系统被用于智能体间协调或系统、数据遭到攻破的证据。

  12. TechCrunch · AI62

    TikTok推出AI购物助手和应用内一键结账

    TikTok宣布推出AI购物助手和新的应用内结账功能,让用户可以直接从品牌购买商品。购物助手以对话式AI智能体提供商品、配送、尺码和库存等信息,并协助完成购买;用户也可在For You信息流中一键结账。新功能由TikTok与Salesforce、Shopify、Shoplazza和Stripe等商务平台及支付服务商合作开发。

  13. The Verge · AI59

    OpenAI 将在 ChatGPT 和 Codex 中推出文本水印

    OpenAI 将在欧盟逐步为符合条件的 ChatGPT 和 Codex 用户推出不可见、机器可读的文本水印,覆盖所有计划,但首发时不会设为全球默认。全球 API 客户从今天起可为部分模型选择启用水印;获批研究人员和专家组织也可申请检测器访问权限。OpenAI 提醒,水印不能保证可靠检测,也不能证明文本准确性、所有权或人类作者身份。

  14. The Decoder73

    OpenAI 将在欧盟为 ChatGPT 文本添加水印,全球 API 用户可选择关闭

    OpenAI 将在未来几周为欧盟的 ChatGPT 和 Codex 用户启用不可见文本水印 textGrain,全球 API 用户则可选择启用。检测率受文本长度、主题和编辑影响:400-token 心理学文本的检测率约为 95%,数学文本约为 60%;替换 25% 的词后,检测率会降至 20% 以下。textGrain 检测器初期仅向经申请的研究人员和专业机构开放。

  15. TechCrunch · AI52

    Hot Girl Hotline 推出面向年轻女性的 AI 关系建议应用

    两姐妹创办的 Hot Girl Hotline 推出面向年轻女性的 AI 关系建议应用,帮助用户以更安全的方式讨论约会与亲密关系问题。应用采用基于行为科学的建议和苏格拉底式提问,并会在对话出现风险信号时转介至 988 等资源。该应用可根据用户的价值观、目标、身份和偏好个性化建议,月费为 $9.99,现已在 iOS 和网页端提供。

  16. AWS Machine Learning Blog69

    Amazon SageMaker 推出面向编码智能体的 aws-ai-ml skill

    Amazon SageMaker AI 推出 aws-ai-ml skill,可接入支持 MCP 的编码智能体,协助优化生成式 AI 推理。它能对端点进行基准测试、推荐部署配置、比较性能数据,并生成可检查和运行的 SageMaker Python SDK v3 代码;文章介绍了通过 Agent Toolkit for AWS 或 SageMaker Studio 安装和使用的方法。

    推荐理由:文章说明了如何将 aws-ai-ml skill 接入 MCP 兼容的编码智能体,并展示其基准测试、部署配置推荐与结果对比流程。

  17. The Verge · AI67

    OpenAI 公关人员在 Sam Altman 采访谈及 ChatGPT 用户自杀时要求转向其他话题

    《Vanity Fair》编辑 Mark Guiducci 在采访 Sam Altman 时提及一名曾与 ChatGPT 交谈、后来自杀的用户,OpenAI 公关人员数次要求转到其他话题。采访随后继续,Altman谈到是否将用户心理危机期间的对话提供给研究人员,称未经用户同意可能不应这样做。OpenAI 发言人表示,采访超时,因此曾要求在 Altman 回应这一重要话题后另约时间继续。

  18. TechCrunch · AI67

    HackerRank 向客户全面开放 AI 面试官 Chakra

    HackerRank 向客户全面开放 AI 智能体面试官 Chakra,它通过真实代码仓库任务观察候选人的工作过程,并评估答案、判断和 AI 使用能力。测试期间,Chakra 已进行超过 500,000 次面试;HackerRank 称,其面试中的可疑活动标记比可比的传统评估低 70% 至 80%,但比例因地区和资历等因素而异。Chakra 为候选人评分,最终招聘决定仍由人类作出。

  19. The Decoder65

    Quinnipiac 民调显示多数美国成年人希望放缓或暂停 AI 发展

    Quinnipiac University 的一项民调显示,47% 的受访者希望放缓 AI 发展,30% 希望暂停,直到安全得到验证,只有 5% 希望加快发展。86% 支持独立安全标准,73% 担心 AI 最终威胁人类生存,74% 对 AI 公司领导者缺乏或几乎没有信任。该民调于 9 月 24 日至 27 日调查了 1,202 名美国成年人,误差幅度为 +/- 3.5 个百分点。

  20. The Decoder73

    Anthropic 员工捐赠及公司配捐已使公司承担超过 $660 million

    Anthropic 员工可将股份捐给慈善机构,公司还会追加股份;早期员工获得的配捐价值可达其捐赠的三倍。仅 2025 年 10 月至 2026 年 3 月,这项安排就使公司承担超过 $660 million,相关支出会稀释其他投资者的持股。2025 年捐赠总额为 $540 million;IPO 后,若股价继续上涨,捐赠总额可能达到数十亿美元。

10月5日周一
  1. GitHub Blog · AI & ML76

    GitHub 发布 ReviewBench 开放基准,评测 AI 代码审查智能体

    GitHub 推出 ReviewBench 开放基准,用于评测 AI 代码审查智能体,并提供公开数据集、统一评分方法和系统比较入口。基准包含来自 187 个开源许可仓库的 219 个 PR,覆盖 19 种语言,其分布参考了对 103.9M 个 GitHub PR 的分析;资深工程师独立复核标注,判断一致率为 96.6%。

    推荐理由:ReviewBench 将真实 PR 分布、多来源标注和专家复核纳入同一评测流程,并用线上实验对照离线信号,为代码审查智能体比较提供可复现依据。

  2. AWS Machine Learning Blog71

    AWS 发布 Amazon Quick Resource Migrator,实现跨账户资源自动迁移

    AWS 介绍了 Quick Resource Migrator,这是一个运行在 Amazon Bedrock AgentCore 上的 MCP 服务器,可将 Amazon Quick 资源从开发账户迁移到生产账户。

    推荐理由:文章拆解了跨账户迁移的资源选择、权限复用、备份回滚与预览流程,可帮助团队理解如何把 Amazon Quick 资源纳入可审计的发布流程。

  3. AWS Machine Learning Blog62

    如何用 LangChain 和 Amazon Bedrock Knowledge Bases 实现智能体检索

    文章演示如何在 LangChain 与 Amazon Bedrock Managed Knowledge Base 中使用标准检索和智能体检索,比较它们处理多部分问题的方式。标准检索以一次混合搜索返回结果,智能体检索则拆分子查询、评估证据并在需要时继续搜索;前者更快、更便宜,后者在多跳问题上的召回有所提升,但成本和延迟更高。

    推荐理由:文章用同一多部分问题对比单次检索与规划式检索,并拆解其成本、延迟和召回取舍,提供了按查询复杂度选择路径的依据。

  4. AWS Machine Learning Blog61

    AWS 教程:使用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与帮助性

    AWS 展示了如何使用 Amazon Bedrock AgentCore Evaluations 构建并评估多智能体供应链决策系统,检查帮助性、业务准确性与可解释性。示例采用协调智能体和优化、分销、路线规划、分析四个专业智能体,并结合内置评估器与自定义评估器,分层验证通用质量、业务规则和决策说明。评估支持开发阶段的按需模式与生产环境的在线监控模式,文中提供部署、运行及评估步骤。

    推荐理由:文章用供应链多智能体示例拆解三层评估流程,将通用质量、业务规则正确性与可解释性分开衡量,便于定位不同的改进方向。