如何将 AI 智能体连接到企业知识
企业 AI 智能体缺乏组织语境知识,是项目难以投入生产的重要原因;平均只有 34% 的智能体项目进入生产阶段。调查发现,生产表现较好的组织知识能力更强,数据碎片化则是扩大智能体知识访问的首要挑战,55% 的受访者提及。企业计划投资检索技术、AI-ready API、RAG、AI 评估智能体和知识图谱,以加强数据与智能体的连接。
企业 AI 智能体缺乏组织语境知识,是项目难以投入生产的重要原因;平均只有 34% 的智能体项目进入生产阶段。调查发现,生产表现较好的组织知识能力更强,数据碎片化则是扩大智能体知识访问的首要挑战,55% 的受访者提及。企业计划投资检索技术、AI-ready API、RAG、AI 评估智能体和知识图谱,以加强数据与智能体的连接。
OpenAI 将在 ChatGPT 用户请求生成的图像旁展示视觉广告,广告计划于本月晚些时候先在美国上线,并纳入首批测试广告商的产品和服务。广告会明确标注,且不会影响 ChatGPT 提供的答案。OpenAI 还将扩展广告衡量工具与合作伙伴,并与 DoubleVerify(DV)和 Integral Ad Science(IAS)合作开展品牌适配评估试点。
TechCrunch Disrupt 2026 将围绕创业公司的 AI 技术选择展开多场讨论,涉及多模型应用、开放与专有模型、模型定制及自建 AI 栈。议题还包括如何权衡成本、性能、灵活性与产品差异化,以及 AI 如何参与芯片和硬件设计。
OpenAI 说明其在欧盟规则下处理文本水印的方式,涵盖水印适用范围、检测机制,以及研究人员如何获得访问权限。
The Verge 主持人 Nilay Patel 采访加州参议员 Adam Schiff,讨论 AI 监管、言论自由及特朗普政府相关争议。Schiff 主张制定 AI 法律并设立具备专业能力和实际权限的监管机构,也谈到训练数据版权、模型责任、隐私保护及 AI 对就业的影响。
Aleph Alpha 发布了 Kolibri,一款拥有 78B 参数的德英语言模型,采用 MoE 架构,每个 token 约激活 3B 参数。公司称,该模型在德语基准上得分为 71%,解码速度快于 GPT OSS A5B、Qwen 3.6 A3B 和 Gemma 4 A4B 等可比模型。
澳大利亚正考虑在部分公共场所禁用智能眼镜,挪威政府则表示将很快向议会提交相关法案草案。挪威不主张全面禁令,并称在没有未经同意拍摄他人风险的场景中可以适当使用;多个国家的法庭也已对可穿戴设备发布禁令。
企业 AI 的重点正从预测转向自主决策,关键在于让预测系统依据结论自主行动,同时不偏离业务意图。深度学习和生成式 AI、实时训练,以及非结构化数据,正推动 AI 分析从回顾过去转向前瞻决策。
NVIDIA介绍其Inception创业公司如何利用AI支持乳腺癌影像筛查、风险评估和治疗规划,覆盖诊疗流程中的多个环节。iSono Health的ATUSA可在每侧乳房约两分钟内完成自动化3D超声扫描;Ataraxis AI则使用病理切片和临床数据预测治疗反应与复发风险,其模型已在10多家机构和多项临床试验中验证,并投入临床使用。
OpenAI 将于本月晚些时候面向美国 ChatGPT 用户测试新的展示广告,在图像生成期间于生成图像下方显示轮播或一排产品图片。广告会标注为广告,并与生成图像分开。OpenAI 还在扩展广告衡量和品牌安全工具,包括接收转化数据、开展地域实验,以及让部分广告商设置否定关键词。
Import AI 475 分析了群体智能体的扩展规律:4 个智能体并行完成同等表现所需的总 token 约为单个智能体的 2 倍,但理论上可将耗时减半;智能体数量扩大 10 倍,性能增幅约为 3 至 5 倍。
MIT 一份发表于 2026 年 6 月的报告指出,AI 使用正在伴随办公时间到访减少、线上讨论参与下降和学习小组缩减,也让教师更难判断学生实际学到了什么。报告反对使用不可靠的 AI 文本检测软件,并建议各课程先明确学习目标,再制定 AI 使用政策,同时加强教师使用 AI 的透明度。报告还指出,AI 可能加剧工具获取差距,并讨论了 AI 介入学习与研究助理工作对学生培养的影响。
OpenAI 在 ChatGPT 中推出一种新的视觉广告形式,并扩展面向广告主的衡量工具、归因合作伙伴关系和品牌适宜性。
作者指出,公众对 AI 的态度呈现矛盾:多项调查显示人们担忧或反感 AI,但 ChatGPT 在 5 月达到 10 亿月活用户,Gemini 在 7 月有 9.5 亿用户。作者认为,许多人厌恶的可能不是技术本身,而是企业不断推动 AI 渗透生活的做法。文章还提到,美国各州已通过或提出 AI 相关法律,形成超过 2,100 项法案;开源替代品也可能为消费者提供更多选择。
EmTech Future 2026 探讨 AI 与生物学、基础设施、制造业和科学交汇时如何重塑这些领域。活动还关注量子、能源系统与气候技术、机器人,以及技术融合带来的机遇与挑战;完整节目现已按需观看,订阅者可享 20% 折扣,售价 $596。
Qwen3.8-27B 的基准测试考察模型能否计算正整数之和,并仅用英文单词给出准确结果。禁用推理时,模型数值准确率为 23.57%;启用 medium reasoning 后,在 169 次单次测试中答对 167 次。
Simon Willison 呼吁按用量计费的服务和 API 默认设置硬预算上限,达到月度额度后应停止服务并返回错误,而不是只发送警告。他指出,编码智能体和个人智能体降低了部署能产生费用的代码的门槛,失控服务可能带来意外账单。AWS 几周前推出项目月度支出上限,达到上限后项目当月暂停;Google Cloud 也在 7 月推出了类似的 Spend Caps 功能。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用数据库终态及副作用评估 AI 智能体是否真正完成业务工作流,并将每项任务独立运行 20 次衡量一致性。
推荐理由:ThinkingBox 将评估焦点从对话和工具调用转向数据库终态,并通过每项任务重复运行衡量一致性,为检验智能体是否可靠完成业务流程提供了可复用基准。
Simon Willison 已发送 9 月版赞助者专属月度通讯,赞助者或现在开始赞助的人可以访问。内容涵盖 Fable 类模型、价格战、3D 图形与 Blender、LLM 与数学、意外网络攻击、Datasette 漏洞,以及他当月使用的工具和软件发布;每月支付 $10 可提前一个月阅读免费版。
Latent Space 的 AI News 汇总了 GPT-6.1 Sol、Sonnet 5.5 等模型在价格、评测和 Agent Arena 排名上的动态,并报道多款决策模型、开放权重模型及开发工具更新。OpenAI Agents API 声称工具调用速度提升 20%、回合可靠性达 99.97%;多项传闻尚未得到证实。
Apple 表示将调整 macOS 隐私设置,以阻止第三方应用开发者滥用权限访问用户消息历史。Meta CTO David Singleton 称,Muse 只有在用户授予 macOS 完整磁盘访问权限并启用 Messages connector 后才能读取消息;安全专家 Patrick Wardle 则指出,获得完整磁盘访问权限的应用可以读取浏览记录、浏览器 cookies 和聊天记录等内容。
Amazon 承诺未来五年向数据中心周边社区捐赠逾 $1B,由社区决定资金用于教育、职业培训、能源负担、水资源和当地优先事项。Amazon 还承诺数据中心不会推高电费或耗尽当地水源,并称将于 2030 年实现“水资源正效益”,目前 75% 的项目已达到这一目标。环保组织 Stand.Earth 批评这些承诺具有误导性,指出 Amazon 未提及其支持的电厂,也很少回应污染问题。
美国逮捕 Earthmade Computer CEO Greg Lui,指控他利用虚假文件,将价值超过 $300 million、含受出口管制 Nvidia 芯片的服务器转运至中国。
OpenAI 发布 GPT-6 系列模型指南,帮助初创公司选择 GPT-6 模型并为生产环境准备工作流。指南还涉及调整推理力度、改进提示词与技能,以及协调工具。
企业 AI 投资增长、模型能力提升,但许多企业仍受数据孤岛和系统碎片化制约,未能通过 AI 增加收入或从根本上改变运营方式。报告指出,持续获得回报的企业先重设计流程,再选择模型;数据是否适合 AI 使用,比数据总量更关键。可组合、具备主权控制的数据基础有助于在不迁移或集中数据的情况下支持 AI 智能体。
AWS 介绍 Adjudicated Query 模式,使用 Amazon Quick 对话界面接收合规问题,并由确定性规则引擎完成租约核查,模型只负责将自然语言转换为固定操作调用和叙述结果,不参与判定。
推荐理由:文章以租约合规为例,拆解如何用确定性规则引擎与完整性回执保证逐条核查,并说明对话模型应与判定环节隔离。
Asta 团队开源 AstaBrief 8B,这是一款根据研究问题和检索到的文献片段生成带引用报告的模型,也已作为 Asta 的 Fast 模式上线。该模型以 Qwen3-8B 为基础,开放模型权重和训练数据;在 Asta 全流程中,Fast 模式平均每份报告耗时 51.1 秒,Thinking 模式为 178.5 秒,约快 3.5 倍。
推荐理由:AstaBrief 的训练经验显示,筛除低引用密度样本比尝试更复杂的过滤组合更有效,为科学报告模型的数据筛选提供了具体参考。
GitHub 指出,AI 正在改变开发者的工作方式,并提出三项值得加强的技能:指导 AI 智能体完成任务、审查而非轻信 AI 的首个答案,以及用节省的实现时间解决更大的问题。GitHub Copilot 内置的 Rubber Duck agent 会使用第二个模型,在继续推进前评审计划、代码和测试。越多实现工作交由 AI 处理,开发者的技术判断、权衡能力和问题选择就越重要。
Google Research 介绍了新一代基于可信执行环境(TEE)的联邦学习(FL)系统,通过公开访问策略、可验证执行和差分隐私,增强数据匿名化的可审计性。Gboard 已用该系统部署英语和日语的下一个词预测模型,获得更强隐私保障和更高准确率,训练时间也较以往显著缩短。
推荐理由:文章梳理了 TEE 如何把访问策略、可审计执行与差分隐私结合起来,并以 Gboard 部署说明这种架构的实际应用。
Nvidia 宣布 Shield TV Pro 自 10 月 2 日起涨价 $100,售价调整为 $299.99。Nvidia 表示,内存等零部件成本在整个行业大幅上涨;这款流媒体设备的最新版本于 2019 年推出。
Airbnb CTO Ahmad Al-Dahle 介绍公司通过内部 AI 提效并改善用户体验,推动 Airbnb 转向 AI 原生。Airbnb 约 60% 的代码由 AI 编写,功能与改进同比增加近 80%,平均工程师的 PR 吞吐量约提升 1.6 倍;AI 目前解决约一半客服工单。
NVIDIA DGX Spark 将推出 64GB 配置,面向开发者、研究人员和 AI 爱好者,可在设备本地运行最多 100-billion-parameter 模型。
推荐理由:64GB 配置覆盖单机本地运行与双机扩展,文中还给出 Qwen 3.8 27B 测试的性能对比和集群接入方式,便于评估扩容路径。
AlphaGo 核心成员 Thore Graepel 认为,LLM 的链式推理仍是反复进行下一 token 预测,不等同于 AlphaGo 搜索未来局面的独立推理机制。文章指出,LLM 通常缺少可检查、持续更新的认知状态,知识与推理过程难以分离,思维链也可能事后编造;作者主张让系统显式记录信念、依据证据修正判断,并形成可审计的推理过程。
Pi 1.0 和 Pi Durable 登上 Hacker News 首页,Latent Space 同时提醒 AI Engineer NYC 常规门票即将截止。Pi 1.0 增加 Codemode、MCP 支持、虚拟模型扩展和默认全屏等功能;Pi Durable 将 Pi 移植到 TypeScript,并支持故障后恢复、并行对话、可插拔存储及运行时热切换。
ServiceNow CoreAI 构建了 AutoSynthData,根据目标模型的失败和更强教师模型的成功生成、验证训练任务,并用于模型微调。
推荐理由:文章展示了从模型失败提炼能力缺口、生成并验证训练任务的流程,并报告该方法在 EnterpriseOps Gym 两个领域的微调结果。
Latent Space 采访 MIT 的 Alex Zhang,讨论 RLM、GPU kernels、研究选题,以及 harness 如何帮助模型处理长上下文并提升跨任务组合泛化。Alex 介绍了 RLM 的上下文卸载、代码执行和递归调用子智能体机制,并认为学术研究者可以押注起初看似微小或古怪的问题;访谈还涉及多智能体系统、工具调用与模型能力过剩。
Chatham Financial 使用 Codex 和 GPT-5.6 构建技术并重新设计工作流程,将交易验证时间从 30 分钟缩短至不足 4 分钟。
OpenAI 的 GPT-6 Astra Ultrafast 运行于 NVIDIA Blackwell GPU,现已通过 OpenAI API 向开发者提供,并面向符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:材料比较了 Astra Ultrafast 与 Standard 模式的生成速度,并联系编码智能体的多轮工具工作流,说明响应延迟如何影响交互节奏。
美国联邦法官 Amit Mehta 驳回了 Chegg 和 Penske Media 针对 Google 提起的反垄断诉讼,裁定 Google 的相关行为不违反反垄断法。两家公司指控 Google 在 AI Overviews 等产品中使用其内容并导致网站流量下降;法官指出,网站开放免费内容后期待 Google 带来搜索流量,并不构成协议。
Simon Willison 使用 Claude Opus 5.5 改进了自己用纯 Python 编写的 WebAssembly 引擎 pwasm,经过 42 次提交后,它已支持几乎全部 WASM 规范。PyPI 上的 wheel 包含可运行的 MicroPython、QuickJS 和 Micro QuickJS 的 WASM 构建;作者称该项目仍处于 alpha 阶段,自己不会信任它。