AI 日报 · 2026 年 10 月 8 日 · 星期四
MYHOT
OpenAI 在 ChatGPT 全球推出 GPT-6 与 Intelligent UI
OpenAI 正在 ChatGPT 中全球推出 GPT-6 和 Intelligent UI,提供更快的响应以及可供用户探索和直接使用的视觉内容与交互体验。
模型发布/更新
Claude Haiku 5.5 上线 Amazon Bedrock 和 Claude Platform on AWS
AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上可用。文章称,该模型面向子智能体及高频、成本敏感任务,多数任务的成本比 Claude Haiku 4.5 低约 75%,并介绍了其在编码、工具调用、计算机操作等任务中的用途。
Anthropic 发布 Claude Haiku 5.5,调整定价并推出订阅 API 额度
Anthropic 发布快速、低成本模型 Claude Haiku 5.5,并将 Sonnet 5.5 的缓存读取价格减半。Haiku 5.5 在 100,000 tokens 以内的价格为 $0.10/$0.50,超过该范围则涨至 $0.50/$2.50;作者指出其 tokenizer 会让同一长提示词消耗约 1.25 倍 tokens。
Liquid AI 发布面向边缘设备的多模态 open d1 决策模型
Liquid AI 发布两款开放权重决策模型 d1-3B 和实验版 d1-omni-600M,支持文本与图像输入,d1-omni-600M 还支持文本与音频输入。
Anthropic 发布 Claude Haiku 5.5,价格大幅下调且基准成绩提升
Anthropic 发布 Claude Haiku 5.5,称其为迄今最快、最实惠的小型模型;相较 Haiku 4.5,平均价格降低约 75%,提示词不超过 100,000 tokens 时最高降价 90%。
产品发布/更新
Microsoft Research 发布 Agent Lightning v1.0 智能体强化学习框架
Microsoft Research Asia 开源 Agent Lightning v1.0,将部署时使用的 Agent harness 直接用于强化学习训练,避免在训练框架中重新实现智能体。
NVIDIA 与 Microsoft 推出面向 Windows AI 智能体的 RTX Spark,并预览 DGX Station for Windows
NVIDIA 与 Microsoft 展示面向 Windows AI 智能体的硬件与软件方案,包括 RTX Spark 笔记本和紧凑型台式机,以及 DGX Station for Windows。
GitHub 推出 ModernBERT 分类器,扩展推送保护对非结构化秘密的检测
GitHub 介绍了与 Microsoft Applied Sciences 合作构建的 ModernBERT 分类器,用于在推送前识别非结构化秘密;模型可在不到 2 毫秒内评估一组候选秘密,预计使可拦截的秘密数量增加一倍以上。
行业动态
测试发现 ChatGPT 青少年安全防护存在失效,研究机构评为“不可接受风险”
Common Sense Media 青少年 AI 安全研究所对 ChatGPT 青少年版进行了 4,000 多条测试提示,并将其评为未成年人“不可接受的风险”。测试账号中,涉及自杀、自残和饮食失调的对话未触发家长通知;超过四分之一应提供危机转介的情形未能引导用户寻求专业帮助。OpenAI 发言人质疑测试未能反映防护措施的实际运行方式,研究所方面则表示,给予系统足够时间后仍未收到通知。
论文研究
OpenAI 发布内部模型数学成果,涉及准黎曼猜想等开放问题
OpenAI 发布了一批来自内部模型的数学成果,共 722 篇手稿,归为 372 组相关结果,涉及约 4,000 个研究问题的评估;模型本身尚未发布。材料称每项结果平均使用约 3 小时 ChatGPT Pro 思考计算,并收录论文、证明材料和部分推理摘要。文中提到准黎曼猜想等成果,同时指出部分结果尚未经过独立核验,数学家对其正确性和影响仍有不同看法。
技巧与观点
Nemotron 专项模型在 IOI 2026 和 IMO 2026 达到金牌水平
Nemotron 团队通过监督微调、强化学习及反馈驱动的推理流程,使专项系统在 IOI 2026 获得 535.4/600 分,在 IMO 2026 获得 30/42 分,均超过金牌门槛。
AWS DevOps Agent 如何通过 Lambda Durable Functions 自动化故障修复
AWS 提供了一套将 AWS DevOps Agent 调查结果转为可审批修复操作的自动化工作流,使用 AWS Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock 完成诊断后的修复环节。
快讯
- Google Research:三个月专利起草实验显示 AI 对律师工作表现与判断能力的影响因资历而异Google Research
- AWS 六周实践手册:帮助非工程岗位团队从讨论 AI 转向构建智能体AWS Machine Learning Blog
- AWS 介绍 Cornerstone OnDemand 如何借助 Amazon Bedrock 将数据库诊断时间缩短 78%AWS Machine Learning Blog
- Amazon Quick与Amazon Bedrock如何为RAG实施实时权限校验AWS Machine Learning Blog
- 如何为智能体自动化建立商业论证AWS Machine Learning Blog