AI 动态 · 2026-09-29
截至 2026-09-29。业界 · 产品 · 模型 · 开源 · 开发者工具 · 前端。
业界
(本日无新条目)
产品
OpenAI DevDay 2026 回顾:20 多项发布,涵盖 GPT-6 Astra、Codex 与 API

OpenAI 汇总了 DevDay 2026 的 20 多项公告,涉及 GPT-6 Astra、ChatGPT、Codex、API、安全能力以及面向构建者的新工具。这场发布会勾勒出 OpenAI 在模型、编码代理与平台工具上的整体布局,是判断其产品路线的重要参考。对读者:建议按自身技术栈挑出与 API 和 Codex 相关的条目精读,避免被发布数量淹没。
OpenAI 推出 dots:可跨项目持续推进的主动式助手

dots 是 OpenAI 推出的主动式助手,能够在复杂项目与日常任务中持续工作,官方强调用户仍可保持控制权。它代表助手形态从「问答」向「持续执行」演进,与 Agent 化趋势一致。对读者:可关注其权限边界与任务中断机制,评估是否适合接入需要长期跟踪的工作流。
模型
Anthropic 发布 Claude Sonnet 5.5:Terminal-Bench 4.0 达 70.6%,价格维持 2/10 美元
Anthropic 推出 Claude Sonnet 5.5,在 Terminal-Bench 4.0 上取得 70.6% 的成绩,输入输出价格仍为每百万 token 2 美元与 10 美元。相比前代,它在速度与单任务成本上均有改善,属于「同价更强」的迭代。对读者:正在用 Sonnet 系列做编码代理的团队可直接替换测试,重点验证长任务下的稳定性与工具调用次数。
Claude Sonnet 5.5 单任务成本下降约 30%,源于更快速度与更少工具调用
报道指出,Anthropic 的 Claude Sonnet 5.5 通过更快的推理速度和更少的工具调用次数,使多数任务的单次成本下降约 30%。这说明模型竞争正从单纯跑分转向「每任务成本」这一更贴近生产的指标。对读者:做 Agent 成本预算时,应把工具调用轮数纳入测算,而不只是比较 token 单价。
开源
Google Research 开源 RRSI:让 AI Agent 自我改进执行框架且不过拟合
Google Research 开源了 RRSI,使 AI Agent 能够改进自身的执行框架(harness),同时避免过拟合。这类「自我改进但不跑偏」的方法对构建可长期演进的 Agent 系统有直接参考价值。对读者:可跟进其防止过拟合的评测设计,用于校准自家 Agent 的迭代节奏。
H Company 发布 Holo4:开放权重计算机操作模型,覆盖桌面、Web、Android 与 API
H Company 发布 Holo4 系列开放权重模型,可执行点击、写代码与调用工具等操作,覆盖桌面、Web、Android 及 API 多种环境。开放权重的计算机操作模型增多,意味着 GUI Agent 的选型不再局限于闭源方案。对读者:若在做跨端自动化,可先在小范围任务上对比 Holo4 与闭源模型的成功率与延迟。
NVIDIA 推出开放 Agent 安全平台:OpenShell 沙箱与 Sentry 毫秒级隔离
NVIDIA 发布开放 Agent 安全平台,其中 OpenShell 在 Vera CPU 上为 Agent 提供沙箱,Sentry 则依托 BlueField-4 在毫秒级对 Agent 进行隔离。随着 Agent 获得更多系统权限,运行时隔离正成为基础设施层的必备能力。对读者:部署高权限 Agent 前,应把沙箱与隔离方案列入架构评审,而非事后补救。
开发者工具
Simon Willison 现场直播 OpenAI DevDay 2026

Simon Willison 在旧金山 Fort Mason 现场以博客形式直播 OpenAI DevDay 2026 的主题演讲与当日见闻,延续了去年的做法。这类一手记录通常比官方通稿更早暴露细节与现场反应。对读者:想快速了解发布会实际内容与开发者反馈,可把这份直播记录作为官方公告之外的补充阅读。
GitHub 用开源 AI 安全 Agent 发现 24 个 Android 漏洞

GitHub 介绍了其开源 AI 安全 Agent 发现 24 个 Android 漏洞的过程,包括背后的定向任务流、所暴露的关键缺陷,以及如何在自有应用上运行同一 Agent。这为「AI 做安全审计」提供了可复现的工程范例。对读者:可借鉴其任务流设计,把 AI 安全扫描纳入 CI 或发布前检查环节。