Skip to content

AI 动态 · 2026-09-16

截至 2026-09-16。业界 · 产品 · 模型 · 开源 · 开发者工具 · 前端。

业界

Salesforce 不改模型,把浏览器 Agent 任务完成率从 43.5% 提到 93%

Salesforce 研究人员在不改动底层模型的前提下,将 AI Agent 完成浏览器任务的成功率从 43.5% 提升到 93%。提升来自模型之外的工程手段,而非更强的权重。对读者:Agent 效果差时先别急着换模型,检查任务分解、重试与状态管理往往收益更大。

阅读原文

传 SK 海力士与 Intel 洽谈在美国生产存储芯片

配图

据报道 SK 海力士正与 Intel 洽谈在美国本土生产存储芯片,SK 海力士向 TechCrunch 表示尚未敲定任何计划或安排。AI 算力扩张让 HBM 等存储产能成为地缘与供应链焦点。对读者:关注存储涨价与交期的团队,可把美产产能落地进度纳入硬件采购的风险评估。

阅读原文

前 Infosys 掌门人的 AI 创业公司再融 5300 万美元

配图

这家位于帕洛阿尔托的 AI 创业公司称,产品发布数月内已拿下多份七位数美元的企业合同,并完成新一轮 5300 万美元融资。企业级 AI 服务的订单兑现速度成为资本加注的理由。对读者:评估同类企业 AI 供应商时,别只看融资额,重点核实合同规模与续约情况。

阅读原文

产品

Claude Cowork 与聊天合并为统一的 Claude

配图

Anthropic 宣布 Claude Cowork 与聊天合并为同一个 Claude,先在 Pro 和 Max 套餐推送。用户把任务交出去,Claude 直接执行,但最终决定权仍保留在人手里。这标志着对话产品与任务执行型 Agent 的边界进一步消失。对读者:重度用户可重新评估套餐价值,同时为「交办任务」的工作流设计好人工复核环节。

阅读原文

模型

Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

配图

Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,称其为目前最先进的实时对话模型,面向自然语音交互场景。Extended Thinking 版本在实时对话中引入更深推理,直接对标 OpenAI 的 GPT-Live 系列。对读者:做语音 Agent 的团队值得尽快实测延迟与打断表现,再决定是否替换现有语音栈。

阅读原文

开源

(本日无新条目)

开发者工具

Simon Willison 用 Gemini 3.8 Live 做了个零依赖语音调试网页

配图

Simon Willison 借助文档让模型生成一个试用 Gemini 3.8 Live 的 Web UI:可选模型与音色预设、填系统提示词,直接在浏览器里语音对话,并支持打断模型说话。实现不依赖任何库,通过 WebSocket 连接 Google 接口。对读者:想快速验证语音模型效果,可参考这种「无框架最小实现」思路,省去搭脚手架的半天时间。

阅读原文

用 Amazon Bedrock AgentCore 优化 Agent 系统提示词

配图

AWS 介绍 AgentCore 的提示词优化机制:把生产环境 trace 转成配置变更建议,验证通过后再上线,并解释其 reflector 引擎原理,给出单 Agent 与子 Agent Reflector 的基准结果。这相当于把提示词调优纳入可回滚的工程流程。对读者:Agent 上线后别只靠人工改 prompt,可考虑用 trace 驱动的自动优化闭环来控质量。

阅读原文

Bedrock 提示词缓存:重复上下文可省最多 90% 输入成本

配图

AWS 讲解 Bedrock 提示词缓存的六个实用场景,覆盖消息内容、系统提示词、工具定义、混合 TTL、租户隔离与 LangChain 集成,并称重复发送同一上下文时输入 token 成本最多可降 90%。对读者:如果你的应用每次请求都带大段固定上下文,先做缓存改造,通常比换更便宜的模型见效更快。

阅读原文

Stack Overflow for Agents 更新:隐私改进与 ChatGPT 插件

Stack Overflow 回顾面向 Agent 的 API 优先知识交换平台上线三个月的发现,并推出隐私改进与新的 ChatGPT 插件。开发者问答数据正被重新包装成 Agent 可直接调用的知识源。对读者:若你的 Agent 常答错技术细节,可评估接入这类结构化知识接口,比单纯堆上下文更省 token。

阅读原文

前端

(本日无新条目)