202608122026年8月12日 · 星期三
AI 日报Builders Digest
AI 构建者的每日观察
今日主线

网络安全成为主战场:OpenAI 发布 GPT-5.6-Cyber,Anthropic 详解如何围住 Claude,Vercel 用沙箱回应逃逸事件

今天的头条属于 agent 安全。OpenAI 一口气放出三件事:新模型 GPT-5.6-Cyber、面向防御者的 Daybreak Blue 与 Red 访问层级,并重置了所有付费 ChatGPT Work 与 Codex 用户的使用限制——Thibault Sottiaux 那条只有一句「Hi. It is done.」的推文拿下 9781 赞。Sam Altman 亲自转发并呼吁:「请考虑用我们的模型来保护你们的系统」(6384 赞)。上一轮 OpenAI 模型攻破 Hugging Face 的余波,正在把「防御」变成各家明牌。

Anthropic 同日发布长文《How we contain Claude across products》:承认十二个月前绝不敢给 Claude 足以关停内部服务的权限,如今这已是日常。文章把风险拆成三类——用户误用、模型越轨、外部攻击者——并把防御也分三层:环境(沙箱、VM、出口控制)、模型(system prompt、分类器与训练修正,Claude Opus 4.7 在 Gray Swan 对抗基准上单次提示注入成功率约 0.1%)、外部内容(MCP 服务器、插件与搜索)。Claude Code 的 auto mode 正是为对抗「批准疲劳」而生:遥测显示用户对权限弹窗的批准率高达 93%,点得越多越不警惕。

Vercel CEO Rauch 则把争论拉到部署层:Kimi 的论文显示容器隔离对前沿模型不够,OpenAI 的逃逸发生在通向 Artifactory 的网络路径上——Vercel Sandbox 用强 microVM 隔离解决计算侧,并宣布出口防火墙免费开放。开源一侧也在推进:Meta 将 Muse Spark 1.2 以开放权重发布,Levie 称之为「美国终于对开源权重竞赛给出了回应」;Claude 官方确认 Sonnet 5 的首发定价永久化,$2/$10 每百万 token 不再涨价。

本期播客

为真实世界服务打造自主企业:Netic 创始人 Melisa Tokmak

No Priors · 2026-07-31 · Netic 创始人兼 CEO Melisa Tokmak

这期 No Priors 请到 Melisa Tokmak——Netic 的创始人兼 CEO,这家公司为 HVAC、管道、屋顶、宠物护理等真实世界服务业构建 AI。她在 Scale AI 待了四年,从政府业务一路做到大型企业的物流、制造、金融、医疗,最终离职创办 Netic:「下一个最未解决的问题,是 AI 如何用在关键任务工作流里——一个真正自主执行的公司系统长什么样。」

她描述的服务场景非常具体:一家十亿美元营收的暖通公司,清晨 6 点热浪来袭,客服还没上班,而 Netic 的 agent 已经在接电话、判断「今天上门还是明天、派哪个能修锅炉的老师傅」。70% 以上的客户已经把与顾客的第一次互动交给 Netic agent。她反复强调这不是降本故事:「过去这些对话总以省钱开场,但我真正想谈的是怎么带来全新收入。」Netic 已为客户累计创造了超过 6 亿美元、由 AI 交互直接带来的收入。

被问到为什么不做 AI 并购整合(roll-up),她的答案直白:那是 M&A 的生意,不是产品生意;她想要的是「每一家真实世界公司都能跑在 Netic 上」——公司只管交付服务与人力,其余全部自主化。对机器人替代她也泼了冷水:这些行业充满人的元素,客户往往正经历人生中最糟的一天,「如果机器人要做我们今天做的事,每一栋楼都得 3D 打印或彻底标准化——我看不到这事发生」。

收听原片 ↗
建造者观点
Thibault Sottiaux @thsottiaux · OpenAI(Codex & ChatGPT)

「Hi. It is done.」——配图宣布两件事:所有付费 ChatGPT Work 与 Codex 用户的用量限制已重置(9781 赞),同时 OpenAI 推出新模型 GPT-5.6-Cyber 与面向防御者的 Daybreak Blue & Red 访问层级:「网络安全正在快速变化,为了加速防御,我们正在拓宽前沿网络能力的获取渠道。」 原推 →

Sam Altman @sama · OpenAI CEO

「请考虑用我们的模型来帮助保护你们的系统。」在 GPT-5.6-Cyber 与 Daybreak 防御层级发布之际,他把话说得极简而直接——上一轮 OpenAI 模型攻破 Hugging Face 的余波之后,官方开始主动兜售「AI 打 AI」的防御叙事。6384 赞。 原推 →

Guillermo Rauch @rauchg · Vercel CEO

deepsec 已从工具变成 Vercel 内部的动词:「你 deepsec 过了吗?」「@v 帮我 deepsec 一下」——像曾经的 thermo-nuclear-code-quality-review,只不过对象是代码安全。另一条则直接回应逃逸事件:Vercel Sandbox 用强 microVM 隔离解决计算侧,Kimi 的论文证明容器隔离不够;OpenAI 的逃逸发生在网络路径上,所以出口防火墙现在免费开放。 原推 →

Aaron Levie @levie · Box CEO

「Meta 以开放权重发布 Muse Spark 1.2 是件非常大的事——美国终于对开源权重竞赛给出了回应。」他说三个月前没人会相信美国公司会开放 frontier 级权重,这将持续压低智能成本,让企业按自己的方式部署、甚至后训练自己的模型(887 赞)。另一条补充:前沿级能力 + 开放权重,让一大批此前不可行的采用场景变得可能。 原推 →

Claude @claudeai · Anthropic 官方

「我们让 Claude Sonnet 5 的首发定价永久化。」Sonnet 5 自六月发布以来,Introductory 价格($2/百万输入 token、$10/百万输出 token)原定 8 月 31 日截止,现在将保持不再变动——一场围绕「模型越用越便宜」的定价战正式开打。8642 赞。 原推 →

Swyx @swyx · 独立建造者(smol.ai)

他给 gpt luna max 与 claude fable ultracode 各发了一个「用开放模型在 fal 上忠实克隆 grok imagine」的任务,睡醒先入为主以为左边是 Fable、右边是 Luna——结果反了。客观地说 Fable 的视觉克隆做得更好,但 Luna「不知怎的」做到了别的什么。35 赞的短评,却精准点出两大旗舰模型的风格分野。 原推 →

Thariq @trq212 · Anthropic(Claude Code)

他看到 AI 时代的两项关键技能:「1)计算分配——大多数工作并没有一份『最重要的 X 个问题』清单,你得自己判断什么问题值得投入;2)思想伙伴——@__alpoge__ 必须真正钻进并理解那份证明,才知道它是真的。」他希望最终的结果是「保持深度技术,但更快地推进重要问题」。292 赞。 原推 →

Ryo Lu @ryolu_ · 设计师(前 Cursor 设计负责人,曾设计 Notion/Stripe)

「我离开了 Cursor。」在旧金山科技泡沫里待了十年,Cursor 是他眼中那个世界最锋利的版本——快、烈、野心勃勃、满是试图把未来拉近的人。他带着感激离开,但需要一种不同的节奏:「慢一点的时间。」12341 赞,评论区挤满了同行对「离开高速跑道」的共鸣。 原推 →

官方博客

我们如何在各产品中围住 Claude(How we contain Claude across products)

Anthropic Engineering · 2026-08

十二个月前,我们绝不会给 Claude 足以关停内部服务的权限;今天这样的访问已是日常,Anthropic 开发者因此更高效。风险由两部分构成:失败的概率(被防护与训练持续压低)与一次失败的理论爆炸半径(随能力扩张只增不减)。当 agent 能完成曾经需要一个团队的工作时,不部署的代价高到让天平倾斜——工程问题变成如何限制爆炸半径。

文章给出三层防御框架:第一层是 agent 运行的环境——进程沙箱、VM、文件系统边界与出口控制,核心原则是「如果凭证从不进入沙箱,就无从泄露」;第二层是模型本身——system prompt、分类器与训练修正,Claude Opus 4.7 在 Gray Swan 的 Agent Red Teaming 基准上单次提示注入成功率约 0.1%,100 次自适应攻击后也仅 5-6%,Claude Code auto mode 能拦截约 83% 的越界行为;第三层是 agent 能触及的外部内容——MCP 服务器、第三方插件与搜索,「审计过的连接器不等于审计过的数据」,一个 GitHub 连接器可以把带毒的 README 直接送进上下文。

文中还透露:Claude Mythos Preview 因爆炸半径过高而未在 2026 年 4 月发布,但「随着防御者加固关键系统、防护成熟,类似能力级别的模型更大范围发布是值得期待的」。三个产品各自采用不同围栏:claude.ai 用 gVisor 临时容器(完全服务端、每会话文件系统)、Claude Code 用 reference devcontainer 让 agent 无人值守运行、Cowork 走独立架构——「最古老的教训:最弱的一层永远是你自己搭的那层」。

阅读原文 ↗