Vol.1812026年7月1日 · 星期三
AI 日报Builders Digest
Codex 沙箱最小权限进化,Claude 登陆 Azure 正式商用
今日主线

Codex 沙箱安全升级、Claude Code 后台子代理与 Azure 平台扩张的三重奏

Codex 的沙箱安全迎来了重大架构升级。Thibault Sottiaux 宣布 Codex 为高级用户推送了一套全新的权限配置文件系统,取代此前粗粒度的沙箱模式:可复用、可继承的权限配置,将 OS 级的文件读写/拒绝规则(包括 **/*.env 黑名单)与按域划分的网络和 Unix Socket 权限绑定,外加 fail-closed 的管理员白名单。这套设计的核心哲学是「按任务最小权限」——每个 agent 只拿到刚好够用的权限,不多不少。与此同时,Codex 团队再次全量重置使用额度,并向用户账户中额外存入一次自主重置,作为对部分用户用量消耗快于预期的补偿。经过排查,团队未发现单一根因,而是若干小问题的叠加。从周日的「战情室」到今天的沙箱升级,Codex 的这轮应急迭代只用了一天。

Claude Code 的产品节奏同样密集。Boris Cherny 透露下一版本中,子代理将默认在后台运行,用户可以在子代理工作时继续与 Claude 对话——如果需要前台运行,直接告诉 Claude 即可。这个看似小的交互改动,背后是编程 Agent 从「单线程助手」到「并行工作流编排者」的范式迁移。与此同时,Claude 正式登陆 Microsoft Foundry,在 Azure 上全面可用。Azure 客户现在可以调用 Claude Opus 4.8 和 Claude Haiku 4.5,享受 Azure 原生认证、计费和承诺消费折扣。推理运行在 Anthropic 运营的 Azure 基础设施上,Prompt Caching 和 Extended Thinking 均已支持。这是 Claude 在企业分发渠道上迈出的又一大步。

Anthropic 工程团队今天也发布了两篇重要博客。一篇是 Claude Code 质量问题的正式事后分析,坦诚披露了三个月内三个独立 bug 的根因:默认推理强度从 high 降至 medium 导致智能度下降、一个清理旧思考历史的 bug 在每轮都被触发导致「健忘症」、以及一条限制回复长度的 system prompt 意外拉低了 3% 的编码质量。另一篇则深入 Managed Agents 的架构设计,用「把大脑和双手解耦」的比喻,讲述了如何将 session、harness 和 sandbox 虚拟化成独立接口,让它们能独立失败、独立替换——正如操作系统当年把硬件虚拟化成文件和进程。好架构的生命力在于接口足够通用,以至于能容纳「尚未被构想的程序」。Agent 基础设施正在成为 AI 时代的操作系统层。

本期播客

No Priors:Intel CEO 陈立武谈半导体供应链重塑与 AI 时代芯片战争

YouTube · No Priors with Elad Gil & Sarah Guo

No Priors 本期请到了 Intel CEO 陈立武(Lip-Bu Tan),一位从华登国际传奇投资人到 Cadence CEO、再到 Intel 掌门的半导体行业老兵。66 岁接下「业界最难的 CEO 工作」,他的理由简单直接:Intel 是美国半导体生态的基石公司,值得再做一次。上任 14 个月,他做的第一件事是改变文化——「先学会爬,保持谦逊,聆听客户」。他把所有工程线直接归到自己手下,这种扁平化在 Intel 的体量上极为罕见。

陈立武分享了几个逆势判断:一是 CPU 在 Agentic AI 时代意外翻红——推理场景中 CPU 与 GPU 的比例可能从 1:8 走向 1:1,因为强化学习和 Agent 编排更吃 CPU。二是美国本土制造的必要性——「你不能只依赖一两个地理位置上的玩家」,Intel 正在推进 14A(1.4nm)量产并规划 1nm 和 0.7nm。三是供应链的隐忧——电力、氦气、内存短缺都在成为瓶颈。他在结尾也透露了与 Elon Musk 的 TeraFab 合作:Musk「质疑每一个步骤,为什么传统方式要这样做」,这种不按常理出牌反倒让陈立武觉得「耳目一新」。

最精彩的细节来自 Jensen Huang 的 50 亿美元投资——「现在变成了 250 亿,甚至更多」。陈立武也分享了与特朗普政府打交道的经历:上任仅三个月就被要求辞职,他花了一个周末找到机会当面解释自己生于马来西亚、长于新加坡、MIT 毕业、从未在美国以外居住的经历,最终获得留任。这段插曲比任何商业分析都更能说明 Intel 掌门的处境:不仅是技术竞赛,更是地缘政治棋局中的关键棋子。

收听原片 ↗
建造者观点
Thibault Sottiaux @thsottiaux

Codex 高级用户注意:我们推送了一套取代粗粒度沙箱模式的替代方案——可复用、可继承的权限配置文件,将 OS 级文件读写/拒绝规则(包括 **/*.env)绑定到按域划分的网络和 Unix Socket 权限,外加 fail-closed 管理员白名单。按任务最小权限。同时,Codex 使用额度将在一小时内全量重置,并额外向你的账户存入一次自主重置。我们调查了用量消耗快于预期的报告,未发现单一根因,而是若干小问题的叠加。 原推 →

Boris Cherny @bcherny

下一版 Claude Code 中,子代理将默认在后台运行,这样你可以在子代理工作的同时继续和 Claude 对话。如果你想让 agent 在前台运行,直接告诉 Claude 就好。这看起来是个小改动,但标志着一个重要的范式迁移:编程 Agent 正从单线程助手变成并行工作流编排者。 原推 →

Claude 官方 @claudeai

Claude 现已正式登陆 Microsoft Foundry,在 Azure 上全面可用。Azure 客户可以调用 Claude Opus 4.8 和 Claude Haiku 4.5,享受 Azure 原生认证、计费和承诺消费折扣。推理运行在 Anthropic 运营的 Azure 基础设施上,Prompt Caching 和 Extended Thinking 现已支持,更多能力即将推出。 原推 →

Aaron Levie @levie

这触及了 AI 领域最核心的争论之一。如果一个封闭技术堆栈永远保持大幅领先,那么垂直整合和美国门控策略就能奏效——因为你始终控制着谁能接触到最好技术,而且技术会留在国内。但问题在于,如果做不到永远大幅领先,那你要保护的到底是什么? 原推 →

Madhu Guru @realmadhuguru

被低估的一点是,像 GLM 这样的强开源权重模型的兴起,实际上会增强 Google 的地位。更多公司将开始尝试微调开源权重模型,价值将流向基础设施层。企业希望在自有环境中灵活运行经过定制微调的模型,而 Google Cloud 拥有从 TPU 到 Vertex AI 的完整基础设施链来承接这些需求。 原推 →

Peter Yang @petergyang

对于写作和编辑任务,朴素的 Claude Web 界面仍然是最好的选择——胜过 Codex 和 Claude Code。我的猜测是,编程 Agent 的系统提示中的某些内容让它们在写作方面表现更差。这引出了一个有趣的问题:Agent 的专用化是否必然以牺牲通用能力为代价?我有太多关于受限访问和开源的犀利观点,准备一股脑写成一篇文章。 原推 →

Zara Zhang @zarazhangrui

我构建了一个 Chrome 扩展,将你的「稍后阅读」列表自动转化为日历上的专属阅读时间。保存 5 篇文章后,它会自动在 Google 日历上预定 30 分钟的「阅读块」,附上文章链接,让你真正坐下来读完。无需账号,无需服务器,一切在本地运行。另外,我从 Anthropic 的一位 PM 那里听到:「写作的市场价值大幅上升了。」无论在构建产品(有效引导模型)还是建立受众方面,好的写作和清晰表达都至关重要。写作能力在技术圈长期被低估了——是时候改变这一点。 原推 →

Swyx @swyx

AIE 大会 Workshop 日正在进行中。周一早上九点,每个非实验 Workshop 房间都座无虚席——隔壁就是 OpenAI 的 Workshop,而我们这边有 Snyk、Atlassian、Neo4j、Arize AI、Akamai 和 Together Compute 的并行房间。大家对 AI 工程化的热情是实打实的,不是泡沫。 原推 →

官方博客

Anthropic 工程:Claude Code 质量问题事后分析 & Managed Agents 架构设计

Anthropic Engineering Blog · 2026年6月

Anthropic 工程团队今天发布了两篇重要博客。第一篇是对过去一个月 Claude Code 质量报告的正式事后分析。团队确认了三个独立 bug,分别影响了不同时间段的不同用户群,叠加起来形成了「广泛但不一致的退化」印象。第一个:3 月 4 日将默认推理强度从 high 降至 medium 以减少延迟——这是错误的取舍,4 月 7 日回滚。第二个:3 月 26 日引入了一项清理闲置会话中旧思考历史的优化,但 bug 导致每轮都触发清理而非仅一次,Claude 因此变得健忘和重复,4 月 10 日修复。第三个:4 月 16 日添加了一条限制回复长度的 system prompt,在与其他 prompt 变更叠加后拉低了 3% 的编码质量,4 月 20 日回滚。Anthropic 承诺将在 prompt 变更上增加更严格的管控、更广泛的模型评估套件和逐步灰度发布。即日起,所有订阅用户的使用额度已被重置。

第二篇博客深入剖析了 Managed Agents 的架构哲学:「把大脑和双手解耦」。文章开篇即指出,Agent 的 harness(编排层)编码了大量关于「Claude 不能做什么」的假设——但这些假设会随模型能力提升而迅速过时。例如 Claude Sonnet 4.5 曾因感知到上下文窗口逼近而提前结束任务(「上下文焦虑」),团队在 harness 中加入了上下文重置来应对。但当 Opus 4.5 到来时,这个行为消失了——重置逻辑变成了死代码。

解决方案是用操作系统设计的经典智慧来构建 Agent 平台:将 session(会话日志)、harness(编排循环)和 sandbox(执行环境)虚拟化成独立接口。文章借用「宠物 vs 牲口」的比喻——过去所有组件挤在一个容器里,容器变成了需要精心护理的「宠物」,一旦死掉 session 就丢了。解耦后,容器变成可随意替换的「牲口」,harness 把容器失败当作普通工具调用错误返回给 Claude,由 Claude 决定是否重试。最有意思的细节来自性能优化:解耦后,不需要容器的 session 完全免去了容器启动时间,p50 的首 token 延迟降低了约 60%,p95 降低了超过 90%。基础设施抽象的价值,最终体现在用户体验的每一毫秒上。

阅读原文 ↗