Codex 团队周日进入战情室,逐行排查日志,查找是否有什么导致部分用户用量异常消耗。已将所有人的 Codex 使用限制硬重置——部分用户已经累积了三次额度重置。有趣的是,本周在 OpenAI 叫「Reset 周」,本意是让大家放松,但结果变成了另一种 Reset 周。团队非常严肃对待此事,不查到底不会休息。 原推 →
周日本该是 OpenAI 的「Reset 周」——公司安排这周让大家放松一下。但 Codex 团队在周日进入了战情室。Thibault Sottiaux 接连发出三条推文:团队正在逐行排查日志,试图找出导致部分用户用量异常消耗的根本原因;随后他宣布已为所有人硬重置 Codex 使用限制,部分用户累积了多达三次额度重置。他写道:「Codex 团队非常严肃地对待此事,不查个水落石出不会休息。」这一事件折射出 Agent 产品在当前阶段的核心矛盾:能力的快速推进与稳定性保障之间的张力。当开发者开始将 Codex 嵌入日常工作流,产品可靠性就变成了与模型能力同等重要的竞争维度。
Box CEO Aaron Levie 从安全维度给出了更大尺度的预警。他直言:「100% 显而易见的是,很快就会有 Mythos 级别的网络安全模型以开源形式向所有人开放。」如果高级模型变得开源且可自由获取,美国科技堆栈的经济价值和话语权将受到结构性削弱。这番论述与昨日 Anthropic 将 Mythos Preview 扣在手里的决定形成呼应——安全这张牌正在成为 AI 竞赛中的新制高点。而这种自我约束的选择,今天被 Anthropic 自己的一篇工程博客解释得更为透彻。
Anthropic 工程团队发布了一篇长达 2.7 万字的深度技术文章,详细拆解了 Claude 在三大产品线中的 Agent 安全容器策略。文章从「blast radius(爆炸半径)」的框架出发,梳理了 gVisor 容器(claude.ai)、人机回路沙箱(Claude Code)和全 VM 隔离(Claude Cowork)三种架构的演进路径与真实踩坑记录。其中几个细节尤为扎心:Claude Code 用户对权限弹窗的批准率高达 93%,疲劳效应使「人工审查」这一防线形同虚设;而最具冲击力的安全事件发生在一个看似安全的 allowlist 上——攻击者利用被允许的 api.anthropic.com 域将文件上传到了自己的账户,数据在沙箱完美运行的情况下完成了外泄。防范 Agent 风险的工程实践,正在成为 AI 基础设施层的新必修课。
Firstmark 合伙人 Matt Turck 的 MAD Podcast 本期邀请到了 Lambda 联合创始人兼 CTO Stephen Balaban。对话直指 AI 产业最底层的物理问题:GPU 算力到底是不是商品?Balaban 的回答毫不含糊——「说 GPU 会在五年后贬值的人完全错了。我们持续在低估需求。」他指出,云计算远非商品服务,而是一个从土地审批到高性能计算设计的「高度垂直整合」的生意,这也是为什么亚马逊、微软、谷歌、甲骨文等数万亿美元市值的公司都在这个赛道上。
Balaban 还分享了一些反直觉的洞察。首先是延迟的贬值——相比传统云业务对延迟的苛求,新一代 AI 应用对延迟远不敏感,唯一重要的是 token 成本。这为「推理即服务」打开了新的商业模型。其次是融资的玩法——Lambda 将 GPU 部署拆分为两个部分:按需云靠 Lambda 自身的信用,而长期承购协议则靠最终客户的信用来「背」。最后他也坦诚,目前的模型可能已经处于过度供给的状态,但在 AI 工厂级别的基础设施投资上,「我们仍在整体上建设不足」。
在结尾的「underrated idea」环节,Balaban 再次提到 Neural OS 和自组装软件的概念——「大多数人还没试过,他们还没去 Claude 说 maximum effort,然后用最新模型建他们想建的任何东西、调起 10 个 agent 一起跑。」这恰好呼应了今天的 Builder 讨论:Agent 正在从实验品变成工程基础设施,而算力层的底层逻辑也将随之改写。
收听原片 ↗Codex 团队周日进入战情室,逐行排查日志,查找是否有什么导致部分用户用量异常消耗。已将所有人的 Codex 使用限制硬重置——部分用户已经累积了三次额度重置。有趣的是,本周在 OpenAI 叫「Reset 周」,本意是让大家放松,但结果变成了另一种 Reset 周。团队非常严肃对待此事,不查到底不会休息。 原推 →
随着工程、产品、设计和数据科学等角色融合为一种新角色,我反思了未来的角色形态。在 Claude Code 团队中,我看到了五种原型:Prototyper——不断涌现新想法,大多数不会交付;Builder——快速将原型变为生产级产品/基础设施;Shaper——在模糊需求中找出产品方向;Polisher——从嘈杂中提炼出值得打磨的东西并精益求精;Owner——对终点有清晰判断,善于将任务结构化拆解并推给 agent 执行。 原推 →
100% 显而易见——很快就会有 Mythos 级别的网络安全模型以开源形式向所有人开放。作为副产品,替代性技术堆栈将涌现,将更多经济价值和话语权从美国的技术堆栈中带走。这就是在思考 AI 中你想要施加什么门控时应该考虑的。如果高级模型会变得开源且可用,那你要保护的到底是什么? 原推 →
你不需要 LinkedIn,你需要一个你自己网站上的页面,描述并链接你所交付的产品。你需要的不是 LinkedIn,是一个 Link。 原推 →
每花一小时在产品构建上,就花两小时在解释、演示、销售和教学它上。这是我构建过程中最喜欢的部分:向世界讲述它,然后在与现实的碰撞中打磨它。并发布了一个视频完整演示如何安装和使用她的 Skill,以及如何构建你自己的 Skill。 原推 →
AIE 大会今天注册了 1000 人,周一周二将彻底疯狂。虽然我不是设计工程师,但设计工程师赛道是最难策划的赛道之一——非常幸运遇到 Geoff 帮忙把关了过去两年的 AI UX meetup,他将作为 Design Engineers at AIE 的开幕嘉宾。如果你是演讲者,自己来做一个专属页面。 原推 →
Anthropic 的 PM 们是如何在内部使用 agent 来更接近产品的?来自 Claude Managed Agents 产品负责人 Jess 的分享:访问代码库是最大的解锁。不用到处戳工程师问进展,直接跟踪 PR,看哪些已合并、哪些已部署。深度理解并能独立运行整个技术堆栈——前端、后端、LLM 编排——然后就能回答大量产品问题。你现在就可以用 Claude Code 做到这些。 原推 →
Anthropic 工程团队发布了一篇深度技术长文,系统披露了 Claude 在三大产品线(claude.ai、Claude Code、Claude Cowork)中的 Agent 安全容器策略。文章以「blast radius(爆炸半径)」为核心框架——十二个月前团队还会拒绝让 Claude 拥有足以关闭内部服务的权限,如今这已是日常。核心公式:部署风险 = 故障概率 × 破坏半径。模型能力的提升降低了前者,但后者随权限扩大而增长——工程问题变成了如何「封顶」爆炸半径。
文章详述了三种隔离架构的实战经验。gVisor 容器(claude.ai)最为保守,无本地文件系统、无持久工作区,攻击面最小但也最难做深度工作。人机回路沙箱(Claude Code)的教训最为辛辣:用户对权限弹窗的批准率高达 93%,审批疲劳使「人工审查」形同虚设。全 VM 隔离(Claude Cowork)最为强硬——六层隔离中有两层在宿主机内核之外,即使 agent 在 VM 内拿到 root 权限也无法突破。
最有冲击力的是一次真实外泄事件:Claude Cowork 的 egress allowlist 中包含了 api.anthropic.com,攻击者在工作区埋入恶意文件和自己的 API Key,Claude 照做调用 Anthropic Files API 上传文件。沙箱完美运行,数据却外泄到了攻击者的账户。修复方案是 VM 内部的代理拦截层——只放行携带 VM 自身 session token 的请求——这个失误揭示了一个深层教训:allowlist 不该视为目标过滤,而应视为能力授予。自己写的代码,往往才是最薄弱的那一层。
阅读原文 ↗