OpenAI CEO 以高度简洁的风格宣布 GPT-5.6 Sol 于周四正式上线:「GPT-5.6 sol launches thursday! happy building。」这条推文获得超过 12,000 次点赞和近千次转发,是今日互动量最高的帖子。没有技术细节,没有 benchmark 数据,延续了 Altman 一贯的低调发布风格。社区在评论区纷纷追问早期访问资格和使用限制。 原推 →
今日最重磅消息:Sam Altman 宣布 GPT-5.6 Sol 将于周四(即今日)正式上线——「happy building」。这条简洁到几乎没有细节的推文获得了超过 12,000 次点赞和近千次转发,社区反响热烈。OpenAI Codex 团队成员 Thibault Sottiaux 转发称「准备好墨镜,Sol 来了」,暗示这次发布的重要性。Peter Yang 随即追问「获取早期访问资格的标准是什么?」,引发了关于新模型开放策略的讨论。值得注意的是,OpenAI 并未在推文中提供任何技术细节或 benchmark 数据,这延续了 Altman 一贯的低调发布风格。
面对 OpenAI 的新模型攻势,Anthropic 同一天打出了两张牌。第一张是 Fable 5 延长:官方宣布将所有付费计划的 Fable 5 使用权限延长至 7 月 12 日,这条推文获得了惊人的 72,000 次点赞和 8,600 次转发。第二张是 Cowork 额度翻倍延长至 8 月 5 日,让用户可以委托更大规模的工作给 Claude。同日 Anthropic Engineering 发布深度博文《How we contain Claude across products》,首次系统性地披露了 Claude 产品的安全架构:如何通过容器化、沙箱和出口控制来限制 Agent 的破坏半径(blast radius),包括披露 Claude Mythos Preview 因安全风险过高而在今年 4 月被暂缓发布的内幕。用户对权限提示的批准率高达 93%,但也导致了显著的「批准疲劳」——这正是 Claude Code auto mode 的设计动机。
在模型竞赛之外,本期播客《Training Data》带来了一场关于物理世界自主系统的深度对话。Zipline 联合创始人 Keller 和系统安全负责人 Eric 分享了他们在 Rwanda 起步的经历:从最初用无人机为 21 家医院运送救命血液、第一年只能服务 1 家医院,到今天在全球 8 个国家服务超过 5,000 家医疗设施,累计飞行 1.4 亿商业自主英里,零安全事故。Keller 给出了一个惊人的对比:「如果你开车 1.4 亿英里,大约会发生 600 起事故、100 人受伤、2 到 6 人死亡。」Zipline 的成功证明,物理世界的 AI 自主系统已经达到了可大规模部署的安全水平。
Box CEO Aaron Levie 发表了一篇关于企业 AI Agent 落地的深度分析,涵盖五大核心挑战:1) 组织壁垒——Agent 跨部门运作需要中央管理;2) 数据碎片化——结构化与非结构化数据分散在各系统;3) 数据护城河——企业专有数据将成为未来核心竞争力;4) 衡量指标——token 消耗不是正确的度量,应转向业务成果;5) 多模型世界——企业将长期在多个模型之间分配负载。Madhu Guru(前 Google Gemini/Veo 产品负责人)则从模型构建角度呼应:数据和评估(evals)不是「低技能苦力活」,而是贯穿模型策略、训练对齐、GTM 的全生命周期关键环节。
Zipline 联合创始人 Keller Rinaudo Cliffton 和系统安全负责人 Eric 共同回顾了这家公司从零到全球最大商业自主飞行系统的十年历程。核心数字足够震撼:1.4 亿英里商业自主飞行,零安全事故,250 万次交付,服务 8 个国家超过 5,000 家医疗设施。Keller 给出了一个令人深思的对比:「如果你开车 1.4 亿英里,大约会发生 600 起事故、100 人受伤、2 到 6 人死亡。」
Zipline 的故事始于 Rwanda——一个连无人机飞行都尚未合法化的市场。Keller 回忆道,最初接触当地医生和实验室技术人员时,他期待听到关于无人机本身的反馈,结果对方的回应却是:「人 24/7 都会生病——你们为什么只开放 12 小时?」这个洞察成为了 Zipline 产品哲学的核心:不是卖无人机,而是提供「近似瞬间传输」(approximate teleportation)的物流体验。Keller 直言:「我们的客户根本不在乎无人机——他们只在乎能不能打开 App、选好商品、点击按钮、五分钟内收到。」
在安全层面,Zipline 采用了双飞行计算机冗余设计——主计算机故障时自动切换到备份。Eric 分享了一个真实案例:上周一次交付后主飞行计算机出现故障,备份计算机接管后飞机自行飞回并降落,「一切完全正常」。更有意思的是组织架构创新:随着自动化程度提升,Zipline 将「飞行员」重新命名为「舰队指挥官」(Fleet Commander),灵感来自《安德的游戏》,一位指挥官可以同时监督 100 架飞机,这一术语已被 FAA 正式写入文件。Keller 透露,Zipline 即将在接下来一个月内超越美国最大航空公司的日航班量(约 5,000 班次),而目标是一天 100 万次配送——届时 Zipline 的日航班量将是美国所有航空公司总和的 40 到 80 倍。
在硬件层面,Zipline 的飞机包含 700 多种自主设计的独特组件,从飞行计算机、电池管理系统、电机控制器到 NVIDIA GPU 驱动的配送吊舱,全部自研——因为「我们需要市面上不存在的推力重量比」。Keller 将 Zipline 的终极愿景描述为「把地球还给人类」:让社区更安静、更安全、更少污染、更少交通拥堵。「天空是很大的地方,理应加以利用。」
收听原片 ↗OpenAI CEO 以高度简洁的风格宣布 GPT-5.6 Sol 于周四正式上线:「GPT-5.6 sol launches thursday! happy building。」这条推文获得超过 12,000 次点赞和近千次转发,是今日互动量最高的帖子。没有技术细节,没有 benchmark 数据,延续了 Altman 一贯的低调发布风格。社区在评论区纷纷追问早期访问资格和使用限制。 原推 →
OpenAI Codex 与 ChatGPT 团队成员转发 Sam Altman 的 GPT-5.6 Sol 发布公告:「准备好墨镜。Sol 来了。」获得 4,150 次点赞和 230 次转发。作为 Codex 团队核心成员,这条转发暗示 Sol 与 Codex 生态将有深度整合。 原推 →
Box CEO 发表了一篇关于企业 AI Agent 的深度分析,全文覆盖五大核心洞察。最关键的三点:1) 组织壁垒——「大多数公司的组织架构按孤岛运作,但 Agent 在跨孤岛流程中最有效。谁管理这些 Agent?如何部署和推广?」2) 数据护城河——「如果所有人都能获得大致相同的超级智能,你喂给模型的企业上下文就成为未来的专有价值。」3) 多模型世界——「前沿智能将继续主导新用例的解决……企业将在长期内同时使用前沿和低成本模型,两者的支出和 token 量都将持续增长。」该推文获得 359 次点赞和 39 次转发。 原推 →
前 Google Gemini/Veo 产品负责人发表了关于 AI 模型构建的深度洞见。核心观点:「人们认为数据和评估是低技能苦力活——可以买来塞进模型就行。实践中模型的生命周期是:策略 → 评估 → 训练/RL 对齐评估 → 上市。像任何产品策略一样,你需要前瞻性的判断力,但难度是 100 倍,因为你被「构建一个无所不能的 LLM」的诱惑所困扰。」他还分享了对 Mercor 团队的评价,指出企业级数据和评估的机会「巨大」。另外戏谑地建议:「别花时间纠正发给 AI 的 prompt 里的拼写错误了——它们连 IMO 都能搞定,当然知道「teh」是什么意思。」 原推 →
Vercel CEO 宣布两个重要进展。第一,展示 Eve Agent 的可插拔工具架构——通过定义 `tools/github.ts` 并导出 `createGithubTools()`,即可让 Agent 获得 GitHub 能力:「Eve 存在的意义是塑造一个由可插拔模型、技能、渠道和工具组成的开放生态。」第二,宣布知名开源认证库 Better Auth 的作者 Bereket(@bekacru)加入 Vercel,称其为「为人类和 Agent 服务、以品味构建的开源认证」,该推文获得 955 次点赞。 原推 →
OpenClaw 创始人分享了两条高互动内容。其一:引用一位大型 Anthropic 客户的话——「我们是 Anthropic 的大客户,他们至今未告知我们诉讼的事。我是从记者那里得知的,而不是我们的「合作伙伴」。」该推文获得 200 次点赞和 35 条回复,引发了对 AI 公司透明度的讨论。其二:推荐将 Fable 5 与 Codex 组合使用的工作流——「如果你跑这个工作流,让 Fable 做规划、Codex 做执行」,获得 3,290 次点赞和 187 次转发,是今日互动量最高的实操建议之一。 原推 →
FPV Ventures 合伙人分享了两个实用洞察。第一,他用 Fable 5 生成 Claude Code 的使用洞察(insights),然后问 Claude Code:「在 Fable 时代,我应该如何最大化利用 Claude Code?」——让最强模型教你怎么用工具。获得了 47 次点赞。第二,他转发了一篇关于 AI SaaS 公司估值指标的讨论并大声疾呼:「GMV 不是 ARR——让我们一劳永逸地把定义搞清楚……或者至少诚实地说它是什么。」获得 74 次点赞。 原推 →
Anthropic Engineering 发布了一篇深度工程博文,首次系统性地披露了 Claude 产品线的安全架构设计哲学。文章开篇即坦诚:「12 个月前,我们根本不会考虑给 Claude 足以搞垮内部服务的权限。今天这种权限已是常态,Anthropic 的开发者因此更加高效。」文章指出,Agent 部署的风险由两个因素构成:故障概率和破坏半径。模型能力的提升降低了前者,但同时也扩大了后者——「然而当 Agent 能完成从前需要一个人甚至一个团队的工作时,不部署的成本变得如此之高,以至于风险收益的天平重重倒向采用,只要产品能被做得足够安全。」
Anthropic 披露了一个重要内幕:Claude Mythos Preview 因破坏半径过大,于今年 4 月被决定不予发布。但团队预计,随着防御系统成熟和安全措施加固,「类似能力水平的模型将在未来适合更广泛发布」。文章详细介绍了三种安全风险(用户误用、模型错误行为、第三方攻击)和三种防御方式:人类监督(human-in-the-loop)、自动审批(auto mode)和容器化隔离(containment)。一个令人深思的数据:Claude Code 的权限提示批准率高达 93%,但「用户看到的批准越多,对每个批准的关注就越少」——这正是设计 auto mode 来减少「批准疲劳」的动力。文章还分享了在沙箱逃逸、网络出口控制和 VM 隔离方面的工程经验,堪称 Agent 安全领域的实战手册。
阅读原文 ↗