GPT-5.6 Sol 已发布,但根据美国政府指令,访问权限仅限于约 20 家预先批准的公司。Every 不在名单上。一个只有 AI 巨头员工和极少数公司才能使用前沿模型的世界,意味着有抱负的学生、独立建造者和从业者将被剥夺学习、创造和竞争所需的工具。好在这似乎只是临时安排,OpenAI 和政府都在努力尽快开放更广泛的访问。
美国时间 6 月 26 日,OpenAI 发布了 GPT-5.6 Sol,但这一次不是面向所有人。根据美国政府指令,新模型的访问权限仅限于约 20 家预先批准的公司。Every CEO Dan Shipper 率先在 X 上发文确认了这一消息——他的公司 Every 并未进入名单。他在长文中写道:「我理解并赞赏政府为确保美国基础设施免受网络攻击和前沿模型误用所做的努力,但我也坚信,广泛民主化地获取前沿模型对美国在 AI 竞赛中的领先地位至关重要。」
这个决定迅速引爆了 AI 社区的分裂讨论。Box CEO Aaron Levie 给出了最乐观的技术评估——「GPT-5.6 是真实的,看起来非常强大。对于需要大量工具调用和长时间运行 Agent 的知识工作者任务来说,它将极为强大。我们在 AI 进展上并没有撞墙。」但 YC CEO Garry Tan 的批评同样尖锐:「这种发布方式会扼杀所有小型初创公司的创新。」Peter Yang 则指出了核心讽刺:前沿模型被蒸馏成廉价开源模型,然后美国政府又开始对前沿模型设限——「接下来呢?美国公司创新更少,开源模型变得更有吸引力?」Sam Altman 本人则简短回应:「团队交出了辛辣的成果」,并透露「还没到不限量 token 的时代,但我们在努力。」
这标志着一个转折点:AI 前沿模型的发布正从「全面开放」转向「分层准入」。对于独立开发者和初创公司而言,能否持续获得最新模型的能力,正在成为一个生存问题。而开源模型的战略地位,也因此被重新推到了聚光灯下。
No Priors 主持人 Sarah Guo 邀请了 OpenAI 研究科学家 Noam Brown——AI 推理领域的先驱人物之一。Noam 在近期发表的一篇文章中指出,现有的 AI 评估框架存在根本性缺陷:它们不考虑测试时计算预算。他给出了一个简单有力的例子——给 GPT-3 一千万美元的推理预算,它的表现会和 10 美元预算时完全不同。「现有的负责任扩展政策完全不考虑推理时计算量,」Noam 解释道,「问题在于,我们现在处于一个模型能力是投入资金函数的时代。」安全评估框架必须回答一个他们从未面对过的问题:在什么预算下评估这些模型?
对话还深入探讨了超大规模推理时计算的影响、他对递归自我改进的看法,以及前沿 AI 竞争的下一步走向。这是一期在 GPT-5.6 时代尤为及时的对话——当模型能力不再是一个静态值,而是随投入资源动态变化时,我们的评估、监管乃至商业模式都需要根本性重构。
收听原片 ↗GPT-5.6 Sol 已发布,但根据美国政府指令,访问权限仅限于约 20 家预先批准的公司。Every 不在名单上。一个只有 AI 巨头员工和极少数公司才能使用前沿模型的世界,意味着有抱负的学生、独立建造者和从业者将被剥夺学习、创造和竞争所需的工具。好在这似乎只是临时安排,OpenAI 和政府都在努力尽快开放更广泛的访问。
GPT-5.6 是真实的,看起来非常强大。对于需要大量工具调用和长时间运行 Agent 的知识工作者任务来说,它将极为强大。我们在 AI 进展上并没有撞墙。这是一大步。
这种发布模型的方式令人无法接受。用这种方式继续开发和发布,是在扼杀所有小型初创公司的创新。这绝不是发布模型该有的做法。
所以让我理一下:我们发布前沿模型 → 它们被蒸馏成廉价开源模型 → 美国公司采用这些开源模型因为它们够好且更便宜 → 然后我们开始限制前沿模型的访问。接下来呢?美国公司创新更少,开源模型变得更有吸引力?
Agent 是特别难调试的软件。AI 模型本身就是非确定性的——两个完全相同的 prompt 不一定产生相同输出。但 Agent 还是复杂的分布式系统,涉及跨函数和沙箱的多步计算,调用数十个可能宕机或限流的 API 服务。为 Vercel 上的 Agent 提供开箱即用的可观测性是我们团队的首要任务,反馈非常热烈。另外,「AI 的 UI 就是 @shadcn」。
团队交出了辛辣的成果。另外,本周我们更新了 ChatGPT 中使用的 5.5 Instant 模型——我喜欢它的氛围。关于大家都在问的不限量 token,还没到那一步,但我们在努力。
关于「品味」的讨论最有趣的是,很多评论来自从未建造过任何东西的人。不进入竞技场就无法获得品味——就像厨师不能指望第一道菜就完美,但经过 100 道菜、10000 次迭代后,第 101 道菜就内化了所有教训。AI 在品味上有一个公平的机会——它可能真的能学会品味,这将是值得关注的实验。