OpenAI CEO 用一条巧妙的对比表达了对 AI 能力的真实感受:「我大儿子第一次说出两个词组成的句子,我对这个认知壮举的惊叹程度,和 GPT-5.6 发现新数学差不多。」这条推文获得了超过 11000 次点赞,显示了社区对前沿模型能力的普遍认可。 原推 →
本周最值得关注的深度思考来自 OpenAI 研究科学家 Noam Brown——他被誉为「AI 推理之父」,是多智能体扑克 AI Libratus 和外交博弈 AI Cicero 的缔造者。在 No Priors 播客中,Brown 系统性地拆解了当前 AI 评估体系的根本缺陷:Benchmark 网格(每个模型在固定 benchmark 上给出一个数字)已经全面失灵,因为它完全不控制推理预算(test-time compute)。「GPT-3 时代你给它 1000 万美元预算也做不了什么,但现在的模型——给它 10 美元和给它 1000 万美元,表现天差地别。那我们应该按什么预算来评估?」他的核心主张:Benchmark 必须像经济学的供需曲线一样带 X 轴——标注 Tokens、成本或时间——不同模型在不同预算水平下的性能才能被公平比较。
这一观点对行业的影响远超学术讨论。Brown 指出,当前所有 AI 实验室的「负责任扩展政策」(Responsible Scaling Policies)和「准备框架」(Preparedness Frameworks)都是在 ChatGPT 时代制定的——那时候 test-time compute scaling 还不是一个维度。「这些框架完全不考虑推理预算。问题是,给模型 10 美元预算它可能安全,给 1000 万美元预算呢?现有政策回答不了这个问题。」他特别提到了 AISI(英国 AI 安全研究所)的评估:模型在 1 亿 token 的推理预算下仍在持续提升——而且提升不是跳跃式的,是连续的,这意味着你可以用低预算下的性能斜率来「预测」高预算下的表现。Brown 认为这是一个亟待学术界研究的课题。
在建造者社区,Anthropic 的 Cat Wu 分享了一个令人印象深刻的使用案例:她让 Claude Code 启动一个动态工作流,自动搜索 100 位候选人,包含 LinkedIn、Twitter、博客和播客信息,并为每人写一段 pitch——然后她就合上电脑出门了,在路上通过手机查看结果。YC 总裁 Garry Tan 则从大阪发来反思:「人类财富的真正瓶颈从来不是资源,而是好想法和实现想法的杠杆。我们刚刚为所有人删除了杠杆约束。现在只剩下想法了——去拥有它们,然后构建它们。」Sam Altman 则用一条对比表达了对 AI 能力的真实感受:「我家大宝第一次说出两个词组成的句子,我对这个认知壮举的惊叹程度,和 GPT-5.6 发现新数学差不多。」这条推文获得了超过 11000 次点赞。
OpenAI 研究科学家 Noam Brown 与 No Priors 主持人 Sarah Guo 进行了一场关于 AI 评估体系危机的深度对话。核心观点:当前所有 AI 实验室发布的 Benchmark 对比表格已经全面失灵——因为它们不控制推理预算(test-time compute)。「GPT-3 时代你给它 1000 万美元预算也做不了什么,但现在的模型——如果搭好脚手架,甚至能思考数周后才 plateau。所以 plateau 点已经远到无法实际测试。」
Brown 提出了一个简洁的解决方案:所有 Benchmark 对比都应该带 X 轴——标注 Tokens、成本或时间——画出性能随推理预算变化的曲线。「每次我跟其他研究者聊这个,他们都说『对,有道理,我们应该这么做。』但没有人这么做。因为第一个打破 Benchmark 网格的实验室,公众会拿旧方式去对比,看起来就像模型变差了。」他呼吁行业一起打破这个「坏均衡」——「下次有模型发布时,希望有公司能感到足够安全,不把 Benchmark 网格放在最前面。」
对于安全评估,Brown 的观点更加尖锐:「这是一个不便的真相。」现有的 Responsible Scaling Policies 和 Preparedness Frameworks 都是在 ChatGPT 时代前后制定的,完全未考虑 test-time compute 维度。他以 AISI 的评估为例:模型在 1 亿 token 的推理预算下仍在持续提升——「给 10 美元的预算和给 1000 万美元的预算评估出来的安全水平完全不同,现有政策根本没有回答『按什么预算』这个问题。」他还讨论了递归自我改进(recursive self-improvement)的可能性:因为模型的能力解锁严重依赖大规模推理预算,而推理预算消耗时间,这意味着「一夜之间实现智能爆炸」的场景不太可能——模型在时间维度上是被瓶颈的。
对于研究者如何使用模型,Brown 分享了个人实践:「我用它们来写扑克 AI——几乎没有什么开源代码可以参考,需要真正的推理和迭代。它们现在已经做得非常好了。我甚至不惊讶,六个月或一年后,模型能零样本完成我整个博士论文级别的扑克求解器。」他同时指出模型仍有局限:「它们目前的研究品味(research taste)还不行,所以是研究者的极好补充,但不能替代整个研究周期。」对于多智能体(multi-agent)系统,他表达了审慎乐观:「MoltBook 和 OpenClaw 刚出来时确实被过度炒作了,但它们指向了未来方向。」
收听原片 ↗OpenAI CEO 用一条巧妙的对比表达了对 AI 能力的真实感受:「我大儿子第一次说出两个词组成的句子,我对这个认知壮举的惊叹程度,和 GPT-5.6 发现新数学差不多。」这条推文获得了超过 11000 次点赞,显示了社区对前沿模型能力的普遍认可。 原推 →
Anthropic Claude Code + Cowork 团队成员分享了她最爱的 Claude Code 新用法:让 Claude Code 启动动态工作流自动搜索 100 位候选人,收集 LinkedIn、Twitter、博客和播客信息,并为每人写一段 pitch——然后合上电脑出门,「在路上通过手机查看结果」。她的另一条推文则展示了 Fable 5 的「判断力」提升——无需提示就能自主使用倾向性评分匹配(Propensity Score Matching)做留存分析。 原推 →
YC 总裁兼 CEO 从大阪发来两条深度思考。其一是关于 AI 时代的财富创造:「人类财富的真正瓶颈从来不是资源,而是好想法和实现想法的杠杆。我们刚刚为所有人删除了杠杆约束。现在只剩下想法了——去拥有它们,然后构建它们。这是你的时代。」其二是关于日本的启示:「日本已经跑完了『天花板实验』——零增长的三十年建出了世界上最好的铁路、服务和工艺。当无法在『更多』上竞争时,你就在『更好』上竞争。而我们现在两者兼得。」 原推 →
Anthropic Claude Code 团队成员贡献了一条经典的硅谷自嘲段子:「『上帝给了我一个征兆』——(想起自己住在旧金山)——『我是说,我被时间尽头的 ASI 因果性地影响,为人类最大化期望价值。』」这条推文调侃了硅谷理性主义者社区的语言习惯,获得了 581 次点赞。 原推 →
Every CEO 分享了两条关于 AI 编程工具演进的观察。其一是 Fable 在 Ultracode 上的表现——用户要求「改个按钮颜色」,Fable 回答「没问题,我刚刚启动了 100 个 Agent 的舰队来帮你搞定。」其二是他对 Model Context Protocol(MCP)的看法——这一协议正在成为 AI Agent 与外部工具交互的标准层。 原推 →
Linear 产品负责人发表了两个引发讨论的观点。其一:「吹嘘自己同时跑 10 个 Claude Code 标签页——这纯属表演。」其二更深刻:「用『即时战略游戏』模型来管理 AI Agent 明显是死胡同。以当前标准来看已经古老的 AI 就能打败 99% 以上的人类玩家,微操能力远超人类。」这暗示着未来的 Agent 管理需要全新的范式,而非简单复制人类的管理界面。 原推 →
FPV Ventures 合伙人分享了对 VC 会议效率的反思:「我还在等那个创始人——在跟我 Zoom 之前,要求我先玩过他们的产品并带来至少两条反馈。我无法理解为什么人们一整天都在 Zoom 上对着背熟的 Deck 聊 30 分钟。如果先做个产品头脑风暴,或者就纯粹花时间互相了解,效率都会高得多。」他开玩笑说,「不如两边都把『个人 Prompt』上传给 Claude 来数字化这个过程。」 原推 →
Anthropic 哲学家兼伦理学家分享了一条引发广泛共鸣的观察:「从医生那里榨出一个概率值是人生中最无必要的 Boss 战。就算你乞求一个区间主观概率——到那个地步你基本就是在求他们的直觉了。我不知道他们是不是因为提供信息会被起诉。」这条推文获得了 1382 次点赞和 131 条回复,反映了公众对医疗信息沟通的普遍困扰。 原推 →