Box CEO:不确定这些具体数字能否泛化到所有任务,但方向上很清楚——harness 编排将取代模型能力,成为 AI 栈中最重要的变量之一。当任务消耗几千万甚至几亿 token 时,如何最有效地拆解工作、在正确时机路由到正确模型,将成为最大化准确率与降低成本的关键。我们仍处在这条路的极早期:当任务只有几十万 token 时 harness 无关紧要,现在机会来了。 原推 →
Box CEO Aaron Levie 今天给出了一个值得记住的判断:随着单任务 token 消耗从百万级走向千万甚至亿级,AI 栈中最重要的变量正在从「模型能力」扩散到「harness 编排」。谁能最有效地拆解工作、在正确的时间路由到正确的模型,谁就能同时最大化准确率与降低成本——而这条赛道才刚刚开始。几乎同一时间,Vercel CEO Guillermo Rauch 宣布 AI Gateway 增加按 key/team/project 的预算管控,并预言 Issue → Agent → PR → Release 将成为软件项目转向「agentic software factory」后的常态;Linear 产品负责人 Nan Yu 则分享了自家循环的实操细节:约 30% 的 bug 会走完全程,但 agent 必须被明确告知「先研究根因、拿不准就别乱改」,否则会烧掉大量 token。
模型侧的反差同样明显:Replit CEO Amjad Masad 展示了一个约 80 亿参数的下棋模型,Elo 约 1500,稳定击败 GPT-5.6 高推理模式与 Stockfish 0 级,且每步只花 1-2 秒(对比 30 秒)——小模型在垂直任务上「四两拨千斤」的故事越来越常见。而 Sam Altman 则晒出 ChatGPT Work 的家庭场景:连接家庭日历、解释孩子的兴趣,每天早上上学路上自动生成一期播客,聊聊下午的球赛、临近的生日和新闻。OpenAI 一边在场景端下沉到日常生活,一边由 Codex 负责人 Thibault Sottiaux 重置了本周末的用量上限,庆祝「一周的效率」。
播客这边,Unsupervised Learning 请到 xAI 联创、如今创办 River AI 的 Igor Babuschkin。他直言闭源模型厂商正被「两头挤压」:预训练收益递减、能力太强可能被监管拦下不让发布,而开源模型每个月都在逼近前沿——出路只剩持续创新。他给 River AI 下了三个赌注:让企业自己做后训练(River API)、为每个个体而非「平均用户」定制 AI,以及把前沿推理带到本地硬件上。对个人 AI 时代的隐私与可控性,他说了一句值得玩味的话:未来你的 agent 会知道你房间里的每一句话,「把这一切都发给数据中心」不该是唯一选项。
The Takeaway:闭源模型厂商正被「能力太强不能发布、开源步步紧逼」两头挤压,出路是把模型能力分发出去——让企业、团队乃至个人自己做后训练,把智能带回本地。
Igor Babuschkin 是少有的「全经历」选手:从 CERN 的物理学博士,到 DeepMind 的 StarCraft 与 AlphaCode,再到 OpenAI 早期推理团队,随后联创 xAI、120 天建成 Colossus 数据中心,现在创办 River AI。他在播客里先讲了自己被「十二月时刻」击中的感受:2025 年底编码 agent 突然强大到无法忽视,就像《魔术师学徒》——每个人都成了开始使用魔法、却未必控制得住魔法的学徒。
他对当前市场结构的判断很尖锐:闭源厂商正被两头挤压。预训练收益递减,把模型做得太强可能因监管无法发布,而开源模型每月逼近前沿;同时后训练要「把全世界专家装进一组权重」也遇到瓶颈。出路在他看来是「去中心化」:让掌握领域数据的企业自己后训练,而不是把数据交给 Anthropic 或 OpenAI。River AI 的三条赌注正是为此——River API 提供强化学习与微调服务、让模型为每个个体而非「平均用户」个性化、以及把推理计算带到本地设备。最后一条他特别强调:个人 AI 会读取你的一切,隐私与「模型是你的而不是别人的」将变得至关重要。
他还谈到对开源生态的看法:强大开源模型降低了所有人的门槛,但今天最前沿的开源权重几乎全部来自中国实验室,这对美国经济不是好事——「我们应该训练出全世界最好的开源模型,而不只是最好的美国开源模型」。关于模型中的后门风险,他目前不太担心(「如果存在,我们应该已经在野外看到过例子了」),但提醒这是未来几年需要盯防的领域。最后他留下一句浪漫的注脚:写《The Prader Machine God》时,那句「当模型第一次开口说话时,你没想到自己会流泪」——来自真实经历,那是所有早期 AI 人都体会过的魔法感。
关于「机器会取代人吗」,他的答案是「共生」:今天人类做架构与规划、agent 写代码,这是好状态;但随着 agent 变强,天平会倾向让它们接管一切。保持人类相关的关键是更深的对齐——「把模型训练成最大化人类繁荣,而不是最大化任何其他目标」。
收听原片 ↗Box CEO:不确定这些具体数字能否泛化到所有任务,但方向上很清楚——harness 编排将取代模型能力,成为 AI 栈中最重要的变量之一。当任务消耗几千万甚至几亿 token 时,如何最有效地拆解工作、在正确时机路由到正确模型,将成为最大化准确率与降低成本的关键。我们仍处在这条路的极早期:当任务只有几十万 token 时 harness 无关紧要,现在机会来了。 原推 →
Replit CEO:约 1500 Elo!一个 8B 模型持续击败前沿模型和 Stockfish 0 级。看着一个 80 亿参数模型靠高推理与响应链「碾压」GPT-5.6 很有趣,它每步只思考 1-2 秒,而对手要 30 秒。可以玩。 原推 →
Linear 产品负责人:Linear 里最常见的循环是 Issue → Agent → PR → Release,约 30% 的 bug 能走完全程。但细节决定成败:指令应让 agent 先用 Datadog 和 Sentry MCP 深入调研根因,只有高确定性才尝试修复,否则会烧掉大量 token;如果调研时需要更多证据(比如让 reporter 提供复现步骤),就留在 issue 评论里请求。Agent 和人类一样,需要被明确告知好的实践。 原推 →
Vercel CEO:AI Gateway 是让 AI 成为有效投资的关键基础设施:按 key/team/project 的预算管控、故障切换保障可用性、模型与供应商选择、实时可观测性。如果你还沉浸在「token 最大化」的狂热梦里,是时候醒来了。另外,Issue → Agent → PR → Release 将成为软件项目转向 agentic software factory 后的常态,作者/维护者的工作变为优化这个循环并设定「该做什么」的标准。 原推 →
OpenAI CEO:昨晚听到一个 ChatGPT Work 的酷用例——连接家庭日历、解释孩子们的兴趣,每天早上开车上学路上让 AI 生成一期播客,聊聊下午的足球赛、临近的生日和一些新闻。另外,我看到了你的摩尔定律,我加注 20 倍。 原推 →
Swyx:在 AI 圈领袖里我似乎是少数派——我仍然活跃地使用 /loop 和 /goal。觉得这些过时的你们都错了,不是永远错,只是在 G5.6/C5 时代放弃得太早。当你想在可控性与自主性之间找到正确配比、想要「能生成循环的循环」那种开放式终态时,就该用它们。另外注意到:「vibe coding」的贬义色彩已经完全消失了——从非技术到超技术,人人都在这么做。 原推 →
Zara Zhang:一篇关于 Claude 如何改变 Anthropic 内部工作方式的访谈很有意思——产品与工程团队 65% 的 PR 现在由 Claude 提出。对非工程团队而言,agent 的终极界面应该是他们本来就在工作的地方(Slack 等协作工具)。过去 6 个月我自己与 agent 的接口变了三次:1 月是终端,3 月是桌面应用(如 Codex),6 月是我的协作工具——每一步都更接近人类自然的交流方式,agent 应该主动来到用户所在的地方。 原推 →
Every CEO:很高兴给这篇 WSJ 关于 OpenAI vs Anthropic 的文章当 kicker。我坚持这个判断——从早春开始势头就明显转向 OpenAI,这是一个迷人的逆袭故事。另外想象 2027 年的人类程序员面试:请描述你解决的最近 3 个未解数学猜想并附上 prompts;请描述你的 agent 无意犯下的最近一次网络重罪及你的补救措施;请告诉我们 strawberry 里有几个 R、seventeen 里有几个 e。 原推 →
Claude Blog 宣布 Claude Code 现在可以把工作进度固化为 artifact——把你的会话成果变成实时、可分享的可视化页面:PR 走查、系统讲解、仪表盘、发布清单,会随着会话推进自动更新。
一个 artifact 会用上会话的完整上下文:代码库、已连接的 monitoring 工具、对话本身。比如一次事故复盘页面,可以把失败的测试与背后的函数、来自监控工具的错误峰值、以及会话中的根因推理整合到同一页。不需要接线数据源或搭建基础设施——「你提出要一个页面,Claude Code 就从已有的东西里把它构建出来」。
更新时页面原地刷新,团队能立刻看到;每个发布都是同一链接的新版本,带版本历史可随时回滚,还有画廊管理所有 artifacts。官方内部测试里最常见的用例是调试。对团队协作而言,这相当于把「同步状态」的成本从沟通中剥离,让人更专注构建本身。
链接:https://claude.com/blog/artifacts-in-claude-code
阅读原文 ↗