Vol.1852026年7月5日 · 星期日
AI 日报Builders Digest
Fable 5 掀起假日黑客狂潮,Agent 自改进成新标配,NVIDIA 开源战略深度解读
今日主线

Fable 5 乘着独立日长周末掀起构建热潮,Agent 基础设施迎来「自改进」范式,Aaron Levie 提出「AI 之争本质是上下文之争」

独立日长周末成了 AI 社区的一场盛大黑客松。Anthropic 的 Thariq 发布了一篇关于「如何与 Fable 合作中发现自己的未知领域」的深度文章,获得了 3400+ 赞和 260 次转发,成为当日最具影响力的技术分享。他分享的核心方法论是:用 HTML Artifacts 来显式化自己的知识盲区,而不是在提示词里大海捞针。Claude Code 团队成员 Cat Wu 则号召社区展示 Fable 5 作品——她的推文收获了 253 条回复,成为了一个即兴 Demo Day。Dan Shipper 顺势发布了 Fable 5 的 prompt 库,并打趣道:「Fable 在你泡泳池时替你工作——无价。」与此同时,Dan 也澄清了社区对 Fable 5 基准测试的争议:模型本身没有变化,但更多地回退到了 Opus 4.8,导致测试评分是「混合模式」而非纯 Fable 能力。

Agent 基础设施层面的讨论同样深刻。Vercel CEO Guillermo Rauch 提出了一个引人注目的概念:Agent 的自改进能力。他认为,Agent 应该能够「内省自己的过往运行,发现低效、错误和冗余的工具调用,然后生成新的 prompts 和 skills」。他宣布这一能力已内置在 Vercel AI Gateway 的部署流程中。Box CEO Aaron Levie 则发表了一篇长线程,系统阐述了他的核心论点:「AI 之争正在演变为上下文之争。」他论证道,Agent 的有效性取决于它是否拥有正确的领域知识、是否能访问合适的上下文和工具、以及是否能深度融入用户的工作流。因此,能够捕获和利用最佳上下文的平台将成为 Agent 完成最佳工作的场所。他还预见了「应用层」的核心价值:在规划编排层使用前沿模型,在大量中间任务中使用低成本模型(开源或闭源),以及在垂直领域训练专用模型——「永远不要跟 bitter lesson 对赌,但在特定领域对接近前沿的基座模型做 post-training,往往能降低成本或提升性能。」

此外,VC Nikunj Kothari 观察到一个有趣规律:「AI 实验室似乎在长周末前偷偷发布模型——Opus 4.5 在感恩节前,Fable 5 在独立日前,给大众留出时间玩弄、震撼、并加深 token 焦虑。」Y Combinator 总裁 Garry Tan 则将目光投向医疗领域:「专科医生的候诊时间在 AI 即将改变一切的时刻不断攀升——我预感 AI 将把护理质量提升 100 倍,对各地患者而言刻不容缓。」Peter Steinberger 则展示了一种与 AI 相处的幽默方式:他把自己的 80000 条推文喂给了 Fable,让它更精准地吐槽自己。Zara Zhang 则从一个创业者角度提出了关于 AI 工具变现的深刻观察:「人们越来越不愿意买工具了——如果它只是个工具,他们觉得自己能用 coding agent 自己造。但他们愿意付钱购买的是'获得自己不具备的专业知识的感觉'。」

本期播客

The MAD Podcast:NVIDIA 为何免费开放 AI 模型 —— 与 Bryan Catanzaro 的深度对话

YouTube · The MAD Podcast with Matt Turck

NVIDIA 应用深度学习研究副总裁 Bryan Catanzaro 与 FirstMark 合伙人 Matt Turck 展开了一场关于开源 AI 战略的深入对话。Catanzaro 领导着 NVIDIA 的 Nemotron 系列开源基础模型团队——这支数百人的研究团队刚刚发布 Nemotron 3 Ultra,该模型在上线后立即成为美国排名第一的开源权重模型。

Catanzaro 的核心逻辑令人深思:「如果你接受我们一直运行在算力极限这个前提,那么获得更多智能的途径就是提升效率——我们已经无法通过施加更多算力来获得更多智能,必须更聪明地使用我们已有的资源。」他将 AI 比喻为人类正在创造的外部器官——正如厨房是我们的外部胃,我们现在正在创造外部大脑。这一哲学直接解释了 NVIDIA 为何将最前沿的模型免费开放:通过让整个生态在 Nemotron 之上构建,NVIDIA 实际上是在为自己的 GPU 平台创造更大的需求飞轮。对话还深入探讨了四位训练、混合 Mamba-Transformer 架构、MoE、多 token 预测和多教师蒸馏等技术细节——全部用通俗语言解释。

收听原片 ↗
建造者观点
Thariq @trq212

我发现与 Fable 合作中最重要的部分,是发现自己的「未知的未知」,这样才能更好地向它提问。关键方法是:用 HTML Artifacts 将你的知识盲区显式化——把探索过程可视化,看看自己遗漏了什么,而不是在提示词里大海捞针。这一方法基于我在 AIE 的演讲,在与 Geoffrey Litt 的讨论中得到了进一步精炼,包括加入了「测验」环节来自检理解。 原推 →

Cat Wu @_catwu

小技巧:你可以用 Claude Code 的计算机使用功能来设置 Claude Tag——只需要把它指向 Claude Tag 文档,它就会自动帮你连接团队的 GitHub 仓库、数据仓库、Google Drive 和其他数据源。另外,这个长周末大家用 Fable 5 在构建什么?在回复里展示你的 Demo! 原推 →

Guillermo Rauch @rauchg

Agent 的自改进能力:让你的 Agent 能够内省自己的过往运行,发现低效、错误和冗余的工具调用,然后生成新的提示词和技能。这就是为什么 Agent 可观测性已内置在 Vercel AI Gateway 的部署流程中——当你把 Agent 部署到 Vercel 时,这一切开箱即用。 原推 →

Aaron Levie @levie

AI 之争正在演变为上下文之争。Agent 的有效性取决于三件事:是否拥有正确的领域知识、是否能够访问合适的上下文和工具、以及是否能深度融入用户的工作流。因此,能够捕获和利用最佳上下文的平台将成为 Agent 完成最佳工作的场所。应用层远不止是 LLM 包装器——它需要组织关键知识、治理访问权限、并持续改进上下文。在架构上,应用层将用前沿模型做规划和编排,用低成本模型处理大量中间任务,并在垂直领域做专用模型的 post-training。 原推 →

Dan Shipper @danshipper

Fable 5 到底有没有变弱?实际上模型本身没变——但它确实更多地回退到了 Opus 4.8,所以你在基准测试中看到的是 Fable 和 Opus 的混合评分,不是纯 Fable 能力。另外,一个全新 iOS 应用端到端:500 万 token;清空整个产品待修复 Bug 列表:2000 万 token;Fable 在你在泳池边时替你工作:无价。 原推 →

Peter Steinberger @steipete

我把自己的 80000 条推文喂给了 Fable,这样它就能更狠地吐槽我了。另外,如果你觉得 Codex 做设计不行,试试「用 imagegen 重新构想这个设计,然后实现它」——效果出奇地好。 原推 →

Zara Zhang @zarazhangrui

人们越来越不愿意买工具了——如果它只是个工具,他们觉得自己能用 coding agent 自己造。但他们愿意为之付钱的是「获得自己不具备的专业知识的感觉」。高频发推文其实没想象中那么难,一旦跨过第一个坎,它就不再是一种任务,而变成一种镜头——你开始通过它来看待你的每一天和这个世界。 原推 →

Nikunj Kothari @nikunj

AI 实验室似乎在长周末前偷偷发布模型——Opus 4.5 在感恩节前,Fable 5 在独立日前,给大众留出时间玩弄、震撼、并加深 token 焦虑。另外,尽管我经常批评 Gemini 的产品体验,但它仍然是唯一一个用单个 API Key 就能「全搞定」的平台:Flash 做快速廉价长上下文结构化任务、Nano Banana 做世界级图像生成、带 Grounding 的搜索、Realtime 实时音频等等。 原推 →