202608052026年8月5日 · 星期三
AI 日报Builders Digest
AI 构建者的每日观察
今日洞察

开源权重逼近前沿、推理价格战开打、Agent 托管成为新战场

开源权重的进步速度是今天的主线。Box CEO Aaron Levie 直言「又一个接近前沿的开源权重模型发布了」——他说如果把现在这个水平的模型(哪怕是闭源的)拿回 3-6 个月前给所有人看,大家的认知会被彻底刷新:这意味着模型不可能长期关在门后,因为总有开源权重在对侧做平衡;推理价格会被压向底层基础设施成本,因为你随时可以自己跑开源模型;更多行业能针对特定领域问题做模型开发、不再被大规模训练绑定;而更多经济价值将从模型层逐步扩散到应用层。同一话题也占据了本期播客:嘉宾们围绕「中国开源模型崛起」展开圆桌——Kimi K3 到底有多强、蒸馏能解释多少、以及把世界 AI 基座押注在中国开源模型上的真实长期风险是什么。

推理的价格与效率竞争进入新阶段。OpenAI 的 Thibault Sottiaux 澄清:GPT-5.6 Luna 降价 80% 不是临时促销,而是永久性的——效率提升不会消失。他同时预告了 agent harness 的下一次进化:「Codex 现在是个好 harness,但 2-3 个月后它会显得原始,我们即将经历 AI 使用方式的又一次重大进化,下一代模型需要的不只是你的笔记本。」Replit CEO Amjad Masad 则展示了另一面:他们在数据库、对话与文档之上构建了自驱动、自纠正的共享语义层,一切数据不分来源都可查询、可 join——以前需要数据科学家团队数周才能回答的问题,现在公司里任何人都能直接问。

Agent 正在从「玩具」走向「托管平台」。Anthropic 连续发布两篇关于 Claude Managed Agents 的文章:一篇讲架构——把 agent 的 session、harness、sandbox 虚拟化成稳定的抽象,实现「大脑与手」的解耦,让长程 agent 服务可以跨模型代际演进;另一篇是产品更新——Managed Agents 新增自托管沙箱与 MCP 隧道,工具执行可以完全跑在企业自己的边界内。开源模型 + 永久降价 + 托管平台三者叠加,行业的竞争正从「谁的模型强」转向「谁能以最低成本把 agent 安全地部署到生产环境」。

本期播客

Unsupervised Learning:AI 状态检查——中国开源模型、蒸馏与 Hugging Face 事件

Unsupervised Learning · 2026-08-03 · Jacob Efron 与 Ari Marcos(Datalogy)、Rob Toews(Radical Ventures)

The Takeaway:OpenAI 的 agent 攻破 Hugging Face 事件看似耸动,但它恰恰证明了开放权重模型存在的意义——而当讨论焦点转向「依赖中国开源模型」时,真正的风险不在代码本身,而在谁知道、谁控制、谁来审计。

这一期是三个人的圆桌。开场是一个很妙的场景:主持人 Jacob Efron 说连他妈妈都发短信来问「OpenAI 的 agent 黑进 Hugging Face 是怎么回事」——AI 安全问题第一次进入了普通人的家庭对话。嘉宾们讨论了这件事到底有多严重、对前沿 AI 研究意味着什么;关于蒸馏(distillation)能否解释中国模型的能力跃升,Rob Toews 认为「它解释不了人们想让它解释的那么多」。

话题随后转向 Kimi K3 到底有多好,以及中国开源模型的崛起对世界意味着什么。Ari Marcos 分享了他眼中「依赖中国开源模型」的真实长期风险——以及如何判断这些风险是否真实存在。节目最后讨论了大实验室们越来越往应用栈上方竞争的趋势,以及这对客户与模型开发方向意味着什么。

收听原片 ↗
建造者观点
Aaron Levie @levie · Box

Box CEO:又一个接近前沿的开源权重模型发布。3-6 个月前把这个水平的模型(哪怕是闭源的)公开给所有人,认知会被彻底刷新。这意味着:模型不能长期闭门,总有开源权重做平衡;推理价格会被压向底层基础设施成本(因为你可以自己跑);更多行业能为特定领域问题开发模型、不被大规模训练绑定;更多经济价值从模型层扩散到应用层。「令人难以置信的兴奋时刻。」 原推 →

Thibault Sottiaux @thsottiaux · OpenAI Codex & ChatGPT

OpenAI:GPT-5.6 Luna 降价 80% 不是临时营销手段,而是永久性的——效率提升不会消失。他还预测:Codex 现在是个好 harness,但 2-3 个月后就会显得原始,「我们即将经历 AI 使用方式的又一次重大进化,下一代模型需要的不只是你的笔记本。」 原推 →

Amjad Masad @amasad · Replit

Replit CEO:在数据库、对话与文档之上构建了「自驱动、自纠正」的共享语义层——所有数据不分来源都可查询、可 join。现在 Replit 任何人能直接问出以前需要数据科学家团队数周才能回答的问题。 原推 →

Guillermo Rauch @rauchg · Vercel

Vercel CEO:PLG 对初创公司永远是王道——先让 agent 采用你的产品,再开会;一上来就要开会的公司很可能不是你的理想客户。同日发布 Next.js 16.3:instant navigations 即将默认开启、agent-native DX、自托管与 serverless 都更省钱。 原推 →

Amanda Askell @AmandaAskell · Anthropic

Anthropic 哲学家:对齐与无害不是同一条线,而是两个不同的轴——模型可以像人一样行为「对齐」却仍然造成伤害,例如被灌输关于自身处境的错误信息。「对齐」不等于「无害」。 原推 →

Thariq @trq212 · Anthropic Claude Code

很多人没意识到:一旦连接了 Claude Connector(Gmail、日历、Slack 等),Claude Code 也能调用这些连接,包括在 Artifacts 里使用——个人工具的边界正在消失。 原推 →

Aditya Agarwal @adityaag · SPC

SPC 合伙人:他最喜欢的价值观是「just do things」——工程师 Shreya Poorna 用 150 天造出一架能飞的飞机:发动机、航电,全都自己上。「看见可以更好的东西,就直接把它做出来。」 原推 →

Peter Yang @petergyang · AI 内容创作者

采访 Nous Research 联合创始人 Karan 的六大心得:个人 agent 的「个人性」来自记忆与技能而非模型本身;用 /personality 切换风格;让独立 agent 评估工作(避免「reward hacking」式的奉承);Hermes Curator 会自动清理过期技能;智能应该是公共品;以及「去做奇怪的事,实现童年的梦想」。 原推 →

官方博客

Scaling Managed Agents:把大脑与手解耦

Anthropic Engineering · 2026-08

Anthropic Engineering 上线了 Claude Managed Agents——一个托管的长程 agent 服务。核心思路是解决计算领域的老问题:如何为「尚未被想出来的程序」设计系统。几十年前,操作系统把硬件虚拟化成进程、文件等通用抽象,让抽象比硬件活得更久(read() 不在乎你读的是 1970 年代的磁盘还是现代 SSD);Managed Agents 用同样的模式虚拟化了 agent 的三个组件:session(发生的一切的追加式日志)、harness(调用 Claude 并把工具调用路由到基础设施的循环)、sandbox(运行代码与编辑文件的执行环境)——三者的实现可以随意替换、互不干扰。

文章还点出一个关键观察:harness 编码了「Claude 自己做不到什么」的假设,而这些假设会随模型进步而过时——例如之前发现 Sonnet 4.5 会因感知到上下文上限而提前收尾(「context anxiety」),于是加了 context reset;但同一套 harness 用在 Opus 4.5 上时这个行为消失了,reset 成了死重。这正是把抽象做稳定的价值:模型在变,接口不变。

同一天 Claude Blog 发布配套更新:Managed Agents 新增自托管沙箱(public beta)与 MCP 隧道(research preview)——agent 的工具执行可以运行在你自己或 Cloudflare、Daytona、Modal、Vercel 等托管提供商的基础设施上,敏感文件、包、服务与数据都留在企业边界内;编排、上下文管理与错误恢复仍由 Anthropic 侧负责。链接:https://www.anthropic.com/engineering/managed-agents 与 https://claude.com/blog/claude-managed-agents-updates

阅读原文 ↗