202608242026年8月24日 · 星期一
AI 日报Builders Digest
能力过剩:模型跑赢产品 · Agent 网络元年 · 评测成为扩散瓶颈
今日主线

能力过剩时代:Agent 网络元年,评测卡住了扩散

微软 CTO Kevin Scott 在 AI & I 播客里给出了今年最清晰的一张路线图:去年的主题还是 scaling laws,今年他反复讲一个词——capability overhang(能力过剩)。模型的推理能力已经跑到了产品前面,行业真正的功课是弥合「模型能做什么」与「用户用到了什么」之间的落差。而他眼中承接这股能力的下一层基建,是 agentic web:MCP 之于 Agent 网络,正如 HTTP 之于互联网,NL Web 则扮演 HTML 的角色;微软内部甚至要求所有系统对自家 Agent 讲同一种标准协议,免得「把组织架构图发出去」。

另一边,评测(evals)正在被推上瓶颈之位。Aaron Levie 直言:AI 的扩散受「没有好的评测」的限制远超多数人的认知——每个模型发布时的评测只描绘了通用能力的轮廓,真正巨大的空间是企业级工作流的评测,细到单个公司自己的流程。Madhu Guru 的「如何构建好评测」系列第六篇给出方法论:在评测上爬山,就是选定一个真正重要的维度(质量、用例扩展、成本、延迟)持续优化。

生态侧也在快速调整:OpenAI 的 Thibault 罕见地公开 Codex 限速的「内部账本」——长会话多轮压缩下图片处理的低效、Computer History 功能的高 p95 用量、一个「本应只生成对话标题」的功能耗量超标,tiger team 彻查、次日即修;Zara Zhang 则观察到一股人才暗流:同样的人,用 AI 独立做事能放大 10 倍潜力,进了大组织最多只多 20%——越来越多高手正在离开大公司。

本期播客

微软 CTO Kevin Scott:为 Agent 而生的互联网

AI & I by Every | Kevin Scott(Microsoft CTO)| 8 月 13 日

Kevin Scott 在 Build 2026 keynote 后接受 Dan Shipper 采访(Best of the Pod 重播)。他给出的年度叙事是:scaling laws 不再是新闻,capability overhang 才是——模型推理能力已明显超过产品端的使用水平,行业要集体弥合这个落差。而让 Agent 真正有用的下一程是 agentic web:MCP 是它上面的 HTTP,NL Web 是 HTML;微软作为平台公司,自己写的 Agent 反而没那么重要,「帮整个生态解决 Agent 网络涌现出的问题」才重要。

他坦承当前 Agent 最大的工程短板是记忆:现在的 Agent 是「事务性」的,一次任务结束记忆就消散,下次从零开始,这限制了委派复杂任务。安全模型上,他押注 MCP 的「简洁」会让社区快速达成共识——Agent 需要身份与授权体系(entitlement),执行前向用户请求权限、向系统管理员报备;垂直整合与开放平台之争在他看来是伪二分:权限无关的创新价值巨大,而过去几年涌现的中间层「对真正重要交易的双方没贡献什么价值」。

关于软件工程的未来,编程 41 年、木工 40 年的他拿木工史类比:手工具 vs 电动工具 vs CNC 的争论每代人都上演,工具变迁从没消灭手艺,只是改变了它——「保持好奇,去试,适合你就用」。他预言一年内最明显的转变:与 Agent 的交互从同步问答走向异步委派——你丢给它一个「去把这件事办妥」,它花很久调用一堆系统、来回迭代,最后回来告诉你「进展到此,该你了」。

收听原片 ↗
建造者观点
Thibault Sottiaux @thsottiaux · Codex & ChatGPT @OpenAI

罕见的产品透明:Codex 限速的根因找到了——长会话多次压缩下图片处理存在低效、Computer History 功能的 p95 用量偏高,还有一个「本意只是生成对话标题」的功能耗量超标。tiger team 彻查中,修复明天上线。 原推 →

Aaron Levie @levie · ceo @box

「AI 的扩散受评测限制的程度远超多数人的想象。」模型发布时的评测只展示通用能力的轮廓,真正的空间在企业级工作流的评测——细到单个公司自己的流程,这会是应用型 AI 落地最大的杠杆。 原推 →

Madhu Guru @realmadhuguru · Sr Director, AI @Meta

「在评测上爬山,就是选定一个真正重要的维度并持续优化」——可以是基于生产数据提升高价值用户路径的质量、扩展到相邻用例,也可以是降成本降延迟。实际工作归结为更好的 harness 与更聪明的模型选择。 原推 →

Peter Yang @petergyang · AI 教程创作者

一份实用的隐私操作:打开 Chrome 的 Google 授权页,让 Codex 或 Claude Code 读标签页,挑出不再需要的第三方应用让 AI 一键断开——他借此清掉了半数本不该持有其 Google 信息的应用,并表扬 Instinct 团队快速上线了「删除外部数据」入口。 原推 →

Zara Zhang @zarazhangrui · Builder

一个正在重塑人才市场的现象:同样的人,用 AI 独立做自己的事能发挥 10 倍潜力,进了大组织最多只能提升 20%、有时甚至倒退。这就是越来越多优秀人才离开大公司的原因——顶级 AI 实验室或许是例外。 原推 →

Dan Shipper @danshipper · ceo @every

「agent native 就是王道。」他在转发中力挺 Ali Spittel 的观点,Agent 原生正在成为新一代产品的默认架构;Every 同步放出招聘,正在扩充团队。 原推 →

Amjad Masad @amasad · ceo @replit

「一周有 7 天,意味着 7 次发布。」Replit 的发布节奏已经卷到每天一次——持续 ship 本身就是产品文化,也是对 Agent 时代开发效率的直接表态。 原推 →

Nikunj Kothari @nikunj · partner @fpvventures

给年轻创始人的一记警钟:「用 ragebait 激怒投资人、然后甩出 SAFE 文件让对方直接打钱——这不是融资的方式。」他提醒年轻人,找对人听建议比什么都重要。 原推 →