Vol.1992026年7月18日 · 星期六
AI 日报Builders Digest
Kimi K3 开放模型首次登顶 Web 工程基准超越所有闭源模型;NotebookLM 正式更名为 Gemini Notebook 用户破 3000 万;Anthropic 深度拆解如何控制 Agent 爆炸半径
今日主线

开放模型里程碑:Kimi K3 首次在 Web 工程基准超越所有闭源模型;Google NotebookLM 更名 Gemini Notebook

Moonshot 的 Kimi K3 在 v0 Web 工程基准测试中登顶,超越 Fable 等所有闭源模型——这是开放模型首次在该综合评测中领先。Vercel CEO Guillermo Rauch 率先公布结果:Kimi K3 以更少的时间达到更高的成功率,峰值 92%(96% 带辅助),目前尚无模型达到 100%。Rauch 同时提醒「基准不等于全貌,但这为开放模型突破的证据再加一枚砝码」。Box CEO Aaron Levie 评论称「开放模型达到这种性能水平令人震惊,每次前沿智能成本下降,企业可部署的用例就会大幅增加」。前 Dropbox CTO Aditya Agarwal 更是直接行动:「我正在把系统从 Fable 迁移出来——如果有好的免费替代品,为什么要付高价?」

Google VP Josh Woodward 宣布 NotebookLM 正式更名为 Gemini Notebook。这个从 Project Tailwind 实验项目成长起来的产品,如今已拥有超过 3000 万用户和 60 万组织。「我还记得那个房间,看着 Steven Johnson 拆解他如何写书,那就是这个小项目的火花。」Woodward 写道。Google Labs 转发庆祝:「谁还记得 Project Tailwind 只是一个小小的 Labs 实验?」这次更名标志着 Google AI 产品线的进一步整合。

OpenAI ChatGPT 桌面端负责人 Thibault Sottiaux 宣布三项重要更新:ChatGPT 对话历史和项目现在可在侧边栏查看;Chat 和 Work 模式现在在桌面端可轻松切换,且与 Web 和移动端保持一致;聊天和工作历史现在跨 Web、移动端和桌面端同步(本地任务仍保留在本机)。Codex 模式不变。同时他还发布了一段 Codex 桌面端的性能演示视频,获得 700+ 赞。

本期播客

顶级 AI 分析师拆解当下 AI 炒作周期

Unsupervised Learning by Redpoint · YouTube · 2026-07-16

Redpoint 合伙人 Jacob Efron 采访了科技分析师 Benedict Evans,深入讨论了 AI 价值将在哪里积累、基础模型的最终估值可能是什么样子、为什么消费级 AI 应用目前还不太奏效,以及能力的参差不齐对企业采用的影响。

Evans 对 AI 取代就业的论述提出了犀利反驳:「Geoff Hinton 十年前就说停止培养放射科医生了——问题是他根本不了解放射科医生实际做什么。」他将 AI 比作电力:「你可以挥挥手说这就像电力。好吧,那电力时代之前的人也不笨。」关于基础模型公司的估值,Evans 表达了对 Sam Altman 的同情,暗示估值叙事比表面看起来更复杂。

核心洞察是:AI 的「参差能力边界」——某些任务上表现惊人,另一些任务上完全失败——才是理解企业采用节奏的关键。消费级 AI 应用之所以还没有真正跑通,正是因为这条边界还不够平滑。

收听原片 ↗
建造者观点
Guillermo Rauch @rauchg

Vercel CEO 公布重大基准结果:「Kimi K3 在 v0 Web 工程基准上排名第一,超越 Fable,以更少时间达到可比成功率。这是开放模型首次在该综合 Web 工程评测中领先所有闭源模型。」目前最高表现者峰值 92%,尚无模型达到 100%。Rauch 同时透露 Vercel 迎来了两位传奇开发者工具人才:React 先驱 Pete Hunt 将领导 Next.js,GraphQL 联合发明者 Nick Schrock 将负责 Agentic 开发者体验。 原推 →

Aaron Levie @levie

Box CEO 对 Kimi K3 的评论:「开放模型达到这种性能水平真的令人震惊。每次前沿智能成本下降,企业可部署的用例就会大幅增加。对创业生态来说,开放和闭源实验室的突破使得大量价值积累到应用层——这一层可以利用多种模型为客户完成完整任务。」Levie 还展示了 Box 与 Databricks 的新集成:从企业非结构化内容中提取结构化数据,无需移动或重新处理内容。 原推 →

Sam Altman @sama

OpenAI CEO 坦诚反思:「我们过去 12 个月不是最好的,这主要是我的错,但我们即将迎来最好的 12 个月。团队正在做惊人的工作。」他强调 AI 必须赋予更多人自由、能动性和财富,「我们想做正确的事,但我们不想吓唬人们来跟随我们。」此外他透露自己已经更多地用语音而非打字与 ChatGPT 交流:「新语音模型真的跨过了一个门槛。」 原推 →

Madhu Guru @realmadhuguru

Meta AI 高级总监分享企业 AI 架构思考:「Kimi 和 GLM 等开放权重模型将导致企业 AI 技术栈的彻底重新思考。」他给出三个关键建议:一、构建严格的评估体系(回归测试 + 攀爬式评估);二、建立模型路由机制,在质量/成本/延迟间做取舍;三、构建模型无关的 harness,标准化 prompt 结构、上下文管理和输出解析。「评估速度就是竞争优势。」 原推 →

Thibault Sottiaux @thsottiaux

OpenAI Codex 和 ChatGPT 桌面端负责人宣布三项更新:对话历史和项目现在在侧边栏可见且跨平台同步;Chat 和 Work 模式可在桌面端轻松切换;Codex 模式不变。他还发布了 Codex 桌面端性能演示,展示其处理复杂任务的速度。一条推文用「Look at this beauty」配 Codex 运行视频,获 703 赞。 原推 →

Boris Cherny @bcherny

Claude Code 核心工程师详解 Anthropic Agent 自动化的四个阶段:从手动审批到自动模式,再到后台修复维护。Anthropic 目前处于第 3 阶段,正向第 4 阶段推进。关键实践包括:启用 auto mode 权限、自动化代码审查和安全审查、使用多 Agent 管理界面、以及 /loop、/batch、动态工作流和 worktree 隔离。「回报最大的时刻是修复和维护在后台运行,你的团队可以专注于构建——那时你开始做之前根本不在射程内的事。」 原推 →

Aditya Agarwal @adityaag

前 Dropbox CTO、South Park Commons 合伙人直言不讳:「我正在把系统从 Fable 迁移到 Kimi K3。这不是夸张——如果有好的免费替代品,为什么要付高价?」他还分享了一个关于创业的洞察:「很多人以为越成功,被拒绝的次数越少。但如果你在野心的边缘运作,高风险下你会被频繁拒绝。我今天被拒绝了 5 次。」 原推 →

Amjad Masad @amasad

Replit CEO 分享了一个有趣的发现:「蒸馏模型竟然能超越教师模型。」他还在构建一个国际象棋引擎,在 200 万个 Stockfish 标注位置上微调,然后进行短 GRPO 强化学习,「它在国际象棋上的表现似乎已经超越了前沿模型。」他还对 NVIDIA 股价在 Kimi K3 消息后反而下跌表示困惑。 原推 →

官方博客

Anthropic Engineering:我们如何在产品中控制 Claude 的爆炸半径

Anthropic Engineering Blog · 2026-07-18

Anthropic 发布了一篇深度工程博文,详细解释如何在赋予 Claude 足够权限的同时控制其「爆炸半径」。文章开篇即承认:「十二个月前,我们会断然拒绝给予 Claude 足以搞垮内部服务的权限。如今这种权限级别已是常态,Anthropic 开发者因此更加高效。」

核心机制是分层防护。首先是对 Agent 行为的监督:Claude Code 此前通过逐轮审批来保护用户,但遥测数据显示约 93% 的审批都被批准——用户看到的审批越多,对每一条的关注就越少。因此团队构建了 Claude Code auto mode,自动批准较安全的操作以减少审批疲劳。其次是环境控制:当可以对自主 Agent 的相对损害设定边界时(如通过控制其环境),高实用性能力就可以安全部署。文章还提到 Claude Mythos Preview 在 2026 年 4 月因爆炸半径被认为过高而未发布,但随着防御系统加固和安全措施成熟,类似能力的模型有望更广泛推出。

这篇文章为整个行业提供了 Agent 安全架构的重要参考:关键不在于限制 Agent 的能力,而在于设计机制来封堵失败时的影响范围。

阅读原文 ↗