Vol.1922026年7月11日 · 星期六
AI 日报Builders Digest
GPT-5.6 Sol 正式发布并重置用量限制;Google Gemini 公布用户反馈 Top 10 改进清单;模型混战周——Meta Spark、Grok 4.5、GLM 5.2 同台竞技
今日主线

OpenAI 发布 GPT-5.6 Sol 并重置全量限制;Google Gemini 向社区征集反馈并公布十大改进方向;多家模型密集发布,行业进入「多模型共存」新常态

本周 AI 行业最重磅的事件当属 OpenAI 正式发布 GPT-5.6 Sol。OpenAI Codex 与 ChatGPT 团队的 Thibault Sottiaux 宣布为庆祝 Sol 上线,将在 24 小时内两次重置 ChatGPT Work 和 Codex 的用量限制,鼓励用户「真正尝试有野心的任务」。这条推文获得超过 6,200 次点赞和 840 条回复。Sam Altman 随后发文表示「5.6 Sol 在每美元完成任务数上是一大步」,该帖收获 9,371 次点赞,是本周互动量最高的帖子之一。Box CEO Aaron Levie 则用企业级评测数据证明了 Sol 的实力:在金融(76% vs 71%)、医疗(58% vs 46%)、公共部门(74% vs 63%)和生命科学(60% vs 51%)等复杂任务上,Sol 全面超越 GPT-5.5,「在数字驱动真实决策的地方最为可靠」。

Google 副总裁 Josh Woodward 则展现了另一种领导力姿态——他公开征集用户反馈并在 12 小时内收到超过 1,400 条回复,随后发布了 Top 10 改进清单。排名第一的是「让 Google Workspace 集成更可靠」,紧随其后的是「更可靠的 tool calling」「项目与文件夹组织」「添加 MCP 和自定义 Skills」等。他还透露 Deep Research 将支持导出到 NotebookLM、Nano Banana 水印问题正在讨论中、聊天历史消息编辑功能即将上线。这种「公开路线图、快速响应」的做法在大厂高管中并不多见。

Vercel CEO Guillermo Rauch 指出本周是「模型发布周」,Meta Spark 1.1、Grok 4.5、GLM 5.2 将显著改变 token 市场份额格局。YC CEO Garry Tan 也确认 Meta Muse Spark 1.1(代号 Hornbill)在他的 OpenClaw 上表现「非常好」。Replit CEO Amjad Masad 则观察到一个有趣的趋势:「当 AI 让编码变得更灵活时,我们正在让运行时变得更严格——基础设施团队开始编写正式规范。你想要移动得越快,脚下的地基就必须越坚实。」多模型共存、差异化竞争正在成为企业 AI 的新常态。

本期播客

AI 先驱 Jürgen Schmidhuber 谈 AI 现状:资本开支过度、AGI 需要物理身体、递归自我改进不是护城河

Unsupervised Learning · YouTube

被《纽约时报》和《福布斯》称为「AI 之父」的 Jürgen Schmidhuber 在 Unsupervised Learning 播客中分享了多个反直觉的观点。他直言当前 AI 领域的资本开支「严重过度」——他对 AI 技术本身非常乐观,但对模型公司「深度悲观」。他认为递归自我改进不会成为任何公司的护城河,这一观点与当前许多 AI 公司的叙事形成鲜明对比。

在 AGI 话题上,Schmidhuber 提出了一个少有人讨论的硬件维度:「机器人硬件相比人体真的很差——没有任何人造技术能比得上这只手。」他明确表示「你不能只在屏幕后面实现 AGI」,认为真正的通用人工智能需要物理世界的交互能力。这一观点在当前以软件和语言模型为主流的 AGI 讨论中显得独树一帜。

主持人 Jacob 在总结中提到,Schmidhuber 还讨论了 AI 安全问题,但他的态度「明显不如该领域许多人那样担忧」。整期对话的核心信息是:AI 技术的潜力远未被释放,但当前行业的资本配置方式和竞争格局可能需要根本性的重新思考。

收听原片 ↗
建造者观点
Sam Altman @sama

OpenAI CEO 表示「5.6 Sol 在每美元完成任务数上是一大进步」,Terra 和 Luna 也同样如此。他还强调 Codex 是 OpenAI 新工作产品的核心,「Codex 哪儿也不会去」。此外,Altman 对 OpenAI 团队成员 Fidji 的健康问题表达了关心和祝福。三条推文合计获得超过 13,000 次点赞。 原推 →

Thibault Sottiaux @thsottiaux

OpenAI Codex 和 ChatGPT 团队成员宣布为庆祝 GPT-5.6 Sol 发布,将在 24 小时内两次重置 ChatGPT Work 和 Codex 的用量限制。他还透露新加入的 @_rajanagarwal 负责模型研究和编码能力提升。该帖获得 6,244 次点赞和 840 条回复,是本周讨论最热烈的帖子之一。 原推 →

Josh Woodward @joshwoodward

Google 副总裁在收到 1,400+ 条回复后发布了 Gemini 改进 Top 10 清单:① Google Workspace 集成更可靠(明确的第一需求)② 更可靠的 tool calling ③ 项目与文件夹组织 ④ 添加 MCP 和自定义 Skills ⑤ Deep Research 支持导出到 NotebookLM ⑥ 讨论移除 Nano Banana 水印 ⑦ 聊天历史消息编辑 ⑧ 改善语音听写准确率 ⑨ 修复移动端滚动 bug ⑩ 保持「名人肖像」限制不变。 原推 →

Aaron Levie @levie

Box CEO 用企业级评测数据展示了 GPT-5.6 Sol 的实力:在金融(76% vs 71%)、医疗(58% vs 46%)、公共部门(74% vs 63%)和生命科学(60% vs 51%)等复杂任务上全面超越 GPT-5.5。他还撰文分析了 AI 时代的竞争优势——当模型智能变得充裕时,「公司自身的数据、AI 与工作流的结合方式、以及员工与系统的交互」将成为差异化关键。 原推 →

Guillermo Rauch @rauchg

Vercel CEO 指出本周是「模型发布周」,预测 Meta Spark 1.1、Grok 4.5 和 GLM 5.2 将显著改变 token 市场份额。他认为「大多数 Agent 任务需要在快速推理下具备合理高的智能水平」,并预告开源模型即将变得「异常快速」。 原推 →

Amjad Masad @amasad

Replit CEO 观察到一个有趣的悖论:「当 AI 让编码变得更灵活时,我们正在让运行时变得更严格。我注意到基础设施团队开始编写正式规范——更确定性的系统、更有韧性的基础设施。你想要移动得越快,脚下的地基就必须越坚实。」他还指出 LLM 市场在过去 6 个月变得「异常活跃」,曾经被 VC 们认为将垄断的 Anthropic 现在面临激烈竞争。 原推 →

Nikunj Kothari @nikunj

FPV Ventures 合伙人用一段幽默的「向妻子解释本周模型发布」走红:「GPT-5.6 有三个版本——Sol 是聪明的那个,需要通过政府安全评估才能发布;Luna 是便宜的那个;Terra 存在着。Grok 4.5 故意在 GPT-5.6 前一天发布,这样它能有 24 小时的『前沿级』地位。Meituan 开源了 1.6 万亿参数的 LongCat-2.0——你的外卖平台现在是前沿实验室。而且这才周四。」 原推 →

Madhu Guru @realmadhuguru

前 Google Gemini/Veo 团队高管宣布加入 Meta 担任 AI 产品高级总监。他表示:「虽然 SWE Agent 已经改变了软件工程,但大多数其他复杂系统中的 Agent 仍处于早期阶段。大多数人还没有真正感受到 AI Agent 的全部力量。Meta 有能力改变这一点。是时候建造了。」 原推 →

官方博客

阅读原文 ↗