「2026 年是公司开始认真对待模型效率与可靠性的年份——模型正在成为关键基础设施。」他同时确认 ChatGPT 的用量重置已推送到所有账号,昨日反馈的问题也落地了修复,用户应能感到明显改善。从「炫能力」转向「保稳定、管成本」,OpenAI 正在进入基础设施运营者的节奏。 原推 →
评测正在成为建造者圈子的头号议题。Meta AI 高级总监 Madhu Guru 在「如何构建好的评测」系列第七篇提出金发姑娘原则:评测粒度要恰到好处,按「待办任务」(jobs to be done)分层测量,而不是只盯着最终答案。他举金融分析 agent 为例——如果推荐错了,一套设计良好的评测应该给出「客户理解 92%、证据提取 92%、数据分析 70%、推荐 75%」的分解,让你知道该往哪里深挖。AI 创作者 Peter Yang 则转述 Shreya 的洞见:top-down 评测(只给任务描述、让模型自由发挥)Claude 做得非常好;bottom-up 评测(从海量样本输出中提炼人的直觉、固化成评测)Claude 非常糟糕——「那是你自己的活儿」。结论惊人一致:评测是人的判断力工程,模型只是工具。
智能的降价开始引爆需求。Vercel CEO Guillermo Rauch 观察到:OpenAI Sol 的价格下调叠加 Vercel AI Gateway 的折扣,使 Sol 成为 Vercel 增长最快的前沿模型——「智能的需求高度弹性,推理成本下降,用量就快速增长」。他由此断言 gateway 不可避免,不用 gateway 就会错过这波价格波动带来的成本与利润红利。OpenAI Codex 负责人 Thibault Sottiaux 则给出更宏观的判断:2026 年是公司开始认真对待模型效率与可靠性的年份,因为模型正在变成关键基础设施;他同时确认 ChatGPT 用量上限已重置、昨日反馈的问题已修复落地。
YC 掌门人 Garry Tan 再补一刀预言:记录系统(systems of record)要么变成 AI 的缰绳(harness),要么被 agent 取代。把三条主线放在一起,行业正在从「模型能力竞赛」转向「基建与工具链竞赛」:评测决定质量边界,成本曲线决定扩散速度,数据与记录层决定 agent 的用武之地。
「2026 年是公司开始认真对待模型效率与可靠性的年份——模型正在成为关键基础设施。」他同时确认 ChatGPT 的用量重置已推送到所有账号,昨日反馈的问题也落地了修复,用户应能感到明显改善。从「炫能力」转向「保稳定、管成本」,OpenAI 正在进入基础设施运营者的节奏。 原推 →
在「如何构建好的评测」系列第七篇里提出金发姑娘原则:评测粒度要恰到好处,按待办任务分层测量,而不是只比对最终答案。以金融分析 agent 为例——若推荐错了,一套好的评测应该给出「客户理解 92%、证据提取 92%、数据分析 70%、推荐 75%」的分解,让你知道该往哪里深挖。不要太粗,也不要太细,够诊断就行。 原推 →
转述 Shreya 关于两类评测的洞见:top-down 评测——只给任务描述、让模型在真空中自由发挥——Claude 做得非常好;bottom-up 评测——面对海量样本输出,把你作为人的直觉外化成评测——「Claude 非常非常差,那是你自己的活儿」。评测的上半场模型能代劳,下半场的品味与判断必须由人来交付。 原推 →
OpenAI Sol 的价格下调叠加 Vercel AI Gateway 的折扣,让 Sol 成为 Vercel 增长最快的前沿模型。他认为这证明智能的需求高度弹性:推理成本一降,用量就暴涨;「不用 gateway 就错过这波剧烈的价格波动」——路由器赛道升温毫不意外,gateway 是必然。另一条推文里他亮出扩展 fx 的哲学:开放协议(MCP、Skills、Plugins)之上,最好的一层是 Unix——小程序各司其职、互相组合;libfx 让 fx 可嵌入更大程序,人人都能构建自己的 CLI、后台 agent 与软件工厂。 原推 →
给出预言:记录系统(systems of record)要么进化成 AI 的缰绳(harness),要么被 agent 取代。作为 YC 掌门人,他把这句话放进 2026 年的语境——企业软件的下一个分水岭,取决于谁能把数据资产变成 agent 顺手的基础设施。 原推 →
为 agent 生态站台:CLI 很好,但在你工作的地方有 UI 可视化和团队视图更好。另一条推文里他给开源项目 camsnap 加上旋转 USB 协议,让「龙虾爪」指挥 360 度网络摄像头转圈环视——把 agent 硬件玩成了玩具。从 CLI 到 UI 再到物理世界的爪子,agent 交互的边界正被一点点推开。 原推 →