Codex/ChatGPT 的活跃规模跨过 1500 万,OpenAI 随即为所有用户重置使用限制。他轻描淡写:「其实是几天前的旧闻了,享受一次重置吧,一小时内生效,直接 /fast。」 原推 →
今天的主线是「为 Agent 打造的互联网」如何落地。微软 CTO Kevin Scott 在播客里给出了最清晰的比喻:MCP 之于 Agentic Web,就像 HTTP 之于互联网,NL Web 则扮演 HTML 的角色。他主张微软内部所有系统统一说标准协议,避免「把组织架构图发布出去」(Conway's Law 的教训),并抛出一个关键概念——capability overhang(能力过剩):模型的推理能力已经跑在产品前面,行业需要集体努力弥合这条落差。
Anthropic 一侧用三篇长文展示了托管 Agent 的工程化进展。核心文章《Scaling Managed Agents》详述了把「大脑」与「手」解耦的架构:session(事件日志)、harness(调用循环)、sandbox(执行环境)三个抽象各自独立、互不假设——容器可以死、harness 可以重启、token 永不进入沙箱(凭据收在 vault 里,经专用代理调用 MCP)。同日发布的还有自托管沙箱与 MCP 隧道:企业可让 agent 的执行环境跑在自己基础设施内(或 Cloudflare、Daytona、Modal、Vercel),配合既有安全边界。此外 Anthropic 复盘了 Claude Code 四月质量事故——三个独立变更叠加造成「看似广泛的不一致劣化」,已于 4/23 重置所有订阅者使用限制。
成本端继续加速。Box CEO Levie 评论 Deepseek 与 Grok 同日发布的新模型是「能力巨大跃升 + 成本低到离谱」——这正是 AI 的 Jevons 悖论:价格下降不压缩需求,反而让企业找到更多值得交给 agent 的场景。
Kevin Scott 给 Agentic Web 画了一张地图:MCP 是它的 HTTP,NL Web 是它的 HTML——简单、可组合、开放,靠社区活动走向普及。另一层洞察是「capability overhang」:scaling laws 一年年被验证仍然成立,但模型的推理能力已经领先于产品实际交付的能力,这是全行业要一起补的课。
关于 agent 记忆,他直言现在的 agent 是「事务性」的——单次任务内记忆连贯,任务结束就归零,这严重限制了人们把越来越复杂的任务委托出去。安全模型方面,他承认 MCP 还没有同源策略那样的东西,但它的简洁让社区相对容易达成共识:agent 要有身份、能构建授权系统、能向用户请求权限——「以开放的方式做,不必是专有的」。
一个值得玩味的细节:Scott 说登台前收到妻子账号的 2FA 变动提醒邮件,他选择发短信而非邮件确认——因为他担心邮件账号可能已被入侵。他想象未来的安全 agent 应该能注意到这种「不对劲」,并用多渠道信息交叉验证真伪。
收听原片 ↗Codex/ChatGPT 的活跃规模跨过 1500 万,OpenAI 随即为所有用户重置使用限制。他轻描淡写:「其实是几天前的旧闻了,享受一次重置吧,一小时内生效,直接 /fast。」 原推 →
Claude in Chrome 的会话不再锁在单个设备:桌面、网页、移动端跑同一份 Cowork 会话,账号即载体,技能与连接器在浏览器里也能用。「在标签页里开始,换台设备接着干」成为现实。Max 与 Team 今日可用,Pro 数周内开放。 原推 →
「一年前是 CLI,半年前是应用,如今是服务、Web 与云端会话。」三句话概括 agent 形态的演化速度——开发者的交付目标正在从「工具」变成「环境」。 原推 →
GBrain 更新到 v0.45.6.0,新增 17 个经过自己 OpenClaw agent(数十万 markdown 文件)打磨的「脑技能」,并同时兼容 Codex 与 Claude Code。他的建议:把它当独立的个人 AI 跑,别塞进主编码 agent——「个人 AGI 就是为你工作的那个」。 原推 →
Deepseek 与 Grok 同日更新模型,他称之为「能力巨大跃升 + 成本低得离谱」。在他看来这正是 AI 的 Jevons 悖论:把 AI 的价格打下来,需求只会加速——企业手里等着交给 agent 的场景,远多于供给。 原推 →
Gemini 又一轮跨应用集成开闸,共 14 家:Angi、Fever、GetYourGuide、Granola、OpenTable、Ticketmaster、Wix、Zocdoc、Zoho 等。「Gemini 替你办事」正靠一张越来越长的合作伙伴名单兑现。 原推 →
「未来几年 AI 产品最大的 alpha 在应用层。」模型会越来越便宜、越好、越本地化,差异化只能来自对具体用户工作流的深刻理解与重新设计体验的想象力。他提醒:能造 AI 产品的人分母即将爆炸,要挤进前 0.1%。 原推 →
「一年前的今天,Perplexity 提出要收购 Google Chrome。」回看这条旧闻,分量完全不同——浏览器作为 agent 入口的争夺,早已是行业明牌。 原推 →
《Scaling Managed Agents》深入拆解了托管 Agent 的设计哲学:把 session(事件日志)、harness(调用循环)、sandbox(执行环境)虚拟化成三个互不假设的抽象——就像操作系统把硬件抽象成 process/file,接口比实现活得更久。文章用「宠物 vs 牲畜」说明为什么耦合设计会失败:容器死了会话就丢,工程师还得钻进去手工抢救。
安全是架构的核心:在耦合设计里,Claude 生成的不可信代码与凭据住在同一容器,提示注入只要骗 Claude 读自己的环境就能拿到 token。结构性修复是让 token 从物理上无法被沙箱触达——Git 用仓库级 token 在初始化时注入本地 remote;MCP 凭据放 vault,经专用代理携带会话关联 token 调用。session 也不是 Claude 的 context window:事件日志可持久查询、可回放,由 harness 决定如何把上下文喂给模型。
同批发布的还有《New in Claude Managed Agents》:企业可让 agent 的执行环境跑在自己基础设施里(或 Cloudflare、Daytona、Modal、Vercel),编排循环留在 Anthropic 侧,自托管沙箱进入公测、MCP 隧道进入研究预览;以及《Claude Code 质量报告更新》:三处独立变更(默认推理强度下调、空闲会话思考清理 bug、降冗长指令)在四月叠加成「看似广泛的不一致劣化」,均已回滚修复。链接:https://claude.com/blog/claude-managed-agents-updates 与 https://www.anthropic.com/engineering/april-23-postmortem
阅读原文 ↗