Codex 引入了大量改进。超长线程流畅处理。可悬停导航栏,可以在各轮对话间预览和跳转。设置搜索覆盖更多控件,外观和主机过滤选项更清晰,自定义 provider 设置也更容易找到。缩放级别变化不再使 tooltip、对话框、菜单、选中气泡、拖拽预览和自动补全错位。复制到 Slack 保留 Markdown 格式(项目符号、粗体、代码、链接);大量文本粘贴不再导致 UI 冻结。还有最重要的:专属 Pets 面板。
距离 GPT-5.6 Sol 受限发布不到 24 小时,开发者社区已经从「能不能用」转向了「用得怎么样」。OpenAI Codex 团队的 Thibault Sottiaux 晒出了 Sol 驱动 Codex 的实战效果——大量改进同时在 Codex 中落地:超长线程流畅处理、可悬停导航栏支持轮次间预览跳转、设置搜索覆盖更多控件、Markdown 格式化粘贴进入 Slack、以及「最重要的:专属 Pets 面板」。推文获得了超过 1300 个赞,developer UX 依然是社区最买账的叙事。
但乐观的开发者体验背后,安全隐忧也在同步升温。Vercel CEO Guillermo Rauch 发出了一个刺耳的提醒:Sol/Mythos 的网络安全能力在攻防两端同样强大。如果对手获得同等能力,将对不了解潜在漏洞的美国公司构成严重威胁。他建议所有企业立即运行 deepsec 等工具扫描漏洞。OpenClaw 作者 Peter Steinberger 则引用了一句老话——「历史告诉我们,访问限制很少能阻挡坚定的用户」——这与昨日围绕限制政策的争论形成巧妙呼应。当 Sam Altman 说「还没到不限量 token 的时候」,社区的理解正在从抱怨转向务实的安全评估。
与此同时,Box CEO Aaron Levie 从另一个角度给出了观察:AI 代币成本优化的最佳实践正在浮出水面,但其前提是对业务工作流的「非抽象」深度理解。「在「工作本身」和「底层智能」之间需要一个中间层——深入理解领域、优化架构、支持变革,三者合一才能把「每美元智能度」做到极致。」在底层模型能力快速收敛的今天,应用层差异化正在成为新的主战场。而 Swyx 则从开源角度切入——开源模型每美元能跑更多 token,应该用美元推理成本而非 token 数量来衡量模型水平,这对开源模型的定位是重大利好。
Sequoia 出品的 Training Data 本期邀请了 Engram 联合创始人 Dan Biderman 和 Jessy Lin。这家 NeoLab 专注于 AI 领域当前最热门的两个话题:记忆(memory)和持续学习(continual learning)。他们的核心理念颇具颠覆性——「我们不透过预训练或后训练的视角看世界。我们的模型一直在训练。」
Dan 解释道,当前模型的瓶颈不在于原始智能,而在于理解不断演变的新上下文。「无论是新任务还是特定工作场景,如何把这些信息像预训练那样深度嵌入模型权重中,这才是关键。」这与当下 Agent 工作流中普遍采用的 RAG(检索增强生成)和上下文窗口方案形成了鲜明对比——Engram 认为,把记忆塞进外部数据库不是真正的持续学习,真正需要的是让模型「学会」新东西并写入权重。对于正在构建长期运行 Agent 的开发者来说,这或许指向了第三条路。
收听原片 ↗Codex 引入了大量改进。超长线程流畅处理。可悬停导航栏,可以在各轮对话间预览和跳转。设置搜索覆盖更多控件,外观和主机过滤选项更清晰,自定义 provider 设置也更容易找到。缩放级别变化不再使 tooltip、对话框、菜单、选中气泡、拖拽预览和自动补全错位。复制到 Slack 保留 Markdown 格式(项目符号、粗体、代码、链接);大量文本粘贴不再导致 UI 冻结。还有最重要的:专属 Pets 面板。
Sol/Mythos 的网络安全能力在进攻和防御两端同样有用。如果对手获得同等的进攻能力,将对不了解潜在漏洞的美国公司构成严重威胁。我强烈建议运行 deepsec 或类似工具,用现有前沿模型进行扫描。
AI 代币成本优化有一些好的最佳实践,但没有一个能在缺乏对底层工作的深度、非抽象理解下落地。这意味着在「工作本身」和「底层智能」之间需要一个能深度理解工作流、上下文和业务流程的中间层。每家公司单独做这件事效率不高,因此这实际上是当下所有应用层 AI 公司的剧本——通过评估特定应用场景的模型、深入理解领域、优化 UX 和功能,这个中间层可以创造巨大价值。
把 Noam Brown 关于「评估时始终保持恒定推理预算」的观点延伸一下——开源模型每美元能跑更多 token,比闭源 API 模型划算得多。所以今天发布开源模型、或者在场景上倾向于开源模型的人,应该用美元推理成本来衡量 thinking level,而不是用 x 轴上的 token 数量。
「历史告诉我们,访问限制很少能阻挡坚定的用户。」
去年我几乎不知道 GitHub 怎么用。现在我有 1 万 GitHub 粉丝(仍然不会手写代码)。多么疯狂的一年。顺便说一句,我不是工程师;这些都是我为了好玩做的 side project。我只是喜欢把技术和用户问题连接起来、用它解决自己的痛点,然后讲产品故事。
智能眼镜简史:2013 年 Google——「你真的需要这个」。所有人:「不不需要」。2016 年微软——「那如果是企业版呢」。企业:「也许,但还是不」。2023 年 Meta——「那如果外观正常还带 AI 呢」。所有人:「等等……也许?……其实还是不」。2024 年苹果——「那如果卖 3499 美元还遮全脸呢」。所有人:「绝对不」。2026 年 Snap——「这次来真的」。所有人:「佩服你们的坚持,但还是不」。
Anthropic 宣布 Claude Code 开始支持 Artifacts——将编码会话中的工作进展实时转化为可分享的交互式网页。无论是 PR walkthrough、系统说明、仪表盘还是发布检查清单,Artifacts 都能自动从会话上下文中构建页面,并随工作推进实时更新。一个典型场景:工程师在站会前启动事故排查,Claude Code 分析日志后自动发布一个 Artifact——包含时间线、可疑提交和错误率图表。每个发布都是同一链接的新版本,附带版本历史可随时回溯。
阅读原文 ↗