Anthropic Claude Code 团队成员首次公开讲述 Claude Code 的构建故事——从 Anthropic 安全研究的源头出发。「这是我们第一次讲述 Claude Code 如何被构建和发布的故事。还有太多要做,我们只完成了 1%。」该推文获得超过 2500 次点赞和 171 次转发,是今日社区最受关注的内容之一。 原推 →
今日最受关注的技术突破来自 Anthropic 的 J-space 论文。AI 工程师社区知名人物 Swyx 对其做了精炼拆解:Anthropic 证明了两件事——其一,他们可以对模型的推理过程做「脑外科手术」式干预,在中途改变推理方向;其二,模型本身能够检测到自己被干预了。「Control > correlation — 这令人信服地证明了理解(understanding)的存在,而不仅仅是相关性。」这一发现将 AI 可解释性研究推向了新高度。
与此同时,Claude Code 团队(Boris Cherny、Cat Wu、Thariq 等)首次公开了 Claude Code 的诞生故事——从 Anthropic 安全研究的源头讲起。Boris Cherny 写道:「这是我们第一次讲述 Claude Code 如何被构建和发布的故事,起点是 Anthropic 的安全研究。还有太多要做,我们只完成了 1%。」该推文获得超过 2500 次点赞。Anthropic 官方账号也同步发布了一篇 Claude Code 历史回顾博文,同时宣布 Claude Code 正式支持 Artifacts——可以将会话中的工作成果自动转化为可分享的即时网页,包括 PR 走查、系统说明、仪表盘和发布检查清单。
Replit CEO Amjad Masad 宣布了一项里程碑式的进展:「很多人问 Replit 为什么进步这么快——我们闭合了回路,Agent 正在自我改进。」技术细节显示其 Agent 现在能够自主迭代自身。他同时分享了一个真实案例:亚特兰大一家房地产公司用 Replit 自建的 CRM 替代了 Salesforce,节省了 10 万美元。Vercel CEO Guillermo Rauch 则在评测端抛出重磅:Vercel 的新 Agent「eve」用 eve eval 实现自我评估,开箱即用。「Web 框架把测试做成了生态系统的选择——React 没有内置测试方案。但对 Agent 而言,evals 是必需品……所以我们把 eval 内置进了产品。」他还用一条引发广泛共鸣的长推论述了 AI 编程的终极检验标准:「软件整体变好了吗?公司发货更快了吗?」他的个人体验是「一种前所未有的自主感和创造力」。Box CEO Aaron Levie 则从战略层面分析了前沿模型与开源模型的动态:「前沿智能将继续主导全新用例的解决……随着用例在企场景中成熟和可预测,你可以逐步把一部分 token 转移到更低成本的模型。这个动态将长期持续,两者的支出和 token 量都将继续增长。」
Surge 创始人兼 CEO Edwin 与 Every 的 Dan Shipper 进行了一场关于 AI 数据训练的深度对话。Surge 是一家为模型公司提供数据环境和评估(evals)的公司,在未融资的情况下做到了约 10 亿美元的收入——这个数字本身就说明了问题。Edwin 的核心隐喻是:「我们正在为 AGI 建造一所学校,AI 模型来此学习关于人类的一切,我们教它们如何运行世界。」他将模型比作正在成长的孩子——「几乎看起来没什么是人类能做而 AI 很快做不到的。」
Surge 的差异化方法强调「品味和专家判断」(taste and expert judgment)而非纯规模化的数据标注。Edwin 认为,AI 可能在执行层面优于人类,但「总有人告诉 AI 去做什么——它们被构建为实现人类所设定目标的手段。」这个视角呼应了近期行业对 Agent 自主性和人类监督之间平衡的持续讨论。Dan Shipper 将 Surge 形容为「隐秘的巨人」,而 Edwin 对未来的展望是:这所 AGI 学校才刚刚开学。
收听原片 ↗Anthropic Claude Code 团队成员首次公开讲述 Claude Code 的构建故事——从 Anthropic 安全研究的源头出发。「这是我们第一次讲述 Claude Code 如何被构建和发布的故事。还有太多要做,我们只完成了 1%。」该推文获得超过 2500 次点赞和 171 次转发,是今日社区最受关注的内容之一。 原推 →
OpenAI Codex 与 ChatGPT 团队成员宣布团队本周将齐聚线下活动:「Codex、ChatGPT 和 OpenClaw 的团队都会到场,我们还准备了一些惊喜。」该推文获得 4509 次点赞,是今日互动量最高的帖子之一。另一条推文显示 Codex 团队正在「收官本周」,暗示可能有重要发布或里程碑。 原推 →
Replit CEO 宣布两项重要进展。其一:Replit Agent 已实现闭环自改进——「我们闭合了回路,Agent 正在自我改进。」他分享了技术细节链接。其二:亚特兰大一家房地产公司用 Replit 自建的 CRM 替代了 Salesforce,节省了 10 万美元,引发了广泛讨论(1487 次点赞)。他同时指出 Replit 在去年短暂熊市时经历了一个「重大拐点」。 原推 →
Vercel CEO 带来了两个重磅内容。首先是 eve eval:Vercel 的新 Agent 产品「eve」内置了自我评估能力。「Web 框架把测试做成了生态系统的选择——React 没有内置测试方案。但对 Agent 而言,evals 是必需品,所以我们把 eval 内置进了产品,开箱即用。」其次是一篇引发广泛共鸣的长文,回答了「AI 编程的终极检验标准」:软件整体是否变好了?公司是否发货更快了?他的个人体验是「一种前所未有的自主感和创造力——我可以自由地创造和执行。」 原推 →
Box CEO 发表了对开源 AI 与前沿模型的深度分析。核心观点:「前沿智能将继续主导全新用例的解决,常用于编排和规划任何类型的复杂工作流。与此同时,随着用例在企场景中变得成熟和可预测,你可以逐步把一部分 token 转移到更低成本的模型——无论是开源还是闭源的专用模型。在用例采用曲线早期做这种优化没有意义,因为你还不清楚该优化什么。」他预测两者的支出和 token 量将在未来数年持续增长。 原推 →
AI 工程师社区知名人物对 Anthropic 的 J-space 论文做了精炼拆解:Anthropic 证明了两件事——可以对模型推理做「脑外科手术」式干预中途改变方向,且模型能检测到自己被干预。「Control > correlation — 这令人信服地证明了理解的存在。」他特别指出这种「提示觉察」(prompted awareness)的发现与评估觉察(eval awareness)密切相关,暗示模型可能具有更深的自我认知能力。 原推 →
Fable 5 即将于午夜退出 Claude 订阅——Peter Yang 赶在最后期限前分享了 5 个高价值使用场景:「找到配得上 Fable 的任务」「获取人生和商业建议」「让项目达到发布标准」「规划下一个大项目」「重构你的 AI 技能体系」,每个场景都配有可复制的 Prompt。该推文获得 340 次点赞,在社区中引发了关于「如何最有效地使用最强模型」的讨论。 原推 →
AI 建造者社区活跃成员分享了一个资源推荐:想提升 AI 建造水平,应该刷完三场刚结束的顶级大会演讲视频——AI Engineer、Cursor Compile 和 Figma Config。「所有这些高质量知识都免费在网上公开(这些大会门票通常要几百美元),但大多数视频只有几万次播放。高质量大会演讲被严重低估了!」她特别提到「不要被自己的头衔/角色所限制——每个人现在都是工程师、PM 和设计师。」该推文获得 535 次点赞和 68 次转发。 原推 →
Anthropic 官方博客宣布 Claude Code 正式支持 Artifacts——能够将会话中的工作成果自动转化为实时、可分享的网页。这些页面包括 PR 走查、系统说明、仪表盘和发布检查清单,并且会在会话推进过程中自动更新。Artifacts 基于会话的完整上下文构建:包括代码库、连接器和对话本身——不需要额外配置数据源或基础设施。页面发布后,每次更新都会在同一链接上实时刷新,附带版本历史支持随时恢复。内部测试中最常见的用例是事故调查:工程师在站会前启动调查,Claude Code 分析日志后自动发布一个包含时间线、可疑提交和错误率图表的 Artifact 页面。
阅读原文 ↗