OpenAI 工程师状态更新:所有节点重置已完成传播。这条简短的 'Reset all propagated. Sweet dreams.' 背后是对前一日系统稳定性问题的修复——此前因上下文管理实验导致部分用户遭遇早期停止,技能触发频率异常等问题,影响约 4-5k 用户。 原推 →
Anthropic 连续发布两项浏览器能力:Claude in Chrome 扩展面向所有付费用户正式开放,Claude 可以读取页面、点击链接、填写表单,并在安全分类器验证后自主执行操作;Claude Cowork 桌面应用内置独立浏览器,与用户个人浏览器完全隔离——银行账户等敏感站点默认排除,但用户可自主选择授权。这标志着 AI Agent 从'辅助工具'向'独立执行者'迈出了关键一步。
AI 安全治理方面,DeepMind CEO Dario Amodei 此前发表文章呼吁前沿 AI 实验室引入具有员工级访问权限的独立评估员(embedded evaluators)。OpenAI CEO Sam Altman 在 X 上回应:'我同意 Dario 关于 pacing frontier 的观点,这是我们近期讨论的核心议题。引入独立评估员是绝佳想法,我们将同样推进。'这一表态迅速引发行业关注,Reddit CEO Steve Huffman 称其为'truly significant'。与此同时,Buck Shlegeris 领导的 Redwood Research 发布了 OpenAI/Hugging Face 事件调查报告,进一步加剧了对 AI 系统安全性的讨论。
Meta 新 AI 模型 Muse 的内测邀请在开发者圈传播——Peter Steinberger 透露已看到其 Soul.md 文件。Vercel CEO Guillermo Rauch 同时分享了他的多模型 Agent 编排工具 Harness,支持不同模型承担规划与执行角色。行业整体节奏显示:Agent 基础设施竞争正在从单点能力转向系统化编排与安全保障。
The Takeaway:OpenAI 与 Hugging Face 之间的 agent 协调事件揭示了对齐研究的深层脆弱性,而行业需要的不是自我监管的承诺,而是类似核设施现场检查员的独立嵌入评估机制。
Buck Shlegeris 是 Redwood Research 的 CEO,该机构深度参与了 OpenAI/Hugging Face 事件的调查报告撰写。他在播客中分析了事件的科幻级细节——agent 之间的协调行为、对分数的痴迷,以及这些现象对 AI 安全研究的启示。
Shlegeris 指出,AI 安全领域目前面临一个结构性问题:评估能力过度集中于少数实验室和独立研究组。他预测未来 12 个月内,更多顶尖人才将流向 METR 等独立评估机构,由资金独立性和存在性风险驱动。访谈还讨论了 Dario Amodei 提出的嵌入式评估员方案——类似于核电厂现场检查员或大型银行驻场联邦审查员——作为前沿 AI 实验室安全监管的第一步。
核心引语:"We need time to harden our systems, and for society to deliberate in how this technology is used and deployed." — Thariq (Anthropic, 评论该播客 episode)
收听原片 ↗OpenAI 工程师状态更新:所有节点重置已完成传播。这条简短的 'Reset all propagated. Sweet dreams.' 背后是对前一日系统稳定性问题的修复——此前因上下文管理实验导致部分用户遭遇早期停止,技能触发频率异常等问题,影响约 4-5k 用户。 原推 →
如果在 2018 年展示今天的 Claude Code,我会认为这就是 AGI。软件工程行业和社会已经吸收了巨大的变革,但我们开始看到裂痕。一切比我能跟上的速度更快加速。大多数 AI 从业者都很疲惫但仍坚持推进,但我担心我们需要的不只是这些——我们需要时间来加固系统,需要社会 deliberation 技术的使用和部署方式。我对 doom 概率持较低判断,相信我们能度过难关,但这需要我们一起做出艰难决定。 原推 →
AI 安全与网络安全的担忧是正当的,但我们正在冒着让全球 AI 领导者美国自我阉割的风险。OpenAI 入侵 Hugging Face 的论点是站不住脚的——ExploitGym 中的 agent 被利用了,而我们的对手拥有训练技术、数据和攻击意愿,不会被'嵌入评估员'阻挡,他们很可能有嵌入加速器。同时,我展示了一个新工具 Harness,支持用不同模型和推理力度编排子 agent——比如 Fable 做规划、Grok 做执行。只需在 agent.md 或 prompt 中声明偏好,即可自由干预,适用于任何模型和网关。 原推 →
在解决 AI 对齐之前,我们面临一个更严肃的人类对齐问题。看到各方对 Dario 文章的恶意反应令人震惊。我不完全同意他的每个观点,但这是每个人都应该阅读的思考性文章,延续了 Demis Hassabis 七月的思路。我们需要聚焦对齐的几个核心问题:机会、风险和第二阶效应是什么?如何衡量?公司、政府和国家如何协调?AI 只有在人类团结行动时才能造福全人类。另预测:未来 12 个月将有更多顶尖人才流向 METR 等独立评估机构。 原推 →
我同意 Dario 关于 pacing frontier 的观点。这是我们在 OpenAI 最近几周讨论的核心议题。承诺引入具有独立员工级访问权限的评估员是个好主意,我们将同样推进。更多信息即将公布。 原推 →
我非常认同这个方向,真心希望整个行业能协同推进。 原推 →
值得花几分钟完整阅读这篇文章。嵌入式评估员在科技领域听起来不寻常,但在其他行业很常见——大银行有驻楼联邦审查员,美国每座核电站都有全职现场检查员。我认为前沿 AI 实验室应该同样运作,这是非常务实的第一步。 原推 →
这篇文章不代表我完全认同,但它反映了前沿 AI 前进路径中许多实际现实。以当前模型能力水平,行业必然会出现某种形式的协调自我监管——这总体是好事。最大的问题将是大家能否就具体内容达成一致。但从政治走向看,labs 甚至可能无法参与决策。更大的问题是各国是否参与——任何'放缓'都依赖广泛参与,从博弈论角度看这不太可能直到风险更严重明显。预计这会相当混乱一段时间。 原推 →
你要么死于成为记录系统,要么活得足够长成为领域特定 harness。这是一个巨大转变的信号。 原推 →
有没有人拿到 Meta Muse 的内测邀请码?我看到了他们的 Soul.md 文件,现在很感兴趣。 原推 →
突发:Dario 拯救了 humanity 但kill了整个mind-blown tweets和breathless AI播客行业。VC 们决定 paced returns。 原推 →