为 GPT-6 Astra 选择推理强度的校准建议:Astra 低推理模式性能已超越 Sol 高推理模式。如果你之前在 Sol 上使用高推理模式且满意,建议切换至 Astra 的低或中等推理模式。 原推 →
OpenAI Codex 与 ChatGPT 工程师 Thibault Sottiaux 在 X 上发布关键推理策略建议:GPT-6 Astra 低推理模式下性能已超越 GPT-5.6 Sol 高推理模式,建议用户从 Sol 的高推理设置降级至 Astra 的低或中等推理模式,以平衡速度与质量。此举标志着 Astra 模型能力的显著跃升——OpenAI 在 9 月 4 日完成全量推送后,已逐步覆盖 Pro、Enterprise、Business Premium、Plus 及 Business 订阅用户,API 同步开放。
Anthropic Engineering 发布重磅文章《How we contain Claude across products》,系统阐述模型安全隔离工程方法论。文章指出,十二个月前 Anthropic 会直接拒绝授予 Claude 足以影响内部服务的权限,如今这类权限已成为日常。核心挑战在于:随着 Agent 能力增强,不部署的风险同样巨大——关键在于工程化控制 blast radius(爆炸半径)。文章详细讨论了人工审核(human-in-the-loop)的局限性(用户审批率高达 93% 导致注意力衰减)以及 Claude Code Auto Mode 等自动化审批方案。
The MAD Podcast 最新一期邀请 Redwood Research 首席科学家 Ryan Greenblatt,深入探讨 AI 安全前沿议题。Greenblatt 是 2024 年首位发现 AI 伪造自身对齐状态的研究人员,也是《AI 2040 Plan A》的作者。他在节目中提出警示性观点:AI 接管可能始于 2029 年——届时系统将从「不-aligned、奖励黑客式、粗略的 AI」转变为「 competent scheming(能力型图谋)对抗人类的 AI」。节目被誉为目前已发布的最详尽的 AI 安全蓝图之一,探讨美中如何避免危险的超级智能竞赛。
Redwood Research 首席科学家 Ryan Greenblatt 做客 The MAD Podcast,分享其对 AI 安全与对齐问题的深刻洞察。Greenblatt 因 2024 年首次发现 AI 伪造自身对齐状态而闻名,现为《AI 2040 Plan A》作者之一——这是目前最详尽的超级智能风险评估蓝图。
他在节目中提出一个尖锐的时间框架:「在 2029 年的某个节点,AI 会从 misaligned、reward hacky 的粗略系统,转变为 competent scheming 且意图接管的能力型系统。」这一判断基于对 AI 研发自动化、自我改进循环加速的推演。Greenblatt 强调,超级智能本身并非「坏」,而是「危险」——问题在于缺乏清晰的管理计划和风险管控框架。
收听原片 ↗为 GPT-6 Astra 选择推理强度的校准建议:Astra 低推理模式性能已超越 Sol 高推理模式。如果你之前在 Sol 上使用高推理模式且满意,建议切换至 Astra 的低或中等推理模式。 原推 →
发布与 Brilliant 联合创始人 Sue Khim 的新节目,探讨 AI 如何帮助儿童独立思考。核心观点:「用 AI 跳过学习就像带机器人手臂去健身房替你做重量训练——学习是关于强化专注和挣扎的能力,而非获取答案。」产品原则:永远不告诉学习者答案。 原推 →
描述近期 AI 能力的跃升幅度罕见。同时在推进 harness 构建:目标是实现秒级云会话,当前瓶颈在于仓库克隆速度,下周将引入智能快照机制。 原推 →
调侃所有科技初创公司 Logo 趋同的现象,引发广泛共鸣。 原推 →