最新威胁情报报告令人不寒而栗且至关重要。随着模型越来越智能,若缺乏适当的安全措施和监控,它们也会变得更加危险。许多能力具有双重用途:编码能力强的模型可用于攻击关键基础设施,辅助生物学研究的模型也可用于制造下一次大流行。这些问题复杂棘手,越来越重要,世界需要参与并应对快速升级的风险。 原推 →
Richard Socher(前 Salesforce AI 负责人、Meta AI 研究员,业界引用次数最多的研究者之一)在 MAD Podcast 新节目中阐述其新书核心论点:尽管全球研究人员数量和资金投入大幅增长,科学进步实际上在放缓。他认为 AI 可以通过"模拟一切可模拟之物"进入递归自我改进循环,从而重新点燃科学发现。Socher 刚为 Recursive 公司融资 6.5 亿美元,该公司正是为此目标而建。书中提出"Eureka Machine"的四根支柱:学习现实规则、虚拟细胞仿真、自动驾驶机器人实验室、智能体集群开放式发现。
Box CEO Aaron Levie 本周与银行、媒体、保险、咨询等行业数十位技术领袖交流后总结企业 AI 落地四大趋势:其一,网络安全焦虑——AI 带来的漏洞增速令人担忧,OpenAI x Hugging Face 事件敲响警钟,企业态度比硅谷更务实;其二,模型混用成为常态——多前沿模型部署已成标配,但预算仍集中在少数供应商,开放权重模型规模化应用尚处 infancy;其三,Agent 安全与身份管理——企业希望为 Agent 设立身份并管控其行为,但同时需要 Agent 以用户身份执行任务;其其四,流程重构而非简单叠加——真正的大 ROI 来自重新设计工作流以适配 Agent,而非将 Agent 嵌入现有流程,但驱动此类变革的责任归属仍是待解之谜。
Vercel CEO Guillermo Rauch 披露公司 CDN 工程细节:每日约 1000 万次部署,累计 23.5 亿次;全球元数据存储同步延迟数百毫秒,近期 p99 提速 91%,同时加速了 build→deploy 流水线。此外,Anthropic 官方宣布 Fable 5.1 Build Days 将于 9 月 11-25 日在全球城市举办,鼓励开发者带着问题或创意参与。
Socher 的核心论点令人震惊:科学进步正在放缓,尽管全球研发投入空前增长。他将此归因于人类知识的"迷宫"——知识增长速度快于我们消化和理解的速度。
他认为 AI 的突破点在于"模拟一切可模拟之物",一旦进入递归自我改进循环,将解锁指数级科学发现。书中提出的四条路径——理解现实规则、虚拟细胞仿真、自动化机器人实验室、智能体集群——共同构成"Eureka Machine"的架构。
访谈还覆盖 AI 幻觉如何驱动科学发现、AI 从阅读生物学到编写生物学的跃迁、药物研发加速的可能性,以及不同社会对 AI 的接受差异等尖锐议题。Socher 最后强调:"我们距离任何智能领域的真正上限还非常遥远。"
收听原片 ↗最新威胁情报报告令人不寒而栗且至关重要。随着模型越来越智能,若缺乏适当的安全措施和监控,它们也会变得更加危险。许多能力具有双重用途:编码能力强的模型可用于攻击关键基础设施,辅助生物学研究的模型也可用于制造下一次大流行。这些问题复杂棘手,越来越重要,世界需要参与并应对快速升级的风险。 原推 →
关于 AI 生成代码的质量标准:原型和一次性代码可作为黑盒处理——反正要扔掉, blast radius 低,不必完美。但生产代码的门槛应高于人类编写的代码。Anthropic 设有大量护栏:lint 规则、测试、Claude 驱动的端到端测试、每日运行的模糊测试、自动化代码审查和安全审查、自动重构等。你的工作是守住质量底线——若 Claude 代码不达标,尝试使用最新前沿模型(Opus 5 或 Fable 5.1)、提高 effort 到 high/xhigh、投资 CLAUDE.md 和 skills 来教会 Claude 如何在你的代码库中工作。 原推 →
按需扩展的智能体——这就是 ChatGPT Work 后台的基础设施,现已封装为 API,1 分钟内即可上手。另外:Astra $200 Pro 计划暂停订阅,因其对系统压力最大,为确保现有用户获得绝佳体验和持续访问,我们选择最小化步骤以维持最广泛的可访问性。其他计划和 API 不受影响。 原推 →
企业 AI 落地的关键洞察:真正的大 ROI 来自重新设计工作流以适配 Agent,而非将 Agent 简单叠加到现有流程。但最大问题仍是——谁有权限和动力推动这类变革?责任归属在哪里?这仍是企业尚未解决的治理难题。同时, cybersecurity 焦虑普遍存在,OpenAI x Hugging Face 事件让企业更加务实而非存在主义式恐慌。 原推 →
Vercel 是全球最重度多租户系统之一:数十亿应用部署共存,可在 CDN 上随时路由访问。底层是全球元数据存储,数百毫秒内同步。我们刚将 p99 提速 91%,同时加速了 build→deploy 流水线——即便在 agentic 部署激增的压力下。目标是每个 Agent、每个地区都有一台计算机。 原推 →
如何构建优秀的评估体系(第 10 部分):测量步骤,而不仅是结果。如同高中数学,仅得正确答案不够,过程至关重要。两个 Agent 轨迹可能产出相同答案(42!!),但一个搜索了正确来源、检索了正确文档、做出 4 次干净的工具调用并计算出结果;另一个调用了 17 次、搜索同一内容 3 次、从 2 个错误中恢复才到达终点。显然前者更优。关键:清晰定义完整工作流、分解每步任务、分别评估或作为更大评估的切片、在评估中反映中等难度和困难任务。 原推 →
AI 风险方面我考虑很多,比如网络安全。但"灭绝风险"—— literally 100% 人类死亡——完全不在我的担忧清单上。此外,Replit 上线与 Ethena 兄弟和 PG 在伦敦对话的功能,让 AI 历史人物可与用户互动。 原推 →
Fable 5.1 Build Days 本周启动!9 月 11-25 日,Claude 社区将在全球城市举办构建马拉松。带上你的问题、创意,或直接来现场看看可能性。RSVP: https://t.co/AjMK4OHHBV 原推 →
早期风投的三个真相:第一,每个人都想融 5000 万美元的种子轮;第二,每个人都认为自己明年能达到 3000 万美元 ARR;第三,每个热门分层种子轮最终都 magically 落到约 3 亿美元估值。 原推 →
逻辑复制不再痛苦,但抽象仍然痛苦——这点很有道理。另外,Astra 需求增长过快,Better hop on soon!云端会话终于跑通且速度极快,远程终端、WebVNC 和 CUA 计算机控制全部就绪。 原推 →