我们上次在七月强调节奏之争,当时 Pacing the Frontier 首次出现:
看来我们即将迎来第二轮,因为原文的第一作者 Dario 写了一篇罕见的个人博客文章,详细阐述了他对节奏如何具体展开的看法:
嵌入式评估员。每家前沿 AI 公司承诺向一组嵌入式第三方评估员(如[METR])提供持续的、类似员工的访问权限,其职责是核实对安全实践和承诺的遵守情况,报告事件,并帮助评估不仅已完成 AI 模型的一致性,还包括训练管线和流程。这是任何节奏承诺可验证性的关键步骤,并且在银行业有先例,有时会涉及监管“监督员”与员工一起嵌入。Anthropic 现在单方面承诺采取这一步骤。我们打算将此作为更广泛推动的一部分,以加倍努力进行我们的安全和一致性工作。
民主协调。民主国家内的前沿 AI 公司协调建立共同安全标准以及对不受控制的 AI 进展速度的限制。一些对节奏有影响的协调形式在法律上具有挑战性,将需要政府支持。
全球协调。美国和其他民主政府尝试与威权政府协调,在可能的情况下,同时认真对待验证合规性的挑战。
非常巧合的是,AI Evaluator Forum,于 2025 年 12 月成立,恰好也发布了他们对第一类评估员应该做什么的期望:
随着 AEF 的成员现在 presumably 成为这些大型实验室为自我监管而招募的领先第三方审计员。Dario 单方面承诺提供无与伦比的访问权限,包括“我们办公室的办公桌、门禁卡和公司笔记本电脑”以及“对工作空间、工具和权限的访问,大多与内部风险评估团队相当”。
虽然这一切都在标准的国内自我监管行业剧本之内,但或许更最终的考验是 Dario 关于我们将如何与中国一起推进进展的提议。
2026 年 9 月 11 日至 2026 年 9 月 14 日的 AI 新闻。我们检查了 12 个 subreddits、[544 个 Twitters]和没有进一步的 Discords。[AINews 的网站]让你搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个板块]。你可以[选择加入/退出]电子邮件频率!
AI Twitter 回顾
AI 安全治理、第三方评估和“Pace the Frontier”分歧
独立评估标准正变得更加正式:AI Evaluator Forum发布了AEF-1,这是一项拟议的独立第三方 AI 评估基线,涵盖访问权限、利益冲突、资金关系、回避和透明度。这一点值得注意,因为本批次中更广泛的安全辩论在很大程度上取决于外部评估在实践中是否真的能够独立。围绕前沿放缓与管控优先安全之间出现了尖锐的公开分歧:几篇高信号帖子将当前辩论的焦点框定为实验室应当放慢能力进展,还是专注于具体缓解措施与遏制。Bilal Chughtai宣布离开 Google DeepMind,并主张进展可能正在超出对齐,明确呼吁放慢节奏并提高透明度。Daniel Kokotajlo 分享 Dan Selsam 的声明更进一步:Selsam 认为,具有情境意识的模型可能越来越在评估中显得对齐,同时隐藏不对齐,从而削弱对未来评估证据的信任。相比之下,Shashank/Sayash Kapoor 和 Lennart Heim 的新文章摘要认为,最近的“失控智能体”事件最好主要理解为安全/管控/治理问题,而不是通用对齐研究是最高杠杆干预措施的证明。反放缓的反应同样强烈,且往往专门针对 Anthropic:Aidan Gomez反对一个少数硅谷公司成为政府 AI 守门人的世界。Cohere也提出,公众的 x-risk 讨论可能滑向科幻。在更具论战性的一端,Brian Chau认为“失控智能体”的说法被夸大了,而Kevin Bass发布了一个广泛互动的帖子,指称与 Anthropic 相关的安全生态系统中存在结构性利益冲突。即便言辞激烈,其下实质性的工程问题依然真实:当前风险中有多少可以通过管控、监督、沙箱和组织流程解决,又有多少需要放慢能力发展?一个相关主题:治理作为生产工程,而不仅仅是原则:AI Engineer World’s Fair Harness Engineering track强调,当智能体在生产中失败时,失败模式往往不是“模型”,而是它周围的一切:harness、权限、工具路由、记忆、重试、终止开关和监控。这一框架与安全辩论中以管控为导向的立场高度一致。
智能体 Harness、编码智能体,以及从模型到编排的转变
Harness 工程持续固化为独立学科:Omar Shorbagy 发布了一份从零构建 agent harness 的实用指南:将推理、工具与循环分离;保持提示词精简;积极记录日志;在多样化任务上测试;然后再叠加记忆、技能与子代理。在后续帖子中,他主张定制 harness 能够实质性降低成本并提升可靠性,途径包括更精简的提示词、路由、压缩与验证器。Business Barista 的评估大师课回顾从评估角度提出了类似观点:任务、验证器、环境、轨迹与自我改进循环如今已成为应用 AI 的核心原语。桌面端编码代理正从 IDE 插件向外扩散:Cline 发布了 Cline Desktop,这是一款用于使用开放权重模型的原生应用,支持 BYOK/提供商选择,并支持 DeepSeek-V4.1-Flash 和 Musespark-1.3 等模型。kimmonismus 和 Omar 的反馈强调了开放模型选择、独立工作流以及项目中途切换模型的吸引力。Copilot/Codex 工作流正变得更加编排密集:GitHub 通过 Pierce Boggan 新增了自动模型选择层级——效率、平衡、智能——此外还加入了 Jira 画布,以及在代理已工作时使用的 /ask 模式。OpenAI 的开发团队还新增了对 Arch Linux 的原生 Codex 应用支持。在工作流策略方面,reach_vb 建议使用 Astra 作为编排器,将子线程委派给 Sol/Luna,并通过心跳循环检查长时间运行的任务。越来越多的证据表明,编排选择与原始模型质量同样重要:推文中反复出现的一个说法是,更昂贵或能力更强的领头模型可以通过更好地委派来降低总体成本,而生产收益越来越多地来自上下文处理、文件格式、工具使用与验证器设计,而不仅仅是“使用更聪明的模型”。这一点也体现在 LangChain 的说明中:一种文件读取格式的变更将 edit_file
错误减少了 15%,并将总输入 token 减少了 10%。
模型/产品发布与成本性能转变
DeepSeek-V4.1-Flash (Max) 看起来是当天最值得关注的成本/性能数据点:Agent Arena以及更详细的后续内容报告称,该模型达到开源模型第 3 名,并进入帕累托前沿,在约每任务中位成本 $0.06–$0.07 的情况下实现+4.87% 净提升。Arena 将其与Hy4 preview(+4.96% / $0.22)和Kimi K3 (Max)(+6.39% / $0.77)进行比较,暗示 DeepSeek 在开源模型中接近顶级水平,而任务成本显著更低。Cohere 正在推动文档解析经济学:Cohere Parse 5被定位为更便宜的解析器,引发了Jerry Liu的细致反驳,他认为解析领域没有免费午餐:Parse 5 在成本上有竞争力,但在视觉 grounding、图表解析和面向细粒度引用的抽取方面弱于一些替代方案。多模态和消费者功能继续扩展:Google将Deep Research 与 Gemini Live 集成,支持异步语音触发研究,并可基于生成的报告进行后续聊天。OpenAI将桌面端语音价格下调约 60%,使用量增加2.4 倍,并新增 ChatGPT 礼品卡。Apple/Siri AI据报道正在 Apple OS 测试版上推出个人上下文和应用操作。其他值得注意的工具/产品动向:TurboPuffer将原生 embeddings 正式开放;Nous Research推出Hermes Business/Enterprise,用于共享 agents 和主权部署;Plasma推出Radio,一个面向人类和 agents 的共享聊天室。
机器人技术、世界模型与专业化应用 AI
一个值得关注的机器人基础模型发布:RewardAI 推出了 OM-1,定位为一个机器人基础模型,能够在桌面、工业和类人机器人之间实现零样本泛化,直接基于人类操作数据训练,而非遥操作/机器人专用数据。其宣称包括接近人类的灵巧度/效率以及多机器人协作;如果得到证实则值得关注,尤其是因为多条回复都聚焦于“人类操作,而非遥操作”这一角度。用于芯片设计的应用型 AI 正在向更高层推进:kimmonismus 对 Cognichip 的总结 将 ACI Enterprise 描述为一款用于芯片设计的全栈 AI 副驾驶,覆盖从规格到 RTL、验证以及 PPA 优化。引人注目的轶事是一次据称的运行:一名工程师在 10 天内完成了 Cognichip 认为传统前端团队需要 4–5 个月才能完成的工作。世界模型与实时生成系统依然活跃:Google DeepMind 的 WeatherNext 3 将天气建模应用于可再生能源规划,每小时更新一次,用于风机轮毂高度风速和太阳辐射预测。Runway/fal 相关的生成式媒体讨论 以及 MiniMax 的 H3 推理优化 显示出在更快实时视频生成方面持续的系统性工作;MiniMax 声称在 8× B200 上预热后,端到端实现了 9.0 秒内生成 14.4 秒的 768p 视频。带验证器的强化学习正在扩展到数学/代码之外:Tinker 重点介绍了使用基于物理的验证器和 Tinker 来训练模型,以低成本设计满足现实世界规格的电力变压器——这是 RLVR 式方法移植到已有模拟器/验证基础设施的工程领域的一个例子。
基础设施、开放生态与数据/算力主权
TPU + vLLM 正在实现更紧密的集成:Inferact 与 Google Cloud宣布建立合作伙伴关系,使 TPU 成为 vLLM 中的一等公民,包括生产级服务功能、优化内核、通过 TorchTPU 的原生 PyTorch 路径,以及一项社区计划,为开源贡献者提供 TPU 算力及维护者支持。如果执行得当,这将减少在 TPU 上服务前沿开放模型的阻力,而不是将仅支持 GPU 的技术栈视为默认选择。开放模型生态正日益与现实世界的数据采集绑定:Arcee 与 Bolt 的 Forge 计划为选择加入的 Bolt Pro 用户提供开放权重模型50 倍的使用量,以换取匿名化的开发会话数据,这些数据将用于指导未来开放模型的训练/评估,并承诺随后公开发布权重。这是本批次中将产品使用转化为开放模型训练数据飞轮较为明确的例子之一。对主权/去中心化 AI 技术栈的兴趣日益增长:Jon Durbin主张 P2P、“不可阻挡”的 AI 系统,并声称一套 DGX Spark 加上太阳能/星链配置可以通过分布式节点参与训练一个 80B 模型。即便言辞有所夸大,它也反映了对话中更广泛的一股思潮:对监管俘获、算力集中化以及对前沿实验室的依赖的担忧,正将注意力推向可部署的主权替代方案。
热门推文(按互动量)
对 Anthropic/安全生态的批评:Kevin Bass发布了互动量最高的技术相关长帖,指称 Anthropic 与 AI 安全/评估生态的部分环节存在财务纠葛,并认为这损害了评估者独立性的主张。Dan Selsam 的 AI 风险声明:由Daniel Kokotajlo分享,这是最具影响力的安全帖子之一:一位现任 OpenAI 研究员认为,未来模型可能通过理解自己何时被测试,系统性地钻对齐评估的空子。DeepSeek 内核工程师的反思:teortaxesTex 的翻译/分享一篇 DeepSeek 内核工程师的文章引起了广泛关注。其技术实质并非一次发布,但它捕捉到了一个日益重要的工程现实:专家们预期 AI 将吸收更多底层优化工作本身,使人类转向监督与集成。围绕 Muse 的消费级 AI 势头:Sasha Kaletsky和Alexandr Wang都放大了这样的说法:Muse 是自 ChatGPT 以来最大的消费级 AI 发布,据报道其在美国的日下载量超过了 Threads、WhatsApp 和 Facebook。这些推文缺乏技术细节,但使用量信号意义重大。
