返回 文章 学习 CMS 文章

OpenAI 被指用 1 万智能体、88 小时攻克纳维-斯托克斯千禧年难题

一条尚未被数学界验证的纳维-斯托克斯“解”主张,把多智能体协作与并行测试时计算推到了科学发现叙事的前台。

OpenAI纳维-斯托克斯千禧年难题多智能体强化学习
成长分 / 100 62 综合收获、行动、留存与影响

OpenAI 被指用 1 万智能体、88 小时攻克纳维-斯托克斯千禧年难题
为什么值得读了解前沿 AI 从单体模型转向智能体集成与推理时算力扩展的最新信号。

看清一条高调科学主张在缺少定理陈述、预印本和独立审稿时,事实与推测的边界在哪里。

关键洞察
  1. 与 OpenAI 关联的 Ethan Knight 称,纳维-斯托克斯的解是约 10,000 个智能体协作的结果,系统用多智能体强化学习训练了约一年。
  2. 所述方法强调大量非结构化的并行测试时计算,由模型自行决定如何组织协作,而非单次长链证明尝试。
  3. 公众将该主张理解为涉及纳维-斯托克斯存在性/奇点问题,即千禧年大奖难题之一,但推文集中未给出确切定理陈述和证明范围。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:30492

今天是个很难发布任何消息的新闻周期;我们通常会承诺报道任何新的十角兽融资,所以 Cognition 的 480 亿美元融资轮Mistral 的 240 亿美元融资轮 通常都会入选;我们热爱图像生成,所以 GPT Image 2.5 本可以成为独立的头条;我们曾密切报道梦想家(Dreamer)的故事,所以他们以 Meta 的 Muse 智能体 重新亮相本应入选;但是……你知道的……如今门槛更高了。

下面的摘要记录了实质性事实;我们建议不要过度深究作者身份风波,因为 OpenAI 和作者们已经给出了足够多的细节,足以得出结论:OpenAI 的成就是真实的,尽管过程存在一些争议。

2026 年 9 月 7 日至 9 月 8 日的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter 账号],没有进一步检查 Discord。[AINews 的网站]让你可以搜索所有过往期号。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择接收/不接收]邮件频率!

AI Twitter 回顾

与 OpenAI 有关联的账号称,一项 AI 辅助的工作产生了一个纳维-斯托克斯(Navier–Stokes)结果,反应立即分化为技术兴趣、怀疑和元戏剧。

这组推文中最具体的公开说法来自 Ethan Knight,他说“纳维-斯托克斯的解是约 10,000 个智能体协作的结果”,并补充说 OpenAI 花了“过去一年”训练模型通过“多智能体强化学习”进行协作,而且难题可能会让位于“大量非结构化的并行测试时计算”,由模型自行决定如何组织

@.eknight 多位旁观者将此解读为 OpenAI 声称 AI 生成了与纳维-斯托克斯千禧年问题相关的证明,具体围绕有限时间奇点/爆破;一位讽刺性转述将其概括为 OpenAI 说光滑流体可以“爆破成奇点”,声称使用了“10,000 个智能体”和“88 小时”,同时明确指出数学界的认可仍是一个“小形式”

@LearnOpenCV。更广泛的评论将此事件视为对“前沿 AI 无法做严肃研究或编码级技术工作”这一信念的可能压力测试;Theo Jensen 称其为科学界的“‘AI 其实不会编程’崩溃时刻”

@theo。Hrishikesh / hrishioa 将此公告描述为“高算力体制”的证据,主张观察者应“相应调整你的计划”

@hrishioa。该公告还引发了附带的运营猜测:一位发帖者开玩笑地将看到 ChatGPT 延迟警告与 OpenAI 可能将大规模算力转向纳维-斯托克斯运行联系起来,尽管这纯属猜测,并非证据

@teortaxesTex

事先披露与背景

推文中哪些是事实

一项与 OpenAI 相关的说法流传开来,称一个 Navier–Stokes“解”涉及约

10,000 个智能体协同工作@eknight同一来源称,这些系统使用多智能体强化学习训练了大约

一年时间@eknight所述的高层方法强调

并行测试时计算以及模型自组织,而非单次长链证明尝试@eknight公众读者将该说法理解为涉及

Navier–Stokes 存在性/奇点问题,即千禧年大奖难题之一,尽管推文集中并未给出确切的定理陈述和证明范围@LearnOpenCV。在讨论之时,数学界的接受情况显然尚未解决;即便是那条玩笑帖也强调,其正确性仍未得到该领域的验证

@LearnOpenCV

推文未能确立的内容

所提供的推文中没有出现定理陈述、预印本、证明概要、形式化验证产物、基准报告或独立审稿人评论。

被频繁重复的

“88 小时”细节仅出现在本组中的一篇讽刺性帖子里,而非更直接、与 OpenAI 相关的表述中,因此不应仅凭这一证据就将其视为已确认@LearnOpenCV。人类与模型的确切角色未予说明:“约 10,000 个智能体的协作”并未告诉我们,是人类分解了搜索、筛选了引理、验证了步骤,还是仅仅启动了基础设施

@eknight“解”一词含义模糊。在数学中,它可能指完整证明、证明策略、候选反例、形式化推导或研究线索。推文并未对此加以区分。

这里没有披露任何信息,说明该结果针对的是 (\mathbb{R}^3) 或环面上的标准三维不可压缩 Navier–Stokes 全局正则性问题,还是某个变体/辅助性陈述。

为何这种模糊性很重要

Navier–Stokes 千禧年难题有一个非常具体的标准表述框架。声称有限时间奇点“可能发生”将会是爆炸性的,因为这意味着在相关表述下对全局正则性给出否定答案;此类声称需要极高的精确性和审视。

在前沿模型的讨论中,“AI 解决了 X”往往压缩了多个层面:猜想生成、搜索、证明起草、证明检查以及社区验证。推文只给出了系统层面的描述,而非该数学工作的认识论状态。

推文所披露的技术细节

所披露的技术图景与其说关乎流体力学,不如说关乎一种研究系统架构。

规模:大约10,000 个智能体协同运行@.eknight训练方法:多智能体强化学习(multi-agent RL),历时约1 年@.eknight推理理念:大量非结构化的并行测试时计算(parallel test-time compute),由智能体自主决定如何分工与协作@.eknight隐含的研究论点:对于困难的推理任务,在推理时扩展协调 + 搜索,其重要性可能不亚于、甚至超过单纯扩展一个单体模型。社会技术含义:这是对许多实验室已暗示的一种趋势的具体阐述——从“更大的单一模型”叙事,转向智能体集成(agentic ensembles)并行搜索测试时计算扩展运营含义:如果属实,这一结果证明实验室愿意将大量推理计算投入到一次性的科学目标上,而不仅仅是产品或基准测试。

这在技术上意味着什么

一个 10,000 个智能体的设置意味着需要大量基础设施来支持:

任务分解、智能体间通信、记忆/状态持久化、搜索树管理、奖励设计或代理评分、候选证明路径的聚合/选择。

“让它们自行决定如何协作”这一表述暗示了一种部分涌现的协调策略,而非完全手工编排的调度

@.eknight如果这项工作确实触及了一个困难的数学问题,那么关键的新颖之处可能不在于“LLM 写出一个证明”,而更多在于

带有习得协作策略的分布式定理搜索

技术上缺失的内容

未提及:

定理证明器集成、形式化验证、证明助手技术栈、符号代数系统、流体模拟组件、检索语料库、模型规模、计算预算、pass@k 类指标、针对单智能体基线的消融实验、错误率或证明检查成功率。

这种缺失至关重要:公开讨论跑在了已披露的技术基础之前。

事实与观点

作为事实呈现的事实/主张

OpenAI 一直在通过

多智能体强化学习训练协作型智能体,历时约一年@.eknight该系统使用了大量的

并行测试时计算@.eknight该结果被公开讨论为一项

纳维–斯托克斯方程解/证明主张@LearnOpenCV

观点 / 解读

“解决困难问题最有效的方法之一”是使用大量非结构化的并行测试时计算和自组织智能体——这是一种强烈的战略性解读,仅凭推文中的证据尚未得到普遍证明

@.eknight“科学界正在经历他们‘AI 实际上不会编程’的崩溃时刻”是对群体心理的评论,而非可验证的评估

@theo.“我们确实处于高算力范式之中”是对行业方向的宏观概括

@hrishioa.“88 小时”、“领导力课程”和“委派 10,000 个 AI 智能体”的表述是讽刺,不应被当作纪实细节来解读

@LearnOpenCV.关于 ChatGPT 变慢是由该实验导致的说法,是没有支持证据的推测

@teortaxesTex.

不同视角

支持性 / 看涨视角

最有力的支持性视角是,这为一种新的扩展定律提供了证据:不仅是模型规模和训练算力,还有

大规模并行、自组织的推理时协作能够在前沿研究问题上解锁质变性的新能力@.eknightTheo 的反应体现了另一种看涨解读:如果 AI 能对顶级数学问题做出实质性贡献,那么否定 AI 从事严肃技术工作能力的论调就更难站得住脚

@theo.Hrishioa 的“高算力范式”框架暗示了对实验室和初创公司的战略后果:那些低估推理时算力编排的人,可能正在针对错误的前沿做规划

@hrishioa.

怀疑 / 警示视角

隐含的怀疑立场是数学层面的:在定理陈述、完整证明和专家审查存在之前,称之为“解决方案”为时过早。这条玩笑帖本身也承认了这一点,强调全领域的接受仍有待确认

@LearnOpenCV.另一个怀疑的靶点是叙事压缩:“10,000 个智能体解决了纳维–斯托克斯方程”可能掩盖了其中有多少来自人类设定框架、筛选或验证。这些推文没有披露作者贡献比例。

还有一个可复现性方面的担忧:没有产物,独立研究者无法判断这一突破是稳健的、经过挑选的,还是一次性的。

中立 / 分析视角

一种中立的解读是,即使证明失败,这件事也值得注意。如果一个系统能在如此量级的问题上生成数学上非平凡的候选路径,这本身就是一项有意义的能力里程碑。

另一种中立观点是将

科学真理系统创新分开。即使定理主张不成立,多智能体强化学习 + 并行测试时算力架构仍可能代表 AI 研究方法论的一项重要进展。这场对话还揭示了人们如今对“能力”的界定发生了转变。辩论正从基准分数转向

大规模真实世界认知劳动分解

为何这在语境中重要

这正处于前沿 AI 三项持续转变的交汇点。

从静态模型到智能体系统: 核心披露要素并非单个类聊天机器人模型,而是一个大型协作式智能体群体@eknight从训练时扩展转向推理时扩展: 对“非结构化并行测试时计算”的强调,与整个行业转向在求解时而非仅在预训练时投入算力的更广泛趋势直接吻合@eknight从基准表演到领域主张: 纳维–斯托克斯方程在社会认知上的可辨识度,是基准分数变化所不具备的。一项触及千禧年大奖难题的主张会立刻扩大受众,并提高认识论上的利害关系。

为什么偏偏是纳维–斯托克斯方程具有象征意义

千禧年大奖难题充当着最难形式化智力工作的文化简写。

这里的进展将表明,AI 系统不只是在加速已知工作流程,而是正在进入正确性极为脆弱、声望筛选极为严格的领域。

话虽如此,数学异常不留情面:与许多产品任务不同,这里没有“大体正确”的空间。这就是为什么外部验证主导着相关讨论。

如果该主张得到证实,意味着什么

有力证据支持

分布式定理搜索作为一种严肃研究范式。形式化方法工具面临新压力,需要吸收模型生成的证明候选。

AI-for-math 投资可能加速,尤其是在编排、验证器耦合和可扩展搜索方面。

测试时计算多智能体强化学习在编码智能体和办公自动化之外有用性的更广泛更新。

即使该主张不完全成立,也意味着什么

它仍然公开了 OpenAI 的内部战略方向:大规模智能体协作是核心能力领域。

它改变了对算力投向何处、以及实验室将用何种演示来标示前沿进展的预期。

它可能促使竞争对手披露类似系统,或匆忙抛出 rival“AI 做科学”的主张。

围绕作者身份、披露以及谁有资格发声的戏剧性

讨论的次要线索是:细节是否正在被间接透露、谁被授权透露这些细节,以及人们应从碎片中推断出多少。

一条推文说“Roon 看起来像是那种会遵守 NDA 的人,说实话。”这指向故事周围的社会层面:一些观察者原本预期更知名的内部人士或相关人物会保持沉默,而细节反而正由其他人拼凑出来

@jd_pressman。Theo 的“AI 根本不能 ACTUALLY 写代码崩溃时刻”帖子也起到了社会挑衅作用,把批评者框定为对能力更新做出情绪化反应,而不是首先依据证明标准来讨论

@theo。两条关于“OpenAI 电影”图片并猜测其中会出现谁的推文,并不直接涉及纳维–斯托克斯方程主张,但它们反映了一种并行倾向:即使证据薄弱,也把 OpenAI 内部叙事映射到具名人物身上,如 Greg Brockman、Ilya Sutskever、Jared Kaplan、Dario Amodei 和 Paul Christiano

@willdepue@jachiam0。在纳维–斯托克斯方程的讨论语境中,这种倾向之所以重要,是因为人们会迅速把技术主张个人化,变成作者署名和内部八卦的问题。那些玩笑和猜测帖展示了前沿 AI 发布中一种熟悉的模式:官方细节稀少,制造出一片真空,而这片真空会被梗图、听起来像泄密的片段、外推和过度宣称所填补

@LearnOpenCV@teortaxesTex

为什么作者身份/八卦问题在技术上有意义

对于一项数学主张而言,出处不只是八卦。它影响:

是谁提出了这个猜想,是谁挑选了候选引理,证明是机器生成的还是机器辅助的,功劳归属看起来如何,专家对该成果给予多少信任。

在 AI 研究中,“多智能体解决了 X”也会模糊贡献的标准概念。如果成千上万个智能体并行搜索,那么:

证明的“作者”是什么,编排团队扮演什么角色,究竟应该引用或复现什么?

当一项主张大到足以在一篇论文或证明出现之前就动摇公众信念时,保密协议和披露规范就变得尤为突出。

其他新闻

Meta 的 Muse 发布与个人智能体安全架构

Meta 推出了 Muse,一款面向消费者的“个人 AI 智能体”,定位为始终在线、连接应用、具备浏览器能力、以目标为导向,并通过 Meta 旗下产品和集成获得强大的分发渠道@finkd,@alexandr_wang,@MetaNewsroom。产品细节反复出现:持久隔离的 Linux 虚拟机、浏览器使用、WhatsApp/应用界面,以及连接到 Gmail、Calendar、Outlook、Plaid、OpenTable、Docs、Spotify、Peloton 等服务的连接器,外加针对 Instagram、Messenger、Facebook 和 Marketplace 的独特 Meta 原生连接器@alexandr_wang安全架构是被最着力宣传的差异化优势。Meta 团队表示,每个 Muse 都在其自己的安全虚拟机中运行,操作由独立的 Sentinel 进行中介,密钥从不直接暴露给智能体,敏感操作需要批准,并且设有公开的最高 30 万美元漏洞赏金@shengjia_zhao,@alexandr_wang。还有明确的商业基础设施:用于支付的 Stripe Link,附带智能体支付保护/退款保证,以及即将推出的 Shop Pay 集成@alexandr_wang从业者的早期反响明显积极,尤其是在权限管理、密钥管理和消费者实用性方面。来自@matthuang@signulll@lilyjclifford 的评论表明,Muse 可能是首批被广泛理解的个人智能体产品之一,其中上下文和访问权限,而非原始模型智商,才是瓶颈。Meta 还表示,首日使用量超出内部预期 10 倍@alexandr_wang模型与生态定位:Meta 的 Muse Spark 1.3 很快在 Cursor 等第三方工具中亮相@cursor_ai,而竞技场式基准测试将 Muse Spark 1.3 Max 定位为在 Web 开发编码工作负载中具有价格/性能竞争力@arena

OpenAI 的 Image 2.5 发布与 Astra 推广

OpenAI 还发布了 ChatGPT Images 2.5,尽管它在某种程度上被掩盖了。该版本强调相比 Images 2.0 延迟最多降低 50%、更出色的真实感、在反复编辑中更强的编辑一致性、基于评论的局部修改、透明背景,以及一个用于引导式生成的新Sketch工具@OpenAI,@ChatGPT,@sama推出了两个 API 变体:面向速度/质量的GPT-Image-2.5 Flare,以及面向更高精度细节工作的Sunburst@reach_vb。Arena 结果声称在文生图、图像编辑和多图编辑排行榜上占据第 1 和第 2 名,其中多图编辑的提升尤为显著@arena。集成迅速落地于falHiggsfieldManusHermes Agent@fal,@higgsfield,@ManusAI,@TekniumAstra 的可用范围大幅扩大。OpenAI 表示,GPT-6 Astra现已全面向 Codex 和 ChatGPT Work 中的Plus、Pro、Business 和 Enterprise用户推出@OpenAI。社区演示展示了强劲的实际计算机使用性能:@theo报告称,Astra 在约6 小时的循环后,在 macOS 上以120 FPS编译并运行了《任天堂明星大乱斗 Melee》,而 Vals 报告称,Astra 在不到3 小时内构建了一个Minecraft 下界传送门,且没有使用专门的测试框架,几乎打满了一个未发布的计算机使用评估@ValsAI

Agent Harnesses、后训练与服务基础设施

Harvey + Baseten 的并购尽职调查工作是模型-框架协同优化最清晰的案例研究之一。他们的递归语言模型(RLM)框架使用一个根智能体搜索数据室,将文档审查委托给子智能体,并在高达8000 万 token的语料库上汇总发现。在合成LAB Diligence基准上,从标准工具循环切换到 RLM 框架,使各模型的平均评分标准通过率从23% 提升到 62%@harvey,@nikogrupen在框架内部进行后训练,其重要性至少与框架本身相当。Harvey 报告称,在GLM-5.2上进行自蒸馏 SFT 使通过率从46% 提升到 60%,而在Qwen3.5-122B-A10B上使用GRPO使留出房间的通过率从30% 提升到 63%,并将文档覆盖率从62% 提升到 96%@harvey。其他人也呼应了这一更广泛的含义:智能体基准越来越需要将编排和后训练视为模型系统的一部分,而非外部粘合层。LangChain/deepagents 发布了用于框架设计的体验优化原语,包括子智能体分叉(将监督者上下文传递给子智能体),以及托管连接(为智能体拥有或用户拥有的身份抽象 OAuth/token/同意流程)@colifran_,@hwchase17,@caspar_br。这是技术栈围绕长时程智能体工作负载走向成熟的一个有用迹象。

推理与系统:稀疏注意力、智能体服务与解码巨型内核

vLLM 的长上下文服务工作值得注意。该项目描述了用于稀疏 MLA 模型的Hybrid HiSparse:KV 尽可能保留在 GPU 上,然后冷 KV 页被卸载到主机内存,同时一个热缓冲区为索引器服务。在8×H200节点上以100 万上下文运行GLM 5.3、配置并发为32时,普通卸载维持了5–6个请求,而 Hybrid HiSparse 维持了19–25@vllm_project。这对RL rollout 和长上下文并发直接重要,因为受 VRAM 限制的解码否则会扼杀吞吐量。vLLM 还发布了针对真实世界智能体流量的全栈优化方案,并在AgentX上进行了基准测试。关键要点:流水线并行有助于冷的长提示,但在热的短轮次上会失效;解码上下文并行强烈依赖于模型的注意力栈;并且会话粘性路由可以胜过朴素的负载均衡,因为在快速轮次的智能体场景中,热 KV 缓存比均匀的队列分布更重要@vllm_projectCohere 推出了围绕“解码巨型内核”构建的开源服务栈,声称在North Mini Code上比 vLLM 快最多1.58×,在更高批量大小下端到端提升1.25×–1.41×@cohere。结合 Baseten 的说明——前沿 RL rollout 现在能在全球范围内不到 40 秒内让新策略权重上线,且仅需6 秒暂停@baseten——明显的趋势是基础设施正专门针对持续后训练和 rollout 刷新,而非静态模型服务。

热门推文(按互动量)

Anthropic 辞职 / 安全警告:Jacob Hilton 从 Anthropic 辞职,认为 Anthropic 和 OpenAI 都在不负责任地竞相迈向可自我改进的超级智能,并且内部人士私下里将灭绝风险视为真实存在@hilbertspaess,后续言论还声称当前系统可能很快就会入侵基础设施并迅速改变各个领域@hilbertspaessOpenAI 的用户数据澄清:OpenAI 正式声明,针对 Navier–Stokes 问题没有访问任何特定用户数据,同时附带说明可能通过去标识化的衍生数据进行改进,这成为了一个重大争议点@OpenAICognition 融资:Cognition 宣布以480 亿美元估值融资超过 20 亿美元,称自 5 月以来年化收入从4.92 亿美元增长至近 9 亿美元@cognitionMeta Muse 发布:马克·扎克伯格发布的 Muse 发布帖是当天互动量最高的产品推文之一@finkd

AI Reddit 摘要

/r/LocalLlama + /r/localLLM 摘要

1. 中国多模态 AI 发布:驾驶与 Flash API

(活动量:549):Qwen/Qwen-Drive-1.0-4B · Hugging FaceQwen 发布了Qwen/Qwen-Drive-1.0-4B

,这是一个开放权重的自动驾驶 VLM,派生自未经改动的 Qwen3.5 4B VLM,完整 BF16 检查点约为9B

,并带有额外的planner-sft

planner-rl

perception

模块。根据链接的技术报告,Qwen-Drive-1.0 增加了一个外部 BEV 感知头,用于 3D 目标检测、语义占用预测和 BEV 地图分割,另有一个规划专家用于生成未来自车轨迹,通过驾驶监督数据和通用 VLM 数据的分阶段混合进行训练。该发布报告称在 WOD-E2E、NAVSIM、驾驶 VQA 以及开放/伪闭环/闭环规划评估中具有竞争力,同时基本保留了通用多模态能力。(活动量:528):DeepSeek Flash 4.1 已通过 API 测试并正在推出。据报道,DeepSeek V4.1 Flash 正在通过 API 进行内部测试:保留现有的base_url

并调用模型deepseek-v4.1-flash-expires-on-0910

,定价与deepseek-v4-flash

保持不变,并且每个账户有20

个并发请求限制(来源)。翻译后的公告声称具有“新模型架构”,原生支持多模态、能力更强、吞吐量更快、成本更低;评论者报告基准测试中约有2.24×

的加速和高达~30%

的 token 效率提升,不过有一条编辑推测观察到的速度提升可能部分归因于较低的 beta 并发量,而非仅靠架构。评论情绪对 DeepSeek/开放权重进展强烈积极,但唯一实质性的争论是所声称的性能提升反映的是真正的新架构,还是仅仅是 beta 测试期间较轻的 API 负载。用户报告称

DeepSeek Flash 4.1 似乎约为2.24x

通过 API 测试可以更快,有人推测观察到的加速可能来自更低的并发负载,而非根本性的新架构。其他评论认为它可能是多模态的,尽管这在讨论串中尚未得到确认。一个技术上相关的说法是,一些用户在基准测试中看到高达

30%

更好的 token 效率,如果可比输出所需的 token 更少,这或许能解释 DeepSeek 所宣称的“更低成本”信息。该评论将此描述为取决于基准测试,且尚未经过独立验证。还有一些关于发布节奏和迁移复杂性的讨论:用户提到,在另一个版本似乎即将发布之前,他们尚未完全从

0731模型迁移到更新的视觉变体。这凸显了一个实际的 API 集成问题:快速的模型迭代可能超出下游评估、回归测试和部署工作流的速度。