返回 讨论 学习 CMS 文章

Qwen 3.8 27B 在 RTX 3090 上自主运行 63 小时尝试解决黎曼猜想

一次 63 小时、5000 万 token 的自主数学攻关实验,虽未解决黎曼猜想,却展示了开源模型在长时程任务中的自我纠错与持续探索能力。

Qwen本地大模型自主智能体黎曼猜想
成长分 / 100 72 综合收获、行动、留存与影响

为什么值得读了解开源模型在超长时程自主任务中的真实表现,而非仅看基准测试分数。

观察模型在未解决问题上的行为模式:不幻觉答案、持续尝试新想法、多次自我纠错。

关键洞察
  1. Qwen 3.8 27B 4bit 量化版在 100K 上下文窗口下自主运行 63 小时,消耗超过 5000 万 token。
  2. 模型未能解决黎曼猜想,但实验展示了其内部工作、记忆组织与使用的策略。
  3. 模型从未幻觉出一个答案,也从未停止尝试新的想法来解决它。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1514

我让 Qwen 3.8 27B 4bit 量化版本以 100K 上下文窗口自主运行了 63 小时(超过 5000 万 token),试图解决 RH。

当然它没有解决,但实验仍然展示了它的内部工作、记忆组织、使用的策略等等。

有趣的是,它从未幻觉出一个答案,也从未停止尝试新的想法来解决它。

它多次纠正了自己的错误。

我真的希望,在未来 12 个月内,某个未解决的千禧年大奖难题能被一个由开源模型驱动的智能体或智能体集群解决。

如果你想查看它的内部记忆、代码、策略等,我把所有内容都发布在 HF 上了:

https://huggingface.co/datasets/gr0010/artificium-riemannhypothesis-experiment

我的下一个目标是实际使用一个智能体——也许由更聪明的开源模型如 GLM 5.3 flash 驱动,或者一个智能体集群——来解决一个开放的数学问题。

如果你尝试过类似的事情,建议接下来攻克什么问题,或者有任何问题,请告诉我。

如果你有 GPU,考虑联系我,我们可以运行多个智能体组成集群,让它们攻克一个简单但开放的数学/编程问题。

阅读更多

讨论精选

LetsGoBrandon4256 (346↑):有趣的是,它从未幻觉出一个答案 它多次纠正了自己的错误。

真心提问:你在该领域(这里是数论)是否有足够的知识,能在 AI 犯错时指出错误?