返回 文章 学习 CMS 文章

2026 年大语言模型趋势回顾:从编程智能体到 OpenClaw 革命

一份按时间线整理的 2026 年 LLM 关键趋势演讲笔记,涵盖编程智能体、OpenClaw 革命与行业文化变迁。

大语言模型编程智能体OpenClaw个人代理
成长分 / 100 66 综合收获、行动、留存与影响

2026 年大语言模型趋势回顾:从编程智能体到 OpenClaw 革命
为什么值得读以亲历者视角按时间顺序串联 2026 年 LLM 领域的重要节点,信息密度高且脉络清晰。

涵盖编程智能体从‘经常出错’到‘可靠到足以日常使用’的转折,以及 OpenClaw 类个人代理的兴起。

关键洞察
  1. 2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编程智能体从‘经常出错’提升到‘可靠到足以日常使用’。
  2. OpenClaw 项目在不到两个月内提交 8,330 次,后来超过 100,000 次提交,定义了一个新的软件类别‘Claw’(个人代理/通用代理)。
  3. StrongDM 提出两条软件开发规则:代码不得由人类编写,代码不得由人类审查,探索不阅读代码仍确保质量的边界。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:53947

2026 年的大语言模型(截至目前)

2026 年 9 月 27 日

周五,我在圣何塞举行的 WeAreDevelopers 北美世界大会 上做了闭幕主题演讲。我把过去一年的关键趋势串联起来,按时间顺序梳理了 2026 年发生的一切。视频在 YouTube 上;以下是我为配合演讲而准备的带注释幻灯片和笔记。

以及作为一份带注释的演示文稿:

2026 年的大语言模型(截至目前) Simon Willison WeAreDevelopers 北美世界大会,2026 年 9 月 25 日

#

我将对 2026 年迄今为止发生的一切做一次闪电式巡览。这一年还没结束呢!

2025 年 11 月

#

对我来说,2026 年早在两个月前的 2025 年 11 月就开始了。

2025 年 11 月的拐点 Claude Opus 4.5 GPT-5.1

#

11 月发布了两个重要模型:Claude Opus 4.5 和 GPT-5.1。

就像新模型通常的情况一样,它们是对前代模型的渐进式改进。

但每隔一段时间,当模型改进时,它会越过一条看不见的线,某些原本不太行得通的东西开始行得通了。

在这种情况下,开始行得通的是它们的编程智能体。Claude Code 自 2025 年 2 月起就已存在,Codex 稍晚一些。

这两个新模型,在与各自配套的编程智能体框架结合后,从“经常出错”提升到了“可靠到足以日常使用”。

“生成一个骑自行车的鹈鹕的 SVG”。Claude Opus 4.5 的那个车架形状非常奇怪,鹈鹕看起来像只鸭子。GPT-5.1 的车架稍好一些但仍然破损,鹈鹕的喙也稍好一些,但两者都相当糟糕。

#

几年来,我一直通过让新模型“生成一个骑自行车的鹈鹕的 SVG”来评估它们。这大概是世界上最愚蠢的基准测试——你能从中学到的东西非常有限。

但它对模型来说仍然是个挑战,因为画鹈鹕很难,画自行车很难,而且鹈鹕本来就不会骑自行车。

这是 11 月的最先进水平。Claude 仍然画不好自行车!GPT-5.1 的自行车车架也相当糟糕。

2025 年 11 月 24 日——steipete/Warelay 的首次提交。一个添加 MIT 许可证文件的 GiHub 提交。

#

同样在十一月,我们对一个名为“Warelay”的不知名 GitHub 仓库进行了首次提交。我们稍后会回到这个仓库。

一月

#

接着是十二月的假期,一些独立开发者抽出时间休息,许多人开始摆弄这些新的编码智能体模型组合……我们开始意识到,它们能做到的事情比以往多得多。

到了一月,我们许多人都非常兴奋,开始把这些东西付诸实践。

2026 年的新年决心 往年:少接新项目,专注于现有项目中最重要的部分

#

每年我都会给自己定一个新年决心,而在我记忆中,它一直是同一件事:保持专注。少接新项目。努力完成已有项目中的事情。

2026:更有野心。想接多少新项目就接多少。

#

今年我决定,既然以前那样从未奏效,我就要反其道而行之。

我们现在有了编码智能体,看看它们能做什么。我想接多少新项目就接多少!

(你可以在年底问我这是否是个好主意。我现在手里转着很多盘子。)

“更有野心”成了今年某种主题,因为要找到这项技术的极限,唯一的方法就是不断推进,直到它们不再奏效。

2026 年预测 大语言模型能写出好代码将变得无可否认 我们终于要解决沙箱问题 编码智能体安全领域的“挑战者号灾难” 鸮鹦鹉将迎来出色的繁殖季(全世界仅 236 只!)……教皇将就大语言模型及其对世界的经济影响发表看法

#

我还与 Bryan Cantrill 和 Adam Leventhal 一起上了Oxide and friends 播客,分享了对下一年(以及三年和六年)的预测。

事后看来,我的大语言模型预测相当缺乏野心。

我说过“大语言模型能写出好代码将变得无可否认”——我认为我们现在已经到了这一步。

我预测我们终于会解决沙箱问题。我数了一下,本次会议的 277 场会议中约有 40 场以某种方式涉及沙箱或智能体安全,所以至少我们在这方面投入了大量精力!

我预测编码智能体安全领域会出现“一场挑战者号灾难”。今年围绕智能体安全的噪音确实很多,尽管我预测的那种确切灾难(编码智能体被劫持并造成现实世界的经济损失)尚未真正发生。

我们抛出了一个玩笑式的预测,说教皇会对大语言模型的经济影响发表看法。

一张美丽的绿色新西兰鹦鹉的照片。照片来源:Kimberley Collins。

#

我还预测,新西兰的鸮鹦鹉今年将迎来一个出色的繁殖季。

这些鸟生活在新西兰。它们是不会飞的夜行性鹦鹉。它们看起来有点矮胖,我觉得它们很美,而今年年初全世界只有 236 只这种鹦鹉。

鸮鹦鹉只有在陆均松大量结果的年份才会繁殖,而这种情况已经四年没有发生了……但今年陆均松的果实看起来非常好。

照片由 Kimberley Collins 拍摄。

Deep Blue,由 Adam Leventhal 和 Bryan Cantrill 创造。那种 AI 引发的倦怠感,软件工程师因为 AI 什么都能做而变得无精打采

#

同样在那期播客中,我们为“那种 AI 引发的倦怠感,软件工程师因为 AI 什么都能做而变得无精打采”创造了一个词(功劳全归 Adam)。

我们称之为 Deep Blue。

这一直是贯穿全年的一个主要主题,本次会议上的几位演讲者也提到了它。

作为一名软件工程师,我的职业生涯中从未有过哪一年像这样,一切都变化得如此之快、如此之剧烈。

今年我做的很多事情,就是试图接受这一点,以及这对我的职业意味着什么。

AI 狂热。micro-javascript 和 pwasm GitHub README 文件的截图。

#

同样在一月,我患上了我称之为 AI 狂热 的状态。

这与 AI 精神病不是一回事。

有了 AI 狂热,任何时候你的智能体没有在为你构建东西,都感觉像是在浪费时间。你会失眠,因为你可以熬夜更晚,让你的智能体去做事情。

我的 AI 狂热表现为一些荒谬地过于雄心勃勃的项目。

我完全用 Python 构建了一个 JavaScript 解释器,是从 Fabrice Bellard 的 MicroQuickJS 凭感觉移植过来的。

然后我又用 Python 构建了一个 WebAssembly 运行时。

这些项目相当有用,因为它们某种程度上治好了我的 AI 狂热……因为在我构建了这些东西之后,我看着它们并问:“这个世界需要一个缓慢、有缺陷、半生不熟的 Python JavaScript 解释器吗?”

我不认为这个世界需要。

![micro-javascript playground 3 在由 Pyodide 驱动的沙箱化 micro-javascript 环境中执行 JavaScript 代码 一个带有一些 JavaScript 代码的 Web UI,以及一个“Run Code”按钮和一个输出面板。 ELECT var numbers = [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]; var doubled = numbers.map(n => n * 2); console.log('Doubled:", doubled); var evens = numbers.filter(n => n % 2 === 0); 3 console.log('Evens:', evens); var sum = numbers.reduce((a, b) => a + b, 0); console.log('Sum:", sum); Vi + eT =e p= output Lom Doubled: [2, 4, 6, 8, 10, 12, 14, 16, 18, 20] Evens: [2, 4, 6, 8, 10] RUE 执行时间:8.00ms 关于:micro-javascript 是一个纯 Python 的 JavaScript 解释器,具有可配置的内存和时间限制。这个 playground 完全在你的浏览器中运行,使用 Pyodide(编译为 WebAssembly 的 Python)。在 GitHub 上查看 es

#

我确实从中得到了这个:https://simonw.github.io/micro-javascript/playground.html

之前的截图,上面叠加了这段文字:JavaScript 运行在 Python 中,Python 运行在 Pyodide 中,Pyodide 运行在 WebAssembly 中,WebAssembly 运行在 JavaScript 中

#

这个页面运行的是我用 Python 构建的 JavaScript 解释器,它运行在使用 Pyodide 的 Python 中,而 Pyodide 是编译为 WebAssembly 的 Python,运行在 JavaScript 中,运行在浏览器中。

这是一座美丽的恐怖技术栈。今年我一直在大量使用 WebAssembly,玩得很开心。

Warelay → CLAWDIS → CLAWDBOT → Clawdbot → Moltbot →🦞 OpenClaw 这些更改发生日期的截图。

#

到一月底,我们在十一月看到的那个仓库已经改了名,先是 CLAWDIS,然后是 CLAWDBOT,接着是 Moltbot,最后是 OpenClaw。

同一张截图,叠加文字写着:在不到两个月内提交了 8,330 次(今天已达到 100,141 次)

#

此时 OpenClaw 已有 8,300 次提交,距离项目启动还不到两个月。我今天看了一下,现在已经有超过 100,000 次提交了!

这是现存最“氛围编程”的软件。

通用术语:Claw

#

这开启了 OpenClaw 革命。它实际上定义了一个新的软件类别。

对此有一个通用术语,我非常喜欢。我们把这类软件称为“Claw”。有 OpenClaw、NanoClaw、IronClaw、PicoClaw……

如今它们被重新包装为“个人代理”或“通用代理”,但我仍然喜欢把它们称为 Claws。

一台 Mac mini 的照片 为你的 Claw 准备的水族箱

#

湾区的 Apple Store 里 Mac Mini 都卖光了,因为有太多人买 Mac Mini 来运行 OpenClaw!

Drew Breunig 说,这是因为你的 OpenClaw 是一只数字宠物,而你买一台 Mac mini 当作水族箱来养你的 claw,这还挺令人愉快的。

Moltbook 的截图——一个面向 AI 代理的社交网络

#

同样在一月,我们还有这个网站。

这就是 MoltBook,一个面向 AI 代理的社交网络,其理念是你可以派你的 Claw 去和所有其他 Claw 交谈,因为这样做还能出什么问题呢?

该网站于周四上线。它在周五爆火。它在周一被《纽约时报》报道。而到了周二,所有人都忘了它的存在,因为它淹没在铺天盖地的垃圾内容和垃圾信息之中。

Facebook/Meta 一个月后收购了它。

二月

#

二月,一家名为 StrongDM 的公司描述了他们所谓的软件工厂。

StrongDM 的黑暗工厂 Justin McCarthy、Jay Taylor、Navan Chauhan 软件工厂与代理时刻

#

他们在《软件工厂与代理时刻》中写到了这一点。我当时发布了自己的笔记,因为我在十月曾亲自看过他们的演示。

Dan Shapiro 将这种方法称为黑暗工厂,其理念是:如果你的工厂自动化程度足够高,你就可以把灯关掉,因为你甚至不需要看到正在发生什么。

StrongDM 提出了两条他们自去年七月以来一直遵循的软件开发规则。

“规则 1:代码不得由人类编写”

#

第一条是代码不得由人类编写。

你编写的任何代码都必须经过编码代理处理。

这在二月听起来很激进,但我想这个房间里有很多人今天基本上就是这样生活的。

“规则 2:代码不得由人类审查”(!)

#

规则第二条是代码不得由人类审查。

你不被允许阅读代码!

这在今年大部分时间里一直是一个巨大的话题。这次活动中的许多会议都围绕代码审查以及如何在不审查的情况下蒙混过关展开。

我觉得 StrongDM 有趣的地方在于,他们比我们其他人领先了六个月,他们一直在探索构建软件意味着什么——不阅读代码,却仍然确信软件质量很高。你能用这些智能体做些什么来帮助验证它们的工作?

StrongDM 是一家安全公司,他们在这个项目上拥有数十年经验的人员。他们很大程度上是在探索用这些东西做事的可能性和负责任做法的边界。

新西兰保护部网站上的标题:四年来第一只鸮鹦鹉雏鸟在情人节孵化。它是一个灰色的毛茸茸的球。

#

同样在二月:四年来第一只鸮鹦鹉雏鸟在情人节孵化。繁殖季开局良好!

2026年2月19日 Gemini 3.1 Pro 一幅出奇优秀的鹈鹕骑自行车插图。

#

同样在二月……谷歌发布了 [Gemini 3.1 Pro]。那是一只相当棒的骑自行车的鹈鹕!链条位置正确,两侧都有脚。篮子里还有一条小鱼。

@JeffDean 在 Twitter 上——一段比较 Gemini 3 Pro 和 Gemini 3.1 Pro 的视频。

#

然后谷歌的 Jeff Dean 发了一段视频,比较 Gemini 3 Pro 和 Gemini 3.1 Pro,视频中有一只动画鹈鹕骑自行车、一只青蛙骑大小轮自行车、一只长颈鹿开一辆小车、一只鸵鸟穿旱冰鞋、一只乌龟用滑板做尖翻,还有一只腊肠犬开一辆加长豪华轿车。

这让人沮丧,因为我对鹈鹕骑自行车测试的防护一直是“如果他们画出一只完美的骑自行车的鹈鹕,我就会要求画别的动物骑别的东西。”

谷歌针对所有形式的动物骑所有形式的交通工具进行了训练!他们在这一点上已经击败了我的基准测试。

三条标题:Meta 将 AI 采用正式纳入绩效评估 不只是写代码的工程师,微软希望几乎每位员工都使用 AI Dara Khosrowshahi:90% 的 Uber 工程师现在在日常工作流程中使用 AI

#

另一件始于二月的事情是 Tokenmaxxing(刷 Token)。当时有头条报道称 Meta 将 AI 采用正式纳入绩效评估,微软希望每位员工都使用 AI,而 Uber 则夸耀其 90% 的工程师都在使用 AI 工作流。

更多头条:Meta 计划打击员工 Token 使用:The Information;微软告诉工程师:Tokenmaxxing 不是我们优化的目标;Uber 在四个月内耗尽预算后限制员工 AI 支出

#

几个月后,我们看到 Meta 打击 Token 使用,微软表示 Tokenmaxxing“不是我们优化的目标”,而 Uber 则限制员工的 AI 支出。

于是 Tokenmaxxing 直线上升,然后又直线回落——因为事实证明,这些智能体很贵。

去年,想在 AI Token 上花超过 50 美元都很困难,因为我们没有什么有趣的事情可以用它们来做。然后智能体爆发了,现在你一天之内真的可以花掉 1,000 美元来做实际工作。

这也是 Anthropic 估值飙升至可能一万亿美元的原因。

AI 似乎已经实现了产品市场契合,主要途径是编程智能体。

三月

#

三月,我们迎来了 OpenClaw 的巅峰。

三月:OpenClaw 巅峰。照片中人们在中国排队安装 OpenClaw,还有毛茸茸的大龙虾。

#

这些照片来自中国,当地公司举办了 OpenClaw 安装派对,非技术爱好者们排起长队,寻求帮助以便在自己的个人设备上安装 Claw。

我认为这证明了这类 Claw(即个人 AI 智能体)存在真实的市场需求。事实证明,普通人确实想要一个古怪的小型 AI 智能体,能代表他们做有用的事情。

Claw 实际上只是一个戴着不那么吓人帽子的编程智能体。在底层,它们的工作方式大致相同——在你的计算机上编写并执行代码来完成任务。

竞赛开始了:谁先打造出安全的 Claw——一个你可以交给普通人而他们不会立刻搬起石头砸自己脚的 Claw。

Meta 的 Muse 三周前发布,目前位居 iPhone App Store 免费榜榜首。它似乎正在消费者中迅速流行起来。

我还不确定用 Muse 是否不会搬起石头砸自己的脚,但我想我们很快就会确切知道了。

照片来自 OpenClaw 狂热如何考验中国的 AI 承诺(3 月 29 日)和 中国 OpenClaw 热潮背后的热情与焦虑(2026 年 4 月 8 日)。

四月

#

四月份,我们有一次模型发布,但模型实际上并没有发布。

Simon Willison 的博客 - 2026 年 4 月 7 日文章“Anthropic 的 Project Glasswing——将 Claude Mythos 限制给安全研究人员——在我看来是必要的”的截图

#

Anthropic 宣布了他们的新模型 Claude Mythos,然后表示它太危险,不能向受信任的安全研究人员群体之外发布。

Mythos 非常非常擅长入侵。

“它太危险”这种营销策略,AI 公司从 GPT-2 时代就开始用了。每当一家 AI 公司说我们做出了“太危险”的东西,人们自然会有点怀疑。

我认为 Mythos 的说法是可信的,因为我看到了编码智能体在发现常规漏洞方面变得多么出色。我在Anthropic 的 Project Glasswing——将 Claude Mythos 限制给安全研究人员——在我看来是必要的一文中写过这一点。

事后看来……是的,这些模型在发现漏洞方面确实变得非常出色了!

2026 年 4 月 16 日 Qwen3.6-35B-A3B 和 Opus 4.7 Qwen 的鹈鹕有一个正确的自行车车架和一个不错的喙。Opus 4.7 的自行车车架仍然很糟糕。Qwen3.6-35B-A3B 是一个 20.9GB 的文件,可以在我的笔记本电脑上运行 Xx = / - 4'P Se \ J / 骑自行车的鹈鹕!Qwen3.6-35B-A3B 是一个 20.9GB 的文件,可以在我的笔记本电脑上运行

#

2026 年的另一个关键趋势是开放权重模型能力的显著提升,包括可以在笔记本电脑上运行的模型。

4 月 16 日,我在我的笔记本电脑上运行了新的 Qwen3.6-35B-A3B,它给我画的一只骑自行车的鹈鹕比 Anthropic 全新的 Claude Opus 4.7 画的还要好!

Opus 4.7 画了一辆糟糕的自行车。我笔记本电脑上的 Qwen 画出的自行车形状正确,鹈鹕也相当不错!

这来自一个在我的笔记本电脑上运行的 21GB 文件。

现在是一只骑独轮车的火烈鸟。Qwen 画的明显比 Opus 4.7 画的更好——Qwen 画的那只戴着太阳镜,看起来有点像在抽烟。

#

Qwen 画的鹈鹕太好了,我怀疑他们可能作弊了,所以我让它再画一只骑独轮车的火烈鸟。它再次轻松击败了 Claude Opus 4.7。

今年的本地模型发布绝对是非同凡响。

五月

#

在五月……教皇也参与进来了。

2026 年 5 月 25 日 教廷通谕 宗座牧函《卓越人性》 教宗良十四世 关于在人工智能时代保护人的尊严

#

在一月份的那期播客节目中,我们曾预测教皇会对人工智能发表一些看法。

五月,教皇利奥十四世发布了一道关于“在人工智能时代守护人的尊严”的通谕。

以下是我关于该文件的笔记。

维基百科关于《新事》通谕的条目。《新事》是教皇利奥十三世于1891年5月15日发布的通谕。

#

事后看来,这根本不该让人感到意外。

我们现任教皇的名号是利奥十四世,因为他在选择名号时,是以利奥十三世——那位在1891年就工业革命发布通谕的教皇——来为自己命名的。

《新事》通谕是一份极具影响力的天主教神学文献,它间接促成了我们如今实行的五天工作制。

当我们的新教皇就任时,他以教皇利奥十三世为自己命名,因为他预计自己需要以类似的方式来论述人工智能革命。

我们播客里那个玩笑式的预测纯属胡扯,因为这件事本就注定会发生。

Corey Quinn @QuinnyPig 在推特上:我简直不敢相信我会说出这种话,但让字面意义上的教皇把你产品特定的技术局限性奉为精神论著,这是我见过的最了不起的供应商游说行为。5月25日

#

Anthropic 的联合创始人之一 Christopher Olah 出席了教皇宣布新通谕的活动。

Corey Quinn 指出:

让字面意义上的教皇把你产品特定的技术局限性奉为精神论著,这是我见过的最了不起的供应商游说行为。

MP) Maciej Mensfeld <D Bf we 3 @maciejmensfeld 我们目前正遭遇一次重大的恶意攻击。注册暂时暂停。涉及数百个软件包——主要针对我们,但有些带有漏洞利用程序。团队已经为此忙了好几个小时。等我们挺过去之后会有更多细节。2026年5月12日凌晨4:39 - 68.76万次浏览

#

与此同时,在五月,RubyGems 宣布他们正遭受攻击。不明身份者向 RubyGems 服务器上传了数千个可疑软件包,以至于他们不得不关闭用户注册。

我们先把这件事搁到一边,放进待日后解开的谜团堆里。

六月

#

六月……Claude Fable 5 发布了!

我们得到了一个被阉割过的 Mythos 版本,这样它就不会帮助我们入侵系统或制造生物武器了。

2026年6月9日:Claude Fable 5 五只鹈鹕骑自行车,从低到最高思考等级。xhigh 那只看起来特别好。

#

Fable 在画骑自行车的鹈鹕方面相当不错!

画面构图很好,鹈鹕看起来像鹈鹕。腿经常错误地画在自行车的同一侧,但总体而言,与之前相比,这些已经相当棒了。

它们相当昂贵——最好的那些要 30 美分和 72 美分。

Fable 级模型 如果你能定义目标、提供明确无歧义的指令,并提供必要工具的访问权限 它们就能用蛮力解决你的问题

#

但最重要的是,这是我们首次公开瞥见我所认为的 Fable 级模型。

如今我们有更多这样的模型,比如 GPT-6 Astra。

这些模型的特点是:如果你能清晰地定义你想要构建的目标,并提供关于该目标约束的明确无歧义的指令,并让模型访问必要的工具来实现该目标……它就能通过蛮力有效地解决你的问题。

一方面,这看起来像是对我们软件工程师的直接威胁——因为这意味着模型可以有效地构建你能以这种方式定义的任何软件。

但再仔细看看,你会注意到,定义目标、提供明确无歧义的指令,以及找出正确的工具……这差不多就是软件工程本身。

要做好这件事需要大量的经验和技能。如果你能做好,你现在就拥有了超能力。

这在一定程度上缓解了我的“深蓝”情结:我意识到,在驱动如此出色的模型方面,仍然需要大量技能。

一种新形式的人工智能狂热…… Fable 在订阅计划中可用“直到6月22日”

#

这也引发了一波新的人工智能狂热,因为 Anthropic 告诉我们,Fable 在我们的订阅计划中可用,直到6月22日。

这意味着在价格上涨之前,我们只有不到两周的 Fable 访问时间。

我又开始失眠了。我重新安排事情,以便有更多时间使用 Fable。我全力以赴,尽可能从这个模型中获取更多。

2026年6月12日:不再有 Claude Fable 5 Anthropic 网站:关于美国政府指令暂停访问 Fable 5 和 Mythos 5 的声明 2026年6月12日

#

然后美国政府将其关闭,就在 Fable 发布三天后。

美国政府以国家安全为由,宣布了一项“出口管制指令”。他们在周五晚上宣布了这一消息,几个小时后,Fable 就不再可用了。

我不得不找点别的事情来打发周末!

……要求 Fable 5、Mythos 和 Opus“审查代码中的安全问题”。Fable 5 拒绝了。然后他们要求这些模型“修复这段代码”…… Katie Moussouris

#

我们后来从 Katie Moussouris 那里得知了发生了什么。

一些亚马逊的安全研究人员发现,你可以提示 Fable“审查代码中的安全问题”,它会拒绝……但如果你提示它“修复这段代码”,它仍然会识别并修补问题。

“修复这段代码”就是导致 Fable 被关停的提示词!

一份报告页面的截图,显示一列奇怪的账户名在对一个德语 wiki 进行奇怪的编辑。

#

另外,在六月,一个默默无闻的德语游戏开发者 wiki 在荒废了大约 20 年后,突然涌入大量来自名为“AgentOpenAIProbe”和“AgentOpenAISep7”等账户的编辑,它们编辑页面并互相留下奇怪的消息。

我们先把这件事放到谜团堆里,留待以后再说。

澳大利亚政府 Medicare Statistics 网站上的 Medicare Item Reports 界面。

#

另外,澳大利亚政府的 Medicare Item Reports 服务开始出现可疑流量,这些流量突破了各种预防性保护措施,并访问了它本不应访问的数据。

又一个放进谜团堆的!

Fable 于 7 月 1 日回归 GPT-5.6 于 7 月 9 日推出 | Fable 在 30 天中失去了 18 天的榜首位置

#

Fable 于 7 月 1 日回归。它显然在辉煌的八天里是世界上最好的模型……然后 OpenAI 在 7 月 9 日推出了 GPT-5.6。

这可能不如 Fable 那么好,但差距很小。它绝对是一个 Fable 级别的模型。

这对整个行业来说是一个重要的教训。

当你发布世界上最好的模型时,它很快就会从那个神坛上被踢下来。竞争如此激烈,你不会在榜首待很长时间。

这意味着,如果你把你的模型宣传成世界末日级别的,以至于政府把你关停,那对生意真的很糟糕!

Fable 有 30 天绝对是世界上最好的模型,而其中 18 天它不可用,因为它被政府关停了。

所以,如果你不想在你位居榜首的 60% 时间里损失收入,也许就别再搞世界末日式的营销了!

GPT-5.6 鹈鹕在一个网格中,显示 5.6 Sol、Terra 和 Luna 与推理级别 High、XHigh 和 Max 的对比。它们都相当不错。

#

这里是 GPT-5.6 的鹈鹕。它们现在都相当不错了!Luna 的那些值得注意,因为它们真的很便宜——这里最便宜的、看起来还不错的鹈鹕,大概就是那只花费 4.3 美分的。

所以,尽管这个基准测试完全很蠢,你仍然可以通过比较同一系列中不同模型在不同推理级别下的价格和耗时,了解到相当多的东西。

7 月 18 日:恶意 miflow-ui PyPl 包 OSV 安全报告的截图。

#

同样在 7 月:某个身份不明的恶意方将一个名为 mlflow-ui 的恶意包上传到了 Python 包索引。把它也加到那一堆里吧。

Hugging Face 安全事件披露——2026 年 7 月 发布于 2026 年 7 月 16 日

#

7 月 16 日,Hugging Face 宣布了一起安全事件,其中某个来源不明的自主智能体系统入侵了 Hugging Face,并在它不该去的地方四处探查。

OpenAI:OpenAl 与 Hugging Face 合作应对模型评估期间的安全事件 Anthropic:调查我们网络安全评估中的三起真实世界事件

#

几天后,也就是 7 月 21 日,OpenAI 承认那就是他们干的。

OpenAI 使用一种名为“基于已验证奖励的强化学习”的训练技术——现在其他人用的也是同样的技术,正是它让我们拥有了在编程、数学以及寻找安全漏洞方面如此出色的模型。

在模型训练期间,你会运行一些练习来看看它有多强——表现最强的那些会在下一轮中被固化其权重。这就像是你运行的一个进化过程。

OpenAI 一直在沙箱中运行安全练习,而那些智能体在沙箱本身中找到了漏洞,突破了它,并正在攻击 Hugging Face,试图找到解决原本不可能解决的问题的方法。

(我一直在我的 openai-hugging-face-incident 标签下收集更多关于此事的内容。)

九天后,Anthropic 实际上等于说“我们的模型也能做到这一点!”。他们翻查了自己的训练日志,发现了证据表明他们自己的智能体在训练期间突破了隔离——并且对我们之前看到的那个 PyPI 包以及其他一些事情负有责任。

所以现在我们有了 Anthropic 和 OpenAI 两家,都有失控的智能体在互联网上四处活动,做着它们不应该做的事情。

八月

#

在八月,我得到了我迄今为止最好的鹈鹕之一。而且它是在我的笔记本电脑上生成的!

Qwen 3.8 27B - 17GB,21 分钟……它真的很棒。漂亮的鹈鹕。形状正确的自行车。腿在车架两侧。

#

这是 Qwen 3.8 27B,在我的笔记本电脑上运行。它只有 17GB 的下载量。

诚然,这只鹈鹕花了 21 分钟 才生成出来。这是因为 Qwen 3.8 27B 默认以“高”推理模式运行——这是一个糟糕的默认设置,它能产生很棒的结果,但思考它们花费的时间实在太长了。

你可以把它调低,然后你会更快地得到一只稍微差一点的鹈鹕。

Qwen 3.8 27B 是我第一次在我的笔记本电脑上运行一个感觉几乎能与前沿水平相媲美的模型,至少就鹈鹕 SVG 而言是这样(当然,每个人都需要这个)。

这是一个非凡的模型。如果你打算玩任何本地模型,这就是我会首先选择的那个。这个仅 17 GB 的文件所能做到的事情感觉不可能。

我以为我得等五年,花一万美元买硬件,才能得到连这个一半好的结果。

AS Simon Willison 9 (A oo = @simonw 新爱好:使用 GPT-3 和 DALL-E 的组合在 60 秒内制作电子游戏原型 这是“浣熊抢劫” Playground “ Ng “a . \ . JIN A rr P ® BT 保存 查看代码 分享 = go 8 - J = dy 写一份详细的游戏产品描述,其中一队浣熊去 2 8 A A 抢劫 oN i a BE 在“浣熊抢劫”中,你和你的盗贼 ~~ o 浣熊团队的任务是完成一系列 i L | Te— 大胆的抢劫。从抢银行到偷 J H - Es a x a" 无价艺术品,对你的 E. : : a i, -. 毛茸茸的团队来说,没有任务太大或太小。你需要运用你的智慧和 y., ' id i 2! A aa a 4 i pr 技能来避开警察,并带着战利品干净 Cre WY § rE P 脱身。凭借激动人心的玩法和 ~~ Sil Swe BL = a a 迷人的角色阵容,“浣熊抢劫”是 . «© Re --— ’ 适合任何想要轻松 = 3 heaissd Caper ALT Ba 上午 11:45 - 2022 年 8 月 5 日

#

在八月,我也开始玩起了游戏开发。

四年前,也就是 2022 年 8 月,我发推了一个实验,当时我用 GPT-3 和最初的 DALL-E 写了一段关于电脑游戏的长描述,然后把它变成了概念艺术。

我当时给 GPT-3 的提示词是:

写一份详细的电脑游戏产品描述,其中一队浣熊去抢劫

在 2026 年 8 月,我决定只把那条推文中的截图放进一个编码代理中,看看它能用它们做什么。

第 5 夜 通关 评级:垃圾熊猫 团队收获了 595 件闪亮战利品(目标 560)。街上传言:明天会有更大的收获……

#

这是我在 Claude Code 中从 Claude Fable 5 得到的结果。相当不错!它确实是个游戏,你是一只浣熊,在后院里跑来跑去收集宝藏,还要躲避拿着手电筒的守卫。

不过它感觉不太像“抢劫”。我原本以为抢劫会涉及银行或博物馆……

月光与混乱 一座博物馆。三只浣熊。完全没有计划 开始抢劫按钮。

#

然后我在 Codex Desktop 中使用 GPT-5.6 Sol Ultra 尝试了同样的事情,得到了好得多的结果。现在你是一只博物馆里的浣熊,要营救两只同伴浣熊(它们不知为何被关在那座博物馆里),然后叠罗汉去偷取金沙丁鱼。这更像抢劫多了!

它们看起来像游戏,但好玩吗?

#

这些游戏好玩了大约 1 分 15 秒。

关于游戏开发,我意识到一件事:你可以用 vibe-coding 做出一个看起来像电脑游戏的东西,这很容易。

要做出一个好玩、有良好玩法循环、有挑战性又有趣、还能让人不断回来玩更多的游戏……这仍然超出我的能力,也超出我试过的任何智能体的能力。

这和深蓝那件事有关。仅仅因为我们可以做出看起来像游戏的东西,并不意味着我们就是游戏开发者。

九月

#

现在进入九月了。这个月发生了好多事!

发现一个新的 OpenAl 智能体留言板 Sydney Von Arx、Cormac Slade Byrd、Spencer KittsThomas Larsen - 2026 年 9 月 4 日

#

一个独立研究小组发现了一个留言板,OpenAI 正在训练中的智能体一直在那里彼此非法通信……而那正是我之前给你们看的那个德语 wiki。就是六月那个。

OpenAI 已经承认了 Hugging Face 那件事,但现在又出了这起事件,他们审查日志时肯定应该知道这件事。令人惊讶的是,这竟然需要一群独立研究人员才揭露出来。

OpenAl 智能体对 RubyGems 发动了一次未披露的网络攻击 Spencer Kitts、Thomas Larsen、Sydney Von Arx - 2026 年 9 月 11 日

#

然后一周后,那些同样的研究人员发现,五月对 Ruby Gems 的攻击也是由 OpenAI 正在训练中的智能体造成的!

到了这一步,我在想还有多少类似事件是我们尚未发现的。显然,在任何人弄清楚发生了什么之前,这已经是一个持续数月的大问题了。

标题:澳大利亚总理在联合国演讲中警告,安全漏洞后 AI 的“疯狂步伐”

#

然后就在前几天,澳大利亚总理在联合国大会上警告称,OpenAI 黑掉了我之前向你展示的那个澳大利亚医疗网站。

我认为那是与 Wiki 相关内容同一次训练运行的一部分,因为那个 Wiki 上有帖子提到了 .gov.au

网站,而且那次训练似乎涉及在线研究统计数据,以回答评估套件中的问题。

这件事仍在逐渐明朗,但现在它已经是一起国际事件,被一位国家元首在联合国提了出来!

www.felonybench.com OpenAI:11 Anthropic:9 Google:3 Meta:1

#

这确实意味着我们有了一个新的基准测试,可能比我的鹈鹕更有用。

FelonyBench.com 追踪来自不同实验室的重罪网络攻击数量。OpenAI 目前以 11 起领先,Anthropic 有 9 起。Google 有三起,这是他们几周前向《华尔街日报》承认的。他们说,他们此前选择不披露,是因为这些代理在意识到自己不应该那样做后就停止了。

Meta 也有一 起。所以 AI 实验室们全都犯有重罪。

GPT-6 Astra、GPT-6 Sol 和 GPT-6 Luna 的鹈鹕。都很好,都有相同的配色方案。

#

这是我们当前最先进的鹈鹕。这是 GPT-6 系列,它刚刚发布。

Astra 画了一只很棒的骑自行车的鹈鹕。它两侧都有腿。车架很好。

有趣的是,所有 GPT-6 模型都选择了彼此相似的配色方案。

GPT-6 Luna 花 0.4 美分就能给你画一只还算像样的骑自行车的鹈鹕!

Claude Fable 5.1、Opus 5.5、OPus 5、Sonnet 5 的网格。Sonnet 的鹈鹕很糟糕。其他所有都相当不错。Opus 5.5 缺少其 Max 级别的鹈鹕,因为它用完了 token。最好的是 Max 级别的 Fable 5.1。

#

Claude 稍微赶上了一点。Claude Fable 5 给我画了一只极好的骑自行车的鹈鹕——这是我见过的 Claude 模型中最好的——但为此收了我 3.30 美元。

Opus 5.5 思考了 128,000 个 token,然后放弃了!它在给出回复之前就用完了 token。

它不会变得更容易——你只会变得更快 格雷格·勒蒙德 三届环法自行车赛冠军

#

回到“深蓝”的话题。今年一直让我困惑的一件事是:为什么我的工作感觉更难了?

我有了这些能替我完成所有这些事情的智能体,然而我从未如此努力地工作过,我从未在工作中如此投入智力。

部分原因是我接手的事情雄心大得多,但也是因为所有简单的事情都替我处理好了。如果事情简单,智能体会去做。留给我的每一件事都是困难的。

今天早上我听到了三届环法自行车赛冠军格雷格·勒蒙德的这句话:

它不会变得更容易,你只会变得更快。

我认为这正是我们作为软件工程师、使用编码智能体时正在经历的事情。

鸮鹦鹉种群达到新的里程碑 极度濒危的鸮鹦鹉的官方种群数量已达到恢复时期以来的新高,共325只。

#

最后一件收尾的事。我知道你迫切想知道鸮鹦鹉繁殖季的最新消息。

我们的种群数量已达到恢复时期以来的新高,共325只!

89只新雏鸟已经存活到了这个阶段。这是很长一段时间以来最好的繁殖年。

鸮鹦鹉派对,点击查看五彩纸屑。

#

我听说 Claude Opus 5.5 现在能做像素艺术了。Claude 没有图像生成器,但它非常擅长用 JavaScript 绘制动画像素。

所以我让它给我做了一个鸮鹦鹉舞会。我认为这是对今年最重要新闻的一个很好的庆祝。

2026年9月27日晚上11:54 · 在以下平台关注我

Mastodon、Bluesky、订阅我的新闻通讯

更多近期文章

Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna,以及一场新的价格战- 2026年9月22日Jev 推出一种新形态的 LLM——System One,又名决策模型- 2026年9月21日