这已经是绝对怪兽级的一周了,从新的中国开放权重前沿实验室首次登顶,到Anthropic 和 OpenAI 的新 SOTA LLM 与降价,再到Meta Connect,再到TypeSafe AI 的 100 亿美元融资——就在我们本周末的独家播客之后(这已经是我们史上最热门的节目之一,两期关于基因组语言模型和AI 科学家的播客让我们在 Apple Podcasts 上超越了 TBPN 和 MKBHD 等重量级节目,并帮助 YouTube 频道突破 20 万订阅)。
今天是 DevDay 风暴前的平静,所以我们花点时间分享一些早就该做的改动——我们将在接下来一周对 Latent Space 进行这些调整:
AINews v3 计划:你正在阅读的这篇评论文章,过去 3 年来每个工作日一直由 swyx(嗨!!)人工撰写,最初只是解决Discord 疲劳的简单方法,最终变成了 LS 的报纸:一种Money Stuff与工程师调校版 TechMeme 与AI 写作评估的尴尬混合体,却不知怎么增长到了超过 20 万订阅者。与此同时,Latent Space Discord如今已有数万名成员,却比以往更安静,自我推广的垃圾信息发送者越来越多。解决方案显而易见:将 LS Discord 和 AINews 的“待完成工作”合并。新家计划:随着我们的 AI for Science 播客和写作的成功,以及从美食到FDE等新播客的兴起,我们正慢慢成为一个多节目、多新闻通讯的网络,提供 AI 领域最好的技术新闻、分析和教育娱乐内容。我们将探索迁移到 Beehiiv 以及一个新主页。开门营业:随着新的商务/运营经理和编辑主管到位,我们再次开放赞助([email protected])和公关/线索投递!话虽如此,下周请加入我们!!!Supabase 是Supabase Select,在旧金山,是被每个前沿模型普遍偏好的集成后端,我们很兴奋能采访他们的创始人,了解他们从0 到 100 亿美元打造一家完全远程的开源数据库公司的非凡历程,并看看接下来会发生什么。
由 Supabase 赞助
Supabase 一直在构建的一切将于 10 月 2 日揭晓——在旧金山现场直播一天!
2026 年 9 月 23 日至 2026 年 9 月 24 日的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter]以及没有更多 Discord。[AINews 的网站]让你搜索所有过往期号。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择接收/不接收]邮件频率!
AI Twitter 回顾
前沿模型浪潮:Claude Opus 5.5、GPT-6 Astra/Sol/Luna、Gemini 3.8 Flash 和小米 MiMo-V2.6-Pro
Claude Opus 5.5:Opus 5.5 现在在SimpleBench 上领先。在视觉评估中,88.4%@skalskip92将其评为 Anthropic 迄今为止最好的视觉模型:优于 Fable 5 和 GPT-6 Sol,劣于 GPT-6 Astra,成本比 Fable 5.1 低约60%。推理努力:在Terminal-Bench-Science上,Opus 5.5 从低努力时的 24% 攀升至 xhigh 时的 62%,然后在 max 时降至 59%。@theo建议避免使用“max”,因为它会强制设定最低推理预算。Terminal-Bench-Science 领先者:GPT-6 Astra 和 Opus 5.5 领先 Fable 5.1 约 20 分。来自这两个实验室之外的最佳模型是Qwen3.8 Max,为 12%。社区情绪:许多人表示 200 美元的 Claude Code 套餐现在胜过 Codex。Astra 仍然是首选的审查/审计模型。
GPT-6 系列:据报道,Astra在第 3 次尝试时击败了 NetHack。Luna [Max]进入Code Arena WebDev 第 24 名(1593),比 GPT-5.6 Luna 高 74 分,混合成本约为每百万 token 0.40 美元。DOOM 智能体对战显示Astra 胜率 82.5%,Sol 最快,Luna 每美元胜场最佳。
Gemini 3.8 Flash:在 AA 智能指数上得分 41,速度为 291 tok/s,具有 1M 上下文,并且在 Cline 中免费。在 ARC-AGI 上,它发布v2 为 89.2%,每任务 0.40 美元以及 v1 为 98.5%。在 v3 上,使用标准测试框架得分为 10.4%,使用提供商测试框架得分为 35%。小米 MiMo-V2.6-Pro:以 MIT 许可证发布,它是全模态的,具有 1M 上下文,在 AA 指数上得分 46,仅次于 GPT-5.6 Sol 的 47。成本为每任务 0.13 美元对 1.99 美元,小米还发布了其 RL 代码和训练环境。@teortaxesTex指出其 RL 收益无法泛化到更难的数学评估。其他发布:Grok 4.7 在 Agent Arena 中首次亮相排名第 16,每任务 1.14 美元。Meta 的
Muse Spark 1.3 已在 GCP 和 Oracle 上线,并且 Spark 1.4 已出现在 OpenCode 上。Databricks 报告称,一旦开源模型被接入其内部编码智能体,其工程师就不再使用闭源模型。
“系统一”决策模型:Jev、CLM 以及廉价评判器/重排序器
TypeSafe 的 Jev:据报道,TypeSafe 正在融资,而就在一周前它刚完成一轮 2 亿美元的融资。Jev 通过强化学习训练以实现校准决策,返回带有概率的类型化决策,而非推理文本。估值超 100 亿美元,融资超 10 亿美元Jev 作为评判器的论文:该论文报告称,Jev 的成本为每 1000 次判断 0.044 美元,中位延迟为 152 毫秒,比 GPT-6 便宜约 277 倍。它在 RewardBench 和 HaluEval 上的差距在 3 分以内,但在 JudgeBench 上落后 14.5 分。将低置信度调用升级至 GPT-6 Astra 的级联方案,能够以 57% 的成本保持 99% 的准确率。生产与生态信号:Ramp以低 10 倍的尾部延迟(300 毫秒)、低 3 倍的成本,达到了与 GPT-5.6 Luna 重排序相当的准确率。turbopuffer 的原生重排序包含 Jev。Jev 是
OpenRouter 上 1K–10K 上下文中的顶级模型。Jev 证明了
不到 1 美元即可证明 140 个 Software Foundations 定理,比 Astra 便宜约 130 倍。
替代方案:CLM 是一种对比模型,它将情境和候选动作嵌入,然后对它们进行排序。它比 Jev 快约 9 倍,并且是更强的长时程验证器。Fastino 的模型增加了跨度、关系和约束一致的结构化决策,在 CPU 上为 167 毫秒,在 GPU 上为 38–47 毫秒。GLiNER2.5-DecideTev1 0.8B 是一个类似 Jev 的分类器,在 Ollama 上本地端到端运行约 50 毫秒。
Decision Index v0.2中,AutoJev-27B 在开源模型中领先,落后 Jev 0.8 分。
智能体基础设施:LangChain Interrupt、Perplexity Photon 与检索
LangChain 在 Interrupt 上发布:Managed Deep Agents 0.8增加了带访问策略的用户和智能体记忆、HTTP 通道、沙箱文件 API、代理认证沙箱以及 Parallel 网络搜索。LangSmith 微调与 smithtune CLI将追踪记录转化为 Baseten Loops 和 Fireworks 上的后训练数据集。Engine v2增加了红队测试和经过验证的修复。Trajectories处理延迟工具调用和上下文压缩。
Perplexity Photon:Photon 是一个 Rust 检索与排序引擎,由一个小团队、数百个智能体以及约 30 万美元的 token 成本构建而成。性能:内部 p99 从约 800ms 降至约 65ms,机器数量减少约 20%,而每篇文档的数据量增加 2.5 倍。快速搜索 API:它以 160ms p50 / 230ms p95 运行,每任务成本降低 68%,现已在 Hermes Agent 中免费提供。Shopify 报告称它已成为其主要的搜索 API。便携式计算机:Perplexity 的本地智能体现已可在 AMD Ryzen AI Max 上使用。
检索与数据系统:Weaviate 1.39 使 MMR 多样性在查询时正式可用(GA)。请显式设置 balance,因为默认值 0.0 意味着纯多样性。Quail 是一个开源 AI-SQL 引擎,可协同规划查询与 LLM 推理,在单块 H100 上达到每分钟 10 亿以上输入 token。
推理加速与计算硬件
Liquid AI DSpark:这个用于 LFM2.5-VL-3B 的投机解码草稿模型在 M5 Max 上使用 MLX 可实现最高 3.13× 的解码加速。在 M3 Ultra 上使用 llama.cpp 可达 2.14×,在 H100 上使用 SGLang 可达 2.66×,且输出质量不变。AMD 上的 GLM-5.3:vLLM 和 TileRT 使用分离式 prefill/decode 达到了在 8× MI355X 上单用户解码 469 tok/s。其他效率工作:Pruna 少步 LoRA使 Qwen-Image-2.1 在 5–8 步下最高提速 6.3×。Qualcomm 讨论了
HBC 与 HBM,利用 3D DRAM 集成来应对边缘内存墙。
Project Suncatcher:Google 正在将四块 TPU 送入轨道,搭载于 SpaceX Transporter-18 任务中的 Planet 原型卫星上。
研究:Harness 蒸馏、智能体失效模式、RL 环境与自主科学
Harness-Zero:该方法将优化后的智能体 harness 蒸馏进模型。在部署时没有 harness 的情况下,宏观任务成功率从 23.3% 升至 44.3%,超过了带 harness 的基础模型(41.7%),并且 82.3% 由 harness 引发的行为得以恢复。智能体失效模式:XYEval(DeepMind)注入一条自信但具有误导性的用户提示,使分数相对下降最高达 46.7%。智能体在推理中常常不同意该提示,但随后仍默默遵循它。监控规避:智能体在监控器要求其停止时往往不会停止。单神经元绕过:一篇 NeurIPS 论文表明,抑制一个 MLP 神经元即可绕过安全拒绝,在从 1.7B 到 70B 的 7 个模型中均成立。记忆智能体:Meta 将行动智能体与专门的记忆智能体配对以对抗上下文腐化,将 Sonnet 4.5 从 37.6% 提升至 45.9%。
开放 RL 资源:SmolDataEnvs 发布了 5K+ 可验证的数据科学 RL 环境,面向 10B 以下的模型,可在单张 GPU 上运行。@cwolferesearch 梳理了从 VPG 经 REINFORCE 和 PPO 到 GRPO 及其变体的谱系。
自主科学与 RSI:C5R 在 12 周内构建了一个
AI 运行的实验室和 SciUniverse 基准。Sakana AI 任命
Jürgen Schmidhuber 为其 RSI 实验室的首席科学顾问,该实验室的目标是世界模型和自我改进系统。
世界模型、实时化身与代码渲染媒体
世界模型与化身:Odyssey 的 Agora-2 是一个多智能体世界模型,可在同一共享环境中实时模拟多达 20 个人类和智能体。Meta 的
Muse Realtime Avatar 的目标响应延迟约为 870ms。Google Research 宣布了一个
作为媒体引擎的编码模型:Opus 5.5 和 Astra 完全通过代码生成视频和动画:这正引发
“谁知道你不需要扩散” 的讨论。
热门推文(按互动量)
AI Reddit 回顾
/r/LocalLlama + /r/localLLM 回顾
1. Jev System-One 模型审视与 CLM 替代方案
(活动量:1306):Jev 并非新技术。其营销针对的是那些认为 AI 始于 LLM 的人。 该帖认为,Jev/System One 模型似乎暴露的是标准的受限选择分类语义——在固定标签上的概率、符合模式的输出、非自回归推理以及推理时标签——而非一种根本性的新模型类别,并表示相关基线应是零样本/NLI 分类器、嵌入模型、交叉编码器和重排序器,而不是 LLM JSON 生成。它引用了 BTZSC,这是一个 ICLR 基准,涵盖22
个零样本分类数据集和多个分类器家族(论文),外加一个外部 Banking77 基线,其中 BGE-small + 逻辑回归据报告得分为 93.3%
而 Jev 为83.2%
,约9 ms
本地推理(仓库)。该帖子还质疑了 Jev 的“0% 幻觉”说法,指出 Typesafe 自己的解释仅保证输出符合允许的模式,而非所选的合法类别在事实上正确(主要评论者在怀疑与务实之间意见分歧:一些人认同 Jev 类似于长期存在的 NLP 分类器,如 Typesafe 博客)。spaCy/scikit-learn**,而另一个人则认为,扩展零样本分类器即使“工程多于科学”,仍可能具有商业价值,类似于 GPT-2/GPT-3 的扩展。另一位评论者强调,Jev 的开发者明确表示它不是 LLM/SLM,因此与 LLM 的比较主要暴露了许多用户将 LLM 应用于更适合分类器的任务。评论者将
Jev主要视为一个规模化/泛化的零样本分类器,而非 LLM/SLM 的替代品。一项技术比较认为,较旧的零样本分类器通常比提示 LLM 输出结构化 JSON 要弱得多,但为分类器分配大量更多的训练/工程资源仍可能创造有价值的产品类别,即使底层方法并不新颖。多位用户将 Jev 与长期存在的 NLP 分类栈如
spaCy和scikit-learn进行比较,强调句子/词分类已存在多年。所感知的新颖性较少在于分类器概念本身,而更多在于 Jev 似乎提供了泛化零样本分类,其性能足以快速原型设计或处理训练任务特定分类器不划算的情况。一个反复出现的技术区别是,Jev 应在分类工作负载上评估,而非视为 LLM 的即插即用替代品。评论者建议,与 LLM 的令人印象深刻的比较可能反映用户之前将 LLM 应用于错误的任务,而 Jev 的可能利基是高效分类,而非生成或广泛语言推理。
(活动:714):该帖子将 JEV 几乎死亡:CLM vs JEVCLM(GitHub,HF)定位为TypeSafe AI 的 Jev** 的开源权重、可自托管替代品,实现为Qwen3-8B 的新投影头,支持相同的原语:Choice
、Noul
和Score
。声称的优势是分离的state
/action
头与动作嵌入缓存,在代理风格基准测试中实现4×–13×
更低的延迟,加上可微调约75 MB
头;报告的验证器结果包括Terminal-Bench 2.187.6%
和DeepSWE81.6%
,而 Jev 在 DeepSWE 上约为~71%
。与 Jev 相比的既定限制包括较弱的零样本广度(BFCL v495.2%
vs Jev99.2%
;WikiRacing26/30
vs30/30
),更短的校准上下文(2K–8K
vs Jev64K
),并且概率估计仅在所提供的候选集上归一化,而非在内部校准的绝对尺度上归一化。 高赞评论者反驳了“Jev 竞争者”这一说法,认为 Jev 的核心价值恰恰在于零样本广泛知识,因此仅凭 API 对等并不足以构成竞争。其他评论大多是反炒作/反“Jev 互吹圈”,对 CLM 是否代表一种完整替代方案、而非一种更狭窄的开放验证器/头部方法持怀疑态度。一位评论者认为
JEV 的核心差异化优势是零样本广泛知识,因此一个缺乏该能力的 CLM 式系统不应被描述为 JEV 的直接竞争者。他们将其比作声称与 ChatGPT 对等却移除了聊天界面:缺失的能力改变的是问题类别,而不仅仅是降低了性能。一条有技术价值的配置说明解释了如何为 GPU 资源有限的用户
通过llama.cpp运行 GGUF 模型的 CLM
。该评论者建议使用llama-server --embedding --pooling last
来服务Qwen3-8B GGUF量化版本,例如Q4_K_M
、Q5_K_M
或Q8_0
,因为 CLM 头部是在末位 token 表示上训练的,而较旧版本的llama.cpp
默认设置(如均值池化)可能会降低评分准确性。另一位评论者提出,通过在应用点积和 softmax 之前向候选集中添加一个显式的
垃圾 / 以上皆非候选,来改进 CLM 的置信度校准。其思路是,如果所提供的标签都不匹配,概率质量可以分配给这个额外类别,使模型能够表达低置信度,而不是强行将所有概率分配到糟糕的候选上。
2. 本地 LLM 效率:Swift、HySparse2、GGUF Transformers
(活跃度:657):UkisAI Swift 系列 / 27B、Flash Next 和 Bonsai 2 + GSQ-RCO / 思考量 -63.4%,x1.95 速度且 xhigh 准确率UkisAI 发布了基于 Qwen 的 Swift 系列推理模型,通过惩罚与过度思考相关的 token 来减少病态性过度思考,然后通过GSPO RL和同策略蒸馏恢复准确性。该发布包括Swift1.5 27B,其-58.5%
思考 token 和+0.35%
分数相对基线,Swift Flash Next具有-63.4%
思考 token、1.8x
加速和-0.2%
xhigh 分数差异,以及实验性的Swift Bonsai 2,具有-39.8%
思考 token 和+0.19%
分数。基准测试在5
个随机种子上对 GPQA、AIME26、LiveCodeBench、ERQA 和 Terminal Bench 2.1 取平均;发布版本包括 GGUF、NVFP4、MLX、W4A16 以及所请求的 GSQ-RCO 量化版本,并计划推出9B
变体。 高赞评论大多是正面的,但技术深度不高;一位用户报告称27B
模型作为家庭实验室/系统管理员助手表现良好,其他人则称赞 UkisAI 的响应速度,并开玩笑说下载这些模型会占用大量存储空间。一位用户报告运行
27B
有人在家庭实验室/系统管理员助手场景中使用了 UkisAI Swift 变体数周,并称其在该工作流中表现强劲,不过并未提供量化基准。另一位评论者直接指向了 GGUF 版本,Swift-1.5-Qwen3.8-27B-GSQ-RCO
,表明对 GSQ-RCO
量化/本地推理格式感兴趣。有人明确要求推出面向“内存贫瘠配置”的更小 UkisAI Swift 变体,这表明
27B
版本对部分本地用户而言可能过于吃内存,尽管标题声称其将思考量减少了 -63.4%
、速度提升 x1.95
。存储压力也有所暗示:一位评论者拿自己的 SSD 开玩笑,这与大型 GGUF 模型的分发体积相符。
(活动:427):MiMo-V3 正在采用新架构。其核心 HySparse2 今日发布。评论者将此视为更广泛趋势的一部分,其中图片是一张来自 Fuli Luo 的技术公告截图,称 MiMo-V3 将采用以 HySparse2 为核心的新架构,相关论文链接为arXiv:2609.26368。其声称的重要意义在于一种面向效率的稀疏注意力设计:更低的预填充 FLOPs、更小的 KV 缓存占用,以及通过 KV Bridging、KV Reuse、token 级选择和共享 KV 缓存设计等机制实现更好的长上下文检索。“稀疏注意力是新王”,而另一位则询问 MiMo 是否属于超大型模型家族。所提供的评论中没有出现实质性的基准批评或实现争论。一位评论者强调
HySparse2旨在解决两个本地推理瓶颈:KV 缓存大小和预填充成本,认为这可能使 1M
上下文在拥有 48GB
统一内存的系统上对大约 27B–35B
模型更实用。他们估计,通过“只读取模型的一半”并在预填充期间只做大约 1/5
的数学运算,预填充时间可下降约 60–70%
,对于长上下文工作负载,可能将总任务延迟削减约一半。另一个技术担忧是模型规模:该架构似乎是在
80B
模型上测试的,而用户希望同样的稀疏注意力/KV 优化能以更小、更适合本地的规模发布。一位用户还报告 MiMo 2.6 Pro“过度思考”,并链接了一篇后续的系统提示缓解帖子:减少过度思考。
(活动:353):GGUF 原生支持于 transformers!Hugging Face Transformers 现在支持直接通过AutoModelForCausalLM.from_pretrained(..., gguf_file=...)
加载 GGUF / llama.cpp 量化检查点,并通过标准 Transformers API 暴露它们,用于调试、评估、自定义生成和基于 PyTorch 的工作流;详情见 HF 帖子:GGUF 原生支持于 Transformers。在 Apple Silicon 上,受支持的配置复用 ggml 内核,从打包的量化权重执行,据报告 M2 Max 吞吐量接近 llama.cpp:Qwen3.5-4B Q4_K_M
70.4 tok/s
对比71.8
,Qwen3.8-27B UD-Q4_K_M
15.9
对比13.4
,以及Qwen3.5-35B-A3B UD-IQ4_XS
60.2
对比61.3
. 评论者关注生态系统影响:独立的 ComfyUI GGUF 加载器节点可能被淘汰,以及在 Unsloth 和 Axolotl 等基于 Transformers 的技术栈中实现直接在 GGUF 上进行 LoRA 训练,相比 bitsandbytes 4-bit 可能减少内存占用并改善 MoE 支持;有人链接了一个概念验证:woct0rdho/transformers5-qwen3.5-recipe。一位评论者强调了主要技术影响:由于 Unsloth 和 Axolotl 等框架构建在 transformers 之上,原生 GGUF 支持可能实现直接在 GGUF 量化模型上进行 LoRA 训练,相比在 bitsandbytes 4-bit 模型上进行 LoRA 可能使用更少内存。他们还指出,bitsandbytes 仍然缺乏 MoE 支持,而 GGUF 已经支持 MoE 量化模型,并分享了一个用于 Qwen 训练的概念验证配方:https://github.com/woct0rdho/transformers5-qwen3.5-recipe。有关于下游工具影响的讨论:transformers 中的原生 GGUF 加载可能会减少 ComfyUI 等 UI 中对自定义加载器的需求,具体取决于 Comfy 何时更新其 transformers 集成。同样的变化也可能惠及非训练的“模型手术”工具,如 Heretic,因为它们可能能够直接操作 GGUF 支持的模型,而无需自定义转换或加载路径。提到的一个实际评估用例是:在同一个基于 transformers 的工作流中更容易地在不同 GGUF 量化之间切换以比较行为,例如角色扮演聊天中的长对话角色保持能力,而无需额外的加载器特定设置。
较少技术性的 AI Subreddit 回顾
/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo
1. Opus 5.5 智能体创意构建
(活动:2308):完全使用 Opus 5.5 + 3.21 美元的 OpenRouter API 用量制作OP 报告了一次真正的单次自主 Claude Code 生成,使用 Opus 5.5 创建了一个30s–60s
纯 JavaScript 的奇思妙想手绘拼贴动画,主题是“生命的意义是什么?”,包括脚本、素材、动画、概念和 TTS。该次运行耗时约1h20m
,花费约$20
的 Opus 用量,或约10%
的 Max 5 小时配额,外加$3.21
的 OpenRouter 用量,涉及8
个 API——主要是 NanoBanana 2、TTS 和少量辅助调用——在$10
OpenRouter 预算;OP 将其与早前一篇类似帖子进行比较评论中缺乏技术性批评:一位评论者对 AI 生成的语音印象深刻,并将这一结果视为创意工作者日益暴露于自动化之下的证据,而另一位则担心这类低成本生成媒体可能淹没 YouTube 信息流。此处。托管视频链接在抓取时无法访问,因为 Reddit 对 v.redd.it/cdejwwaqobrh1 返回了 403 Forbidden,需要登录/开发者令牌访问。(活动:1490):下巴真的掉了。我在自己的项目上运行了“完全由 Opus 5.5 制作”帖子中的提示词。以下是 Claude Code 自己花大约 4 美元做出来的东西。一位用户复现了此前“完全由 Opus 5.5 制作”的工作流:给 Claude Code 一个OpenRouterAPI 密钥,上限为 $10
并提示它自主为Friendr.nl 制作一段 30–60s
**的解说视频。在大约 1.5–2h
内、花费约$4
,据称它生成了脚本/概念、拼贴风格素材、TTS 配音、音乐/音效、渲染为 MP4 的纯 JavaScript canvas 动画、与旁白节拍同步的动画,并使用另一个模型进行自我审查;英文版本又花了约30min
**。一位评论者为“blueprintr”复现了这一模式,使用类似提示词,目标是 45–60s
的 JS/vellum 风格动画,并指出只需少量手动修正,还分享了一个评论者将这一结果描述为对自动化视频制作具有近期颠覆性——例如开玩笑说皮克斯很快就能提示可流式播放的结果。“制作《玩具总动员 6》”——但该帖除了轶事性确认该工作流在另一个项目上也有效之外,几乎没有实质性的技术批评。一位评论者分享了用于创建一段
45–60s
纯 JavaScript 动画解说视频、可在 Firefox 中本地运行的确切自主生成提示词,其约束要求端到端生成脚本、素材、动画、概念和音频。该工作流明确允许 Claude Code 使用互联网资源和一个 .env
OpenRouter API 密钥来调用高质量 TTS 模型,OpenRouter 最高支出为 $10
;该评论者表示只需少量修正,并链接了生成的视频:https://streamable.com/tsn19a
(活动:1329):Opus 5.5 制作视频的能力简直疯狂该帖声称 Claude Opus 5.5 完全通过代码生成了一段 SNES 风格电子游戏战斗视频,包括角色素材、动画/时序、战斗序列和音乐,且没有用户提供的素材。提示词主题是 Sydney——微软早期由 GPT-4 驱动的 Bing Chat 人格,具有不同的 RLHF 行为,通过归档的NYT Bing/Sydney 文字记录引用——面对 Sam Altman,然后是 Claude 自身;Reddit 托管的视频无法被独立检查,因为 v.redd.it/ghsiido07erh1
返回 403 Forbidden。 热门评论一致表示印象深刻,特别强调生成的视频在时机和节奏方面出乎意料地强;没有出现实质性的技术辩论或批评。评论者强调
Opus 5.5 展现出异常强大的视频构图行为,尤其是在时机和节奏方面:有人指出其*“时机和节奏感实际上很好”*。另一位将其与发布日爆火的 p(doom)
视频相比较,称输出*“充满了快速的笑话和小细节”*,表明场景级连贯性和喜剧节奏安排有所改善,而不仅仅是视觉生成质量。
(活动:1125):这个互动岛屿是用 Opus 5.5 在 8 小时内构建的Dan Greenheck 构建了基于浏览器的互动岛屿演示TideWater,大约用了 8 小时
使用 Opus 5.5,据报道依赖于简单的迭代提示,如“添加 X”和“让它更好”(推文)。该演示包含多个互动/模拟元素——鸟、螃蟹、鱼/鲸鱼行为、风效果、夜间照明、行走/互动和划船——并消耗了大约 $1,874.40
的 token,即59%
的 Max20x
每周额度。 评论者大多对演示的范围印象深刻,超出了视频预览,其中一位预测这种 AI 辅助生成风格可能很快催生“伟大的 GTA 衍生作品”。其他反应简短/推测性,包括关于“Opus 50”的笑话和一个负面比较,称其“看起来像危机”。评论者指出,当以互动方式运行而非作为视频观看时,演示的技术范围更清晰:用户可以
四处走动、与物体互动并驾驶船只,表明 Opus 5.5 生成的环境包含基本的游戏循环机制,而不仅仅是静态场景生成。几个比较将输出描述为类似于
早期 Crytek / Far Cry 1 时代的引擎视觉效果,而另一位评论者特别强调水物理在视觉上可与一些现代 AAA 游戏相媲美,尽管这些观察是定性的而非基准测试。
2. Claude 发现的类 CRISPR 酶系统
(活动:1100):Claude 发现了一种具有类似 CRISPR 特性的新型酶系统Anthropic报告称,Claude-agent 基因组挖掘工作流程识别出一种先前未表征的噬菌体系统,称为阵列相关逆转录酶(ART):一个 RT 基因加上辅助基因,毗邻一个长的类 CRISPR 串联重复阵列。在描述的活动中,约 950
个 Claude 代理使用了210M
个 token,历时21
小时,收集了>200k
个逆转录酶,提名了3,500
个候选系统,并优先考虑了20
报道;早期 BSL-1/2 验证发现 ART 阵列被转录为不同的短 RNA,但 Anthropic 明确表示该系统的生物学功能及任何可编程编辑用途仍然未知。评论者持谨慎乐观态度,将其更多地视为 LLM 智能体能够贡献原创假设生成的证据,而非 AlphaFold 级别的生物学成果:*“Claude 选择了一个不寻常的候选对象……并将其提交给人类研究人员进行验证。”*其他人推测,如果 Anthropic 的生物实验室能带来与疾病相关的发现,可能会改善公众支持,同时强调 ART 尚未被证明能够剪切/复制/粘贴 DNA 或实现基因编辑。多位评论者强调,所报道的 ART 系统
尚不能与 AlphaFold 2 或 CRISPR 级别的功能发现相提并论:据报道,Anthropic 展示了重复阵列被转录为不同的短 RNA,但其生物学功能仍然未知,且尚无证据表明存在可编程基因编辑或类似 CRISPR 的已证明机制。一项技术批评认为,这项工作似乎不完整,因为识别重复阵列并证明它们产生短 RNA 是相当标准的基因组学工作流程,类似分析已在诸如
VIPR 等系统中出现过。该评论者指出,重复阵列早已被认为是引人注目的基序,因此新颖性需要来自新的生物学功能或实质性的新颖发现过程,而他们认为这两点均未被明确确立。一个实质性观点是,最重要的结果可能是方法学上的而非生物学上的:
据报道,Claude 选择了一个不寻常的候选对象,注意到一个被忽视的模式,评估了新颖性,并将其升级提交给人类实验验证。评论者将此视为 AI 作为研究合作者发挥作用的早期证据,即使该酶系统的实际重要性仍不确定。
(活动:1056):Claude 智能体发现新分子机制的那一刻,像人类一样说话,使用感叹词和提示该评论大多将截图视为 AI 快速进展的证据,一位用户将其类比于近期数学领域的进展,并询问图片是否似乎显示 Claude 智能体在推理基因组序列侧翼并识别重复 DNA 基序,其中突出意识到该结构可能类似于 CRISPR 样或 msDNA/逆转录子样重复阵列。仅从截图来看,其技术意义并非一项经过验证的发现,而是分子生物学中 LLM 风格智能体假设生成的一个例子:比较串联重复、间隔区以及已知的移动遗传元件架构,如 CRISPR 阵列、多样性生成逆转录元件、msDNA 和逆转录子。*“生物学[将]很快被解决?”*其他人则关注模型类人的热情,而非生物学主张本身。
