返回 文章 学习 CMS 文章

Gemini 4 Argon 发布:GDM 以 1M 输出 token 重返前沿

GDM 发布 Gemini 4 Argon,以 1M 输出 token 和多项 SOTA 成绩重返前沿模型竞争。

Gemini 4 ArgonGoogle DeepMind1M输出token基准测试
成长分 / 100 64 综合收获、行动、留存与影响

Gemini 4 Argon 发布:GDM 以 1M 输出 token 重返前沿
为什么值得读了解 Google DeepMind 在管理层改组后如何回应 Fable 和 Astra 级模型的竞争。

掌握 Argon 在基准测试、定价、输出限制和实际部署中的关键表现。

关键洞察
  1. Argon 在 19 项可信基准中 13 项达到 SOTA,DeepSWE 得分 77.9%,超过 Opus 5.5 和 Astra。
  2. 业界领先的 1M token 输出限制,通过 Long Decode Continuation 实现,高于此前的 64K。
  3. 标准定价为每 1M 输入/输出 token 4 美元/20 美元,50% 折扣后为 2 美元/10 美元,缓存输入享 95% 折扣。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:21714

GDM 上一次发布比 Flash 更大的模型是在二月份(3.1 Pro),而在接连推出多个渐进式的 3.x Flash 版本以及上个月GDM 管理层大改组之后,GDM 面临的最大问题是:他们何时才能赶上那些在此期间已推出 Fable 和 Astra 级模型的同行。

嗯,Argon 来了,基准测试成绩非常可观(在 19 项可信基准中 13 项达到 SOTA)……但仅限网络安全预览版有限访问,不过官方承诺会“尽快”开放访问:

我们喜欢实验性的 Long Decode Continuation,它将输出 token 提升至最高 1M,为业界首创。

2026 年 9 月 29 日至 9 月 30 日 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter 账号],没有发现其他 Discord。[AINews 网站]可让你搜索所有过往期刊。提醒一下,[AINews 现已成为 Latent Space 的一个栏目]。你可以[选择加入/退出]邮件频率!

AI Twitter 回顾

Gemini 4 Argon:Google 重返前沿

发布:Google DeepMind 推出了 Gemini 4 Argon,面向编程、企业知识工作和网络防御(@GoogleDeepMind、@sundarpichai)。可用性:访问首先面向政府用户和 Fairwind 计划中受信任的网络防御者。Google 表示将在向开发者、企业和消费者开放访问之前完善防护措施(@Google、@demishassabis)。输出限制:Google 称其拥有业界领先的 1M token 输出限制,高于此前的 64K(@GoogleAI、@TheRundownAI)。测量说明:Vals 列出最大输出为 262K。Artificial Analysis 通过 Long Decode Continuation 达到了 1M 输出 token,这是一项新的 API 功能,可暂停长响应并在多次调用之间恢复(@ValsAI、@ArtificialAnlys)。

定价:标准价格为每 1M 输入/输出 token 4 美元/20 美元。50% 的 introductory 折扣使其降至 2 美元/10 美元,未公布结束日期。缓存输入可享受 95% 折扣(@_philschmid、@ArtificialAnlys)。

Google 声称的结果:在针对 GPT-6 Astra 和 Claude Opus 5.5 的 19 项已发布基准中,Argon 在 13 项上排名第一。在 DeepSWE 上得分为 77.9%,而 Opus 5.5 为 74.2%,Astra 为 74.1%(@TheRundownAI)。内部部署:Google 报告称,Argon 智能体释放了超过 300 TiB 的数据中心内存,并正在将超过 80 万行 C/C++ 内核代码迁移到 Rust(@kimmonismus)。视频解码器:智能体用安全的 Rust 替换了 32K 行 SIMD 代码,使现有的 Rust 移植版速度提升 2.7 倍,且输出完全相同。

研究用途:团队表示,基于 Argon 构建的内部智能体循环帮助完成了 CK 猜想(@mirrokni)。

Artificial Analysis 评估:Argon 在智能指数上得分为 53,与 GPT-6 Astra(53)持平,略高于 GPT-6.1 Sol(52)(@ArtificialAnlys)。每任务成本:在折扣定价下,每任务成本为 1.99 美元,而 Astra 为 3.26 美元;标准定价下这一成本将升至 3.98 美元。Token 使用:节省来自价格,而非效率。Argon 每任务平均输出 62K token,而 Astra 为 27K。

智能体工作:它在 AutomationBench-AA 上以 77.5% 排名第一,在 Terminal Bench 4 上得分 57%,落后于 Sonnet 5.5、Opus 5.5 和 Astra。幻觉:它在 AA-Omniscience 上的幻觉率为 15%,而 Astra 为 51%。代价是准确率更低:50% 对 Astra 的 63%(@aipulseda1ly)。

Vals 评估:Argon 在 Vals 指数上以 68.9% 排名第一,平均每任务 15.68 美元(@ValsAI,@ValsAI)。编码:它完美构建了 30 个 Vibe Code Bench 应用,而 Opus 5 为 25 个,Astra 为 24 个(@ValsAI)。终端与安全:Terminal-Bench 4.0 从 19.0% 升至 57.6%。它在 CyberBench 概念验证任务上得分 70%,在 IOI 2024–2026 上得分 100%(@ValsAI)。效率:在 Vals 指数任务上,它使用的输出 token 约为 Sonnet 5.5 的四分之一(@ValsAI)。

竞技场及其他评估:Argon 在 Text Arena 上以 1525 排名第一,在 Code Arena WebDev 上以 1679 排名第八(@arena)。Agent Arena:在初步的 3K 会话中,它总体排名第八,在可操控性上排名第一(@arena)。PostTrainBench:它得分 45.3%,高于 Gemini 3.1 Pro 的 21.99%(@karinanguyen)。

质疑:一些观察者对公布的数据提出疑问。法律基准:Argon 在 Harvey 法律基准上报告的 19.6% 落后于 Muse Spark 1.2 所列的 25.42%(@BlackHC)。其他批评:评论者提出了可能的偏好数据刷榜行为,并对包括 DeepSWE 在内的一些数据表示反对(@teortaxesTex,@teortaxesTex)。

GPT-6.1 Sol 与 OpenAI 的 DevDay Agent Stack

独立评估:GPT-6.1 Sol 是 MathArena 上的新第一名(@j_dekoninck)。Code Arena:它在 WebDev 上以 1759 排名第三,在相同的 2/10 美元定价下比 GPT-6 Sol 高 70 分(@arena)。每任务成本:Artificial Analysis 测得在最大努力下每任务 0.72 美元,而 Astra 为 3.26 美元,GPT-6 Sol 为 1.04 美元(@ArtificialAnlys)。节省来源:Sol 使用更少的轮次,并且缓存读取价格更低(@ArtificialAnlys)。

Luna 漏洞修复:OpenAI 修复了一个图像编码漏洞,为 GPT-6 Luna 增加了 1 个智能指数点。

超快推理:OpenAI 宣称最高可达 300 tok/s。SemiAnalysis 报告称,它在低批量规模下运行于 NVIDIA GPU 上,而非 Cerebras(@kimmonismus)。实测报告:生成速度约快 8 倍,但端到端智能体任务仅加速 2–4 倍,因为工具延迟占主导(@sayashk)。计算机使用:此处收益最大,因为 UI 操作可在毫秒级响应。成本:测试者约 2 小时就耗尽了一周限额。

产品层:DevDay 推出了 dots(拥有自己云计算机的持久化智能体)、Decisions API 和计算机使用(@latentspacepod)。Sites:ChatGPT Sites 现在可以托管 MCP 服务器,并将其转化为可安装插件(@mxstbr)。使用限额:用户报告一次性额度价值约 2,500 美元。其他人则抱怨使用限额被削减(@kimmonismus,@kimmonismus)。

其他发布:嵌入、图像/视频与开放模型

Perplexity 上下文嵌入:pplx-embed-v2-context-9b-preview 已在 Hugging Face 上开放(@perplexity_ai)。方法:该模型对整个文档编码一次,随后对分块向量进行池化。训练从上下文压缩模型中蒸馏相关性,而非使用单一金标分块标签(@denisyarats)。结果:它在 ConTEB 上创下新的最优水平。在 turbopuffer 的私有 context-bench 上,其答案召回率@10 比 voyage-context-4 高出 14.4 个百分点,且使用 1 KB int8 向量对比 8 KB(@turbopuffer)。

Cohere Embed 5:该系列有 Pro 和 Fast 两个变体,共享同一嵌入空间,因此你可以用一个建立索引,用另一个检索(@cohere)。Fast 层级:Cohere 称其以比 Pro 低三分之一的成本,至少领先其他快速层级模型 6 个百分点。评估使用其新的 RCP-nDCG@10 指标(@cohere)。

Ideogram 4.5:该编辑模型面向无伪影的多轮编辑,并承诺开放权重(@ideogram_ai)。视频基准:Artificial Analysis 推出 AA-Video-T2V v2.0,以 1080p 评判,超过 68K 人类投票(@ArtificialAnlys)。领先者:Wan 3.0 以 12 美元/分钟位列第一。Seedance 2.5 以 34.12 美元/分钟位列第二,MiniMax H3 以 4.80 美元/分钟在统计上与之并列。Utopai X:这一 MiniMax H3 的后训练版本首次亮相即位列第二(@ArtificialAnlys)。

开放与小型模型:Ling-3.1-flash:一款 500B 模型,据报道接近 GPT-5.6 Sol 和 Opus 5(@kimmonismus)。它在 Mobile App Arena 的开放权重模型中排名第 2(@DesignArena)。Praxis-1:Runway 发布了一款开放权重世界动作模型,并表示机器人策略性能随第三人称视频可预测地扩展(@agermanidis)。Solar Mini 4:Upstage 报告其总参数为 35B / 激活参数为 3B。它在 Intelligence Index 上得分为 24,价格为 $0.10/$0.40(@ArtificialAnlys)。缓存惩罚:每个任务的成本仍约为 Luna 的 5 倍,因为其重复上下文中只有 48% 命中缓存,而 Luna 为 99%(@ArtificialAnlys)。

智能体研究、推理与系统

上下文语言模型(Meta):CLM 将上下文视为可编辑文件,而非仅追加日志,上下文管理策略在权重中学习,且无需外部框架(@RulinShao)。结果:在 24 小时多仓库智能体集群任务上,相同算力下得分高出 65%(@arankomatsuzaki,@natolambert)。

自适应推理算力:TaH2:前瞻深度监督教会模型哪些困难 token 值得再循环一次(@ZhihuFrontier)。收益:报告称在匹配测试时算力下准确率提升 3.4 个百分点,扩展斜率陡峭 53%。服务:MiniSGL 集成将不同循环深度的请求批量处理在一起。

AutoBenchmark(Meta):该项目自动化基准创建。在构思阶段的人类反馈优于智能体单独工作,且难度可迁移到留出的求解器(@jaseweston)。Stratego:一篇 Nature 论文提出了首个超人 Stratego AI,基于不完全信息下的强化学习和测试时算力构建(@ssokota)。

预填充/解码分离:一项稳态分析认为,在相同批大小和吞吐量下,分离将平均交互性提高约 1/(解码时间占比)(@ekzhang1,@cHHillee)。含义:它有助于预填充密集型工作负载,而非受解码约束的低延迟服务。

编译器与硬件:华为上的 DeepSeek:DeepSeek 发布了一套开源 Ascend 工具包,其中包含针对 Ascend 950 优化的 TileLang(@kimmonismus)。AI 作为编译器:一个模型将 Triton 直接翻译为 PTX,并由验证器检查正确性、竞态和死锁。在 B200 上,FlashAttention 的加速达到 1.37 倍(@Azaliamirh)。Vera Rubin:Cognition 是通过 CoreWeave 使用 Vera Rubin 的首个客户,报告称在相同解码速度下,token 吞吐量约为 GB200 的 4.8 倍(@cognition)。DFlash 草稿模型:面向 Ornith-1.5 的新草稿模型带来最高 2.54 倍的无损加速(@ornith_)。

智能体沙箱:Cloudflare 为智能体重建了 Containers,p50 交互就绪时间为 648 毫秒(快 6 倍),快照功能处于测试阶段(@mgamache)。AutoRouter:Cloudflare 的模型路由器在内部测试中显示支出降低约 30%(@ashleypeacock)。

安全、安保与评估完整性

推理提取:OpenAI 将一场隐藏推理提取行动的核心部分归因于与 Moonshot AI 有关联的个人(@kimmonismus)。规模:OpenAI 在两天内记录了来自 4,000 多名用户的 16,000 次尝试,相关活动涉及超过 15,000 名用户。外部研究人员:他们的攻击直到本周仍对 Astra 有效。补丁难以在产品版本和第三方托管方之间传播(@JSchaeff3r,@jonasgeiping)。批评:Nathan Lambert 认为该漏洞是 API 提供商的责任(@natolambert)。

蒸馏防御:在没有后续 RL 的情况下评估的防御会带来虚假的安全感。RL 使简单攻击变得有效(@shidan_javaheri)。嵌入式评估:Apollo Research 发布了针对获得类似前沿实验室员工权限的外部评估者的原则(@ApolloResearch)。网络评估:在 CyberGym-E2E-AA 上,一些前沿模型在超过 85% 的任务上被安全阻止(@ArtificialAnlys)。成本:GPT-6 Luna 或 MiMo-V2.6-Pro 可以在一个 100 万行代码库中运行约 100 次漏洞搜寻,成本约为 20 美元。

来源与透明度:SynthID Bio:针对 AI 生成蛋白质的水印技术发表在 Nature 上,并开源了工具(@demishassabis)。AI 检测器规避:Opus 5.5 和 Astra 可以重写文档的 50% 以上而不被 Pangram 标记(@ValsAI)。智能体报告:一篇新预印本探讨了 LLM 撰写的智能体工作报告实际上有多透明(@jennyihuang)。

产业与政策

Factory 与 Cognition:Factory 撤除了顾问 Chris Degnan,称他在参加其董事会会议期间向 Cognition 透露信息(@matanSF)。聘用:Cognition 同日宣布 Degnan 出任其 CRO(@cognition)。否认:Cognition 的 CEO 表示没有共享任何 Factory 信息,且 Degnan 已于周一辞去顾问一职(@ScottWu46)。

政治支出:Greg Brockman 放弃了承诺向 Leading the Future 超级 PAC 提供的第二笔 2500 万美元捐款(@teddyschleifer)。后续问题:Alex Bores 询问这是否也涵盖那些不披露捐赠者的反监管团体(@AlexBores)。

OpenAI 财务:NYT 报道称 OpenAI 的年化收入接近 700 亿美元,并正就以 1.4 万亿美元估值筹集 300 亿美元进行谈判,其 IPO 被推迟至明年(@srimuppidi)。融资:为硬件工程构建 AI 工具的 Flow 以 7.5 亿美元估值完成了 5000 万美元 B 轮融资(@parisingh)。

热门推文(按互动量)

Gemini 4 Argon 发布;通过 Fairwind 向受信任测试者推出—— 44.6KArgon 智能体释放了 300 TiB 内存并推动 Rust 迁移—— 3.7K

AI Reddit 摘要

/r/LocalLlama + /r/localLLM 摘要

1. GLM-5.3 网络风险与本地推理支持

(活动量:785):GLM-5.3 与高级网络能力的扩散 \ AnthropicAnthropic 报告称,智谱/Z.ai 的开源权重GLM-5.3跨过了一个值得注意的自主网络能力门槛:50/410

在 ExploitBench 上的端到端 V8 漏洞利用,接近 Claude Mythos Preview 的56/410

,并且在4%

的 Anthropic 内部二进制漏洞利用任务上实现了完整的控制流劫持,而此前模型在这些任务上几乎为零。Anthropic 将风险框定为能力 + 可获取性:GLM-5.3 可广泛下载、相对便宜,且拒绝行为微调较弱,据报告简单的越狱在64–100%

的情况下成功,而“消融”(abliteration)将拒绝率降至低个位数,且测得的能力退化很小。热门评论大多对 Anthropic 的框定持敌意,认为该帖子读起来像是试图压制一个接近 Anthropic 前沿的、更便宜/开放的中国模型。一位评论者强调了正当的防御性用途,称 GLM-5.3 是他们进行安全测试和改进自身软件的唯一实用工具。评论者强调

GLM-5.3是一个低成本、限制较少的模型,被认为接近前沿能力,一位用户将其描述为可用于*“对我自己软件的安全测试和改进”*,而非本质恶意。所提出的技术担忧是,像Anthropic这样的提供商施加的限制可能会限制防御性网络安全工作流,这些工作流需要模型愿意分析可能敏感的漏洞利用或漏洞模式。一位评论者提到此前

GLM-5.2 模型被认为有助于缓解一次 Hugging Face 攻击,与之形成对比的是 Claude 据称拒绝提供协助。其实质要点在于,拒绝策略可能会降低事件响应或漏洞修复场景中的实用性,而限制更宽松的模型在防御性安全任务中可能具有实际操作性价值。

(Activity: 348):add GLM-5.3-Flash (GLM5-Next) support by timkhronos · Pull Request #27773 · ggml-org/llama.cpp已合并ggml-org/llama.cpp#27773

为llama.cpp添加 GLM-5.3-Flash / GLM5-Next 支持

,从而为这个 320B 混合文本+视觉模型启用本地推理。该实现添加了 GLM 专用的 DSA 索引/池化、混合索引内存,以及一条新的glm5v

视觉预处理/tower 路径,同时复用 Kimi-K3 KDA 层、DeepSeek 风格的 MoE/mHC 辅助组件、仅 MLA 注意力,以及 DSV4 风格的 SwigLU 钳制;验证报告称随机模型 logits 在 prefill/ubatching/decode 上与 Transformers 匹配,视觉嵌入一致性约为1e-5

,部分对精度敏感的 tensor 保持未量化。评论者担心llama.cpp

模型支持落后于新实验性架构的推出速度,其中一位指出有效瓶颈似乎是维护者的可用性。还提出了一个技术兼容性问题:据称现有的 Unsloth 量化使用glm5next

,而主线期望glm5-next

,因此当前主线可能无法加载这些量化。评论者指出了

Unsloth 量化 PR 与主线llama.cpp

PR 之间的兼容性问题:一个将架构/模型类型标识为glm5next

,而另一个使用glm5-next

,这意味着主线llama.cpp

可能无法在不进行转换或元数据修复的情况下加载现有的 Unsloth GLM-5.3-Flash 量化。有人担心

llama.cpp

支持落后于新模型发布的速度,尤其是较新的模型越来越多地使用实验性架构,这些架构需要专门的加载器/运行时改动,之后推理和优化工作才能落地。一位评论者将 GLM-5.3-Flash 支持描述为在模型发布后大约*“还要一个月”*,进展在很大程度上取决于少数几位维护者。