我们对此报道得晚了,但迟做总比不做好。我们一直忙于敲定第二届 AIE NYC,活动将在一个月后举行。趁价格还没上涨,赶紧买票——我们下周将公布来自 Bridgewater、Ramp、Coatue、Mastercard、Vanguard、Coinbase、Blackrock、Fidelity、Point72、Capital One、JPMC、Wells Fargo、Bloomberg、A24(没错,就是那家电影制片厂)Labs、Two Sigma、Apollo Global 等机构的演讲嘉宾!
DeepSeek 推进其研究议程的方式简直令人着迷。 在 DeepSeek 的主要版本之间,从 v2 到 v3 再到 v4,他们发布了若干中间论文,每篇都聚焦于某一项架构改进,而且基本上命中率是 100%,从 Math(尤其是
、以及
Coder,更不用说还有
R1、近期关于 Manifold Constrained Hyperconnections 与 Compressed Sparse Attention 的工作。在 2025 年上半年因 R1 论文而获得巨大关注之后,DeepSeek 开始低调行事,在过去大约一年里,乐于让 GLM 和 Kimi 等同行在开放模型领域领跑。
有一小段时间看起来形势不妙,但真正的鲸鱼兄弟们从未动摇,而现在 DeepSeek 发出了一个奇怪而混杂的信号:他们做了一个全新的架构,让 V4 Pro 退役,全力投入这个新模型,却只把它命名为 v4.1 Flash,这似乎是在测试你是否懂得透过基本标题去理解真正的进步。
是的,v4.1 Flash 在某些基准测试上确实落后于其他开放模型。但那是因为我们目前还没有能够简洁地捕捉 v4.1 以及 DeepSeek 更广泛研究议程所追求目标的基准测试——即我们所见过的、被公开解释过的最具创造性和最高效的上下文利用方式。
如果你是那种只读模型版本号和基准测试标题的人,那你正是 DeepSeek 想要愚弄的那种肤浅之人。理解 DeepSeek 在此取得巨大进步的最佳方式,是看看 Sebastian 的梗图:
同样的模型名称,但按任何人的标准都算不上 0.1 的提升,而且他们还加入了视觉能力,却没有让你等待一个单独的模型。想要更好的可视化,你可以看看从 Attention is All You Need 的原始编码器-解码器架构以来,随时间堆叠起来的所有模型创新:
如果你读过我们的 V4 Pro 解读文章和 Engram,那么截至 2026 年 4 月,你应该已经掌握了 DeepSeek 基础架构层面的阅读材料,但我们极为推崇的是这里引入的 prefill/decode 分离设计:prefill(输入 token)为 8B,decode(输出 token)为 16B,如果沿用 MoE 的既有命名法,就催生了我们那串字母汤式的“DeepSeek v4.1-Flash: 763B-P8B-D16B”。这意味着 1-2% 的稀疏度,而如果你读过 DeepSeek v4.1 Flash 技术报告,再结合 Sliding-Window Attention Bounded Replay 等新调整,其 KV 缓存占用可低至 V4 Flash 的 1/8……这让它对于长时间运行的智能体来说更好、更快、更便宜:
我们非常高兴 DeepSeek 重新开始发布 SOTA 研究。我们最后要重点提的是他们对后训练的评论,在这些评论中他们似乎很大程度上同意 Jie Tang 教授的观点:
2026 年 9 月 9 日至 9 月 10 日的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter 账号],没有进一步的 Discord。[AINews 网站]让你可以搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择订阅/退订]邮件频率!
AI Twitter 回顾
DeepSeek 发布了 V4.1-Flash,作为新的开放权重旗舰模型,专注于极致的推理效率和低成本。
独立基准测试账号 Artificial Analysis 报告称,DeepSeek V4.1 Flash 尽管便宜得多,却超越了 DeepSeek V4 Pro 0813,得分为
Artificial Analysis 智能指数 40 分,略低于 GLM-5.3-Flash,高于最新的 V4 Pro,同时定价为每 100 万输入 token 0.30 美元和每 100 万输出 token 1.20 美元,缓存输入为每 100 万 0.006 美元,并额外享有50% 的非高峰折扣;他们还将其描述为一个总参数 763B的模型,具有8B 激活输入和16B 激活输出参数、100 万 token 上下文、文本+图像输入、MIT 许可证,并通过 DeepSeek 第一方在美国/API 可用@ArtificialAnlys,@ArtificialAnlys,@ArtificialAnlysVals 称其为新的
Vals 指数上排名第一的开放权重模型,领先于 Kimi K3,每次测试仅需0.30 美元,是开放权重前十中最便宜的模型;他们还指出该评估在100 万上下文、384 最大输出 token、温度 1、默认 top-p/top-k 和高推理努力下运行@ValsAI,@ValsAI,@ValsAIBaseten 提供了第 0 天支持,并将产品定位总结为
比 DeepSeek v4 Pro 0813 更智能、更快、更高效,具备文本和视觉、仅限美国、ZDR和100 万上下文@basetenOllama 开始将其推广到
Max 和 Team账户,随后扩展到Pro 计划订阅者@ollama,@ollama,@ollama
架构与论文级技术细节
讨论最多的技术新意是一种因果编码器-解码器设计,旨在降低活跃计算量和 KV/缓存成本。
Artificial Analysis 表示,该模型采用了
新的因果编码器-解码器架构,其中输入/预填充阶段有 8B 活跃参数,输出/解码阶段有 16B 活跃参数@ArtificialAnlysSebastian Raschka 将 V4.1 描述为一次
“大改造”,并表示他们“本应把它叫做 DeepSeek V5”,明确强调编码器-解码器设置是与之前 DeepSeek 世代的关键区别@rasbt多位技术读者对该设计的反应是异常混合:有人称其为“研究中非常保守、有时甚至老旧的想法,与工程中潜在前沿的效率与硬件设计的非常有趣的混合”
@_xjdrStochastic Chasm 的一则简洁架构解读将该设计理念与
HySparse、NSA 以及 DeepSeek 自己在 V4 中的 CSA/HCA 相比较,将其总结为局部滑动窗口分支加稀疏检索分支,暗示这种稀疏/局部混合正在成为一种更广泛的模式@stochasticchasm同一账号指出多模态变化
并不激进,称 DeepSeek 主要是“让主干处理大部分内容,并给它视觉 token”,采用3x3 像素反洗牌而非更常见的2x2@stochasticchasm他们后来指出“与 K3 在视觉编码器上的巨大差异”,暗示视觉前端与近期中国同行存在实质性分歧
@stochasticchasmTeortaxesTex 观察到 DeepSeek 一个反复出现的模式,即在
前 N 层做一些不寻常的事——以前是稠密或哈希路由,现在是仅 SWA——推测这可能反映了早期层反复出现的训练困难@teortaxesTex后来,同一账号认为该堆栈“降至
40 层,可以说只有 20 个真正的解码器层”,强调 DeepSeek 在解码关键路径上可能多么激进地压缩有效深度@teortaxesTexTeortaxesTex 的另一条讨论片段暗示 DeepSeek 在做
多种压缩频率,“它全都是 CSA2”,这是对围绕内存压缩的架构讨论的回应@teortaxesTexNrehiew 的技术笔记强调
KV 缓存压缩是该设计的核心,称其为“痴迷于 KV Cache 压缩如何让你得到一个超高效前沿模型”的案例研究@nrehiew_在后续中,nrehiew 强调了报告中的基础设施细节:
减少长尾停顿的调度策略、从先前检查点进行路由重放、通过数据集级上限管理较短补全的离策略效应、丢弃方案、有界离策略比率与损失掩码,以及在新检查点更新时的持久化 KV 与路由;他们还提到最后一个阶段是在 40 多个教师模型上进行全词表 OPD @nrehiew_。Nrehiew 总结说,这一设计看起来比 V4 中较旧的
HSA + CSA 组合更简洁,称它“非常明显是为推理而设计的”,并引用了在基准测试分数区间下惊人的 ~890 字节/token KV 大小 @nrehiew_。Stochastic Chasm 推断
针对 KV 缓存的 QAT,称这可以解释为什么该模型在 FP4 KV 缓存下表现优于同类模型 @stochasticchasm
基准测试结果与数字
独立评测一致认为 V4.1-Flash 在成本调整后的智能、长上下文和自动化方面异常强大,但有一个关于冗长度的重大警告。
Artificial Analysis 的头条:
40 AA Index,高于 V4 Pro,低于 GLM-5.3-Flash @ArtificialAnlys,并由 Scaling01 单独佐证 @scaling01。Artificial Analysis 报告称
AutomationBench-AA:69%,与 GPT-6 Astra(69%) 持平,高于 Grok 4.6(67%),同时比 V4 Flash 0731 提升 15 分,比 V4 Pro 0813(57%)高 12 分,比 GLM-5.3(62%)高 7 分 @ArtificialAnlys。在 GDPval-AA v2 上,据称它提升了
164 Elo,从 1468 到 1632,超过 Kimi K3 的 1584 @ArtificialAnlys。在
AA-LCR v1.1 上,它得分 84%,与 GPT-5.6 Sol 和 Gemini 3.8 Flash 的 84% 持平 @ArtificialAnlys。Artificial Analysis 还表示,V4.1 Flash 是所测模型中
最冗长的模型之一,在 Intelligence Index 任务上平均 89k tokens——比 GLM-5.3(71k)多 25%,比 GLM-5.3-Flash(69k)多 29%,比 V4 Pro 0813(55k)多 62%,甚至高于 Fable 5.1(78k) 和 Claude Opus 5(73k) @ArtificialAnlys。即使如此冗长,AA 估计每个 Intelligence Index 任务仅需
$0.27,大约比 GLM-5.3($2.01) 和 Kimi K3($2.00) 低 7 倍,比 V4 Pro 0813($0.67) 低 约 2.5 倍 @ArtificialAnlys。Vals 的结果强化了成本领先地位:
$0.30/测试,在其榜单上排名开放权重第一 @ValsAI。另一个反应帖更激进地总结了 DeepSWE 风格的说法,称 V4.1 Flash 提供了
在 DeepSWE 中优于 GPT-5.6 Sol 和 Opus 5 的性能,同时 API 成本低 94%,但该陈述是二手总结,而非本数据集中的一手基准测试帖 @kimmonismus
本地运行与推理工程方面的反应
很大一部分讨论集中在通过卸载和 SSD 流式加载,在接近消费级的本地硬件上运行 V4.1-Flash 的惊人便利性上。
Fraser Price 报告称
全精度 DeepSeek 4.1 Flash + DSpark,在 4 张 Max-Q 上以 200 TPS 运行,系统内存仅 64GB,将200GB 的 Engram/哈希表卸载到 NVMe;他表示这使得不再需要将完整结构保留在内存中,并承诺提供一份 vLLM 配方@fraserpricee他后来将其提升到
4 张 RTX Pro 上 300+ TPS,仍为全精度,系统内存峰值 <32GB,使用自定义 vLLM 分支和 SSD 支持@fraserpriceeAntirez 展示了
DwarfStar 在 128GB M5 Max 上运行 V4.1 Flash,称 SSD 流式传输使其快得出乎意料;他推测近期 SSD 流式传输的改动以及 DS4.1“更频繁地使用相同专家”的可能性都有所贡献@antirezTeortaxesTex 回应称“你竟然可以主要从 SSD 运行前沿模型,这太不可思议了”
@teortaxesTexElie Bakouch 发布了一个反应梗图,明确针对 V4.1 Flash 架构的
推理工程师视角,反映出这次发布在系统领域人士中引起了多么强烈的共鸣@eliebakouchvLLM 的新版本还包含了
DeepSeek-V4 共享专家融合进 MegaMoE,以及 Mooncake Store 可以卸载解码 KV,这与为何在开放基础设施中服务这类模型正迅速变得更容易相关@vllm_project,@vllm_project
事实与观点
事实和直接归属的声明
V4.1 Flash 发布,并迅速获得 Ollama 和 Baseten 支持
AA Index 40、AutomationBench-AA 69%、AA-LCR 84%、GDPval-AA v2 1632 Elo、1M 上下文、MIT 许可证以及低 API 定价@ArtificialAnlysVals 报告称其在其指数上位列开放权重模型第一,价格为
$0.30/测试,在其测试框架设置下最大输出 384 个 token@ValsAI,@ValsAI本地部署报告声称
200 TPS,后来在 4 GPU 配置上达到300+ TPS,以及 M5 Max SSD 流式运行成功@fraserpricee,@fraserpricee,@antirez
解读与观点
Raschka 的“他们本应叫它 V5”是一种关于架构变化有多重大的观点
@rasbtTeortaxesTex 关于 DeepSeek“反复难以正确训练前几层”的推测是推断,而非 DeepSeek 的确认声明
@teortaxesTexNrehiew 认为该报告比之前的 HSA/CSA 设计“更干净”,并且可能不同于 OpenAI/Anthropic 会做的,因为他们有定制芯片,这是有依据的观点
@nrehiew_“DeepSeek 发布的是内部研究产物而非产品”这一批评是外部判断,而非事实性发布说明
@teortaxesTex“数据就是一切”或“研究已经结束”这类断言本身也被批评为过度反应
不同意见与反应
支持 / 印象深刻
强烈的正面反应来自基准测试者和研究者,他们强调其性价比的跃升:Vals 称其为“新的 #1 开放权重模型”,Artificial Analysis 给出了成本调整后的头条评价,以及诸如“有趣的发布 / 一股清新之风”之类的普遍赞誉
@ValsAI,@ArtificialAnlys,@dejavucoderRaschka 称其“超级酷、令人耳目一新”
@rasbtXJDR 尽管在审美上有所保留,但喜欢其中的工程思路
@_xjdrNrehiew 称其为“又一份炸裂的技术报告”
@nrehiew_Stochastic Chasm 最后表示这篇论文“信息密度很高”,但赞赏其多智能体训练角度和稀疏设计思路
@stochasticchasm,@stochasticchasm
中立 / 分析性
一些观察者主要是在剖析其设计,而非为其喝彩:稀疏/局部混合、第一层的怪异之处、多模态分词、KV 量化、同址异步 RL 等。
@stochasticchasm,@stochasticchasm,@nrehiew_Gordic Aleksa 将这篇论文用作更广泛的预训练数据分类法的证据,把 DeepSeek 归入
有机数据阵营,并指出令人惊讶的是,根据其发表物,他们似乎甚至没有使用合成改写@gordic_aleksa
批评 / 怀疑
TeortaxesTex 反复反驳外界的印象,认为 DeepSeek 常常表现出
内部评估高、外部稳健性较弱、脆弱以及奇怪的技能缺口,因为它“交付的是内部研究产物,而不是产品”@teortaxesTex同一账号称某些评估结果“非常奇怪”,尤其是
AutomationBench 第一名以及 CritPt 的回退,并请 DeepSeek 团队“对此好好反思”@teortaxesTex他们还认为
V4 GA从工具/技能框架的访问中获益巨大,而V4.1似乎对框架脚手架的依赖更少,在“最小化框架”中表现更好@teortaxesTex在实际使用中,他们报告称
多智能体“DSH agent teams”可能会降低质量,除非项目具有非常清晰的模块化设计,其中V4.1 solo在至少一个示例中优于团队模式,因为子智能体产出了低劣内容或在无必要的研究上浪费了 token@teortaxesTex,@teortaxesTexJared Z 更广泛的产品市场批评——即用户现在非常在意 token 成本,日常主力编码模型应当既便宜又聪明——与 V4.1 Flash 的定位相契合,尽管该批评并非专门针对这一模型
背景
为何这在技术和战略上重要
此次发布正值一个更广泛的转变之中:从“更大的稠密聊天模型”转向
系统优化、稀疏、长上下文、面向智能体的模型,这些模型能够真正以低成本在本地提供服务。V4.1 Flash 的定位异常激进:开放权重、MIT 许可、1M 上下文、多模态输入、低激活参数量、极端的缓存折扣,以及在 SSD/卸载密集型消费级配置上展现出的可行性
@ArtificialAnlys,@fraserpricee,@antirez基准测试模式表明了一种有意义的权衡:
极高的冗长度,但由于超低的 token 定价,仍然具有极低的总任务成本@ArtificialAnlys该架构也反映了更广泛的行业趋势,即
将预填充与解码的经济性拆分,使长上下文和智能体工作负载更加实用,而无需为每个 token 支付前沿稠密模型的成本。此次发布强化了这一观点:开放模型的竞争力日益体现在
可服务性上——即融入卸载流水线、量化 KV 栈、本地部署和开放推理服务器的能力。它也加剧了关于 2026 年模型进步中最重要因素的争论:架构、RL/推理协同设计、数据质量,还是系统工程。Shikib Mehri 明确反驳了 DeepSeek 的论文意味着“研究已终结”的说法,认为杠杆面已从架构扩展到数据工厂和奖励设计研究
@shikibmehri最后,DeepSeek 在实验室身份认同上仍然两极分化:因发布不寻常的研究成果和详细报告而受到赞赏,但也被一些从业者视为不如以产品为中心的竞争对手精致,存在奇怪的评估缺口和脆弱行为,这些在真实工作流中比在内部头条数字中显现得更清楚
OpenAI 的语音、智能体与企业推进
OpenAI 将 GPT-Live-1 推向 API,并迅速围绕其构建起一个生态:这款新模型被定位为一个全双工语音接口,能够边听边说,并将工具调用或推理委托给后端模型。此次发布的核心来自@OpenAIDevs,另有细节说明开发者可以控制语气、节奏、表现力、回复长度和语言详见此处。OpenAI 自己的基准测试帖子声称其相较 GPT-Realtime-2.1 有所提升,包括在与 GPT-6 Astra 搭配时,Tau3 上首次尝试任务完成率达 83.6%,Artificial Analysis Conversational Dynamics 上达 97.3%,以及在 Full Duplex Bench v1 上0.798 秒的响应起始延迟详情。周边工具链正朝着托管式智能体基础设施成熟:OpenAI 还宣布了公测版 Agents API,配备 Codex harness,以及通过托管云智能体提供代码执行、文件和产物的 OpenAI 托管沙箱发布。这与整个行业将模型、运行时和沙箱合并为单一界面的更广泛趋势一致。来自 LiveKit、HeyGen、Telnyx、Speak 和 Cognition 的 Devin Voice 的集成公告表明,GPT-Live-1 可能比早先的实时技术栈更快地成为生产级语音智能体的默认基座。企业数据访问正成为一等产品原语:OpenAI 在产品侧宣布的 ChatGPT Work 中的 Data agent 承诺可在已连接的公司数据源之上提供仪表盘、答案和操作@ChatGPT,而 Box 将其集成描述为“AI 的文件系统”,将受治理的企业上下文引入 ChatGPT。结合谷歌面向智能体的文档推进以及 Cursor 新的持久化工作区,趋势正朝着有状态、具备组织感知能力的智能体环境发展,而非无状态的模型端点。
Cognition、Cursor,以及向持久化编码智能体的转变
Cognition 今天表现格外强劲:它发布了 SWE-2,被描述为“我们迄今最接近前沿的模型”,声称在领先的编程评测上达到同等水平,而成本最多降低 70%,并明确表示其将强化学习扩展到了数万亿参数规模发布。来自 ybenpan 的补充背景强调,该团队在算法、基础设施和数据方面均为自研,而 silasalberti 则强调了一项实用的强化学习发现:一个简单的线性长度惩罚在各努力水平上保持了训练时的帕累托曲线形状。Devin 技术栈正变得更加多模态,并与开发者工作流更加深度整合:除 SWE-2 之外,Cognition 还推出了由 GPT-Live 和 SWE-2 驱动的 Devin Voice推文,并宣布 Dioxus Labs 将加入 Cognition,为 Devin 的虚拟机、计算机使用和测试做出贡献,同时继续支持 Dioxus 及相关 Rust 开源项目Cognition。这是编程智能体厂商收购基础设施和系统人才、而不仅仅是模型研究人才的一个具体例子。Cursor 的新“Projects”功能从 IDE 一侧指向了同一个终点:Cursor 引入了带有协调者智能体的持久线程、跨智能体共享的记忆/产物,以及跨用户设备和智能体计算机的同步。实际上,这是从“每个任务一个聊天”转向一种长期存续的软件项目基底,其中子智能体会随时间累积状态。与 Claude Code 新的窗格弹出和受管智能体会话查看器 / 自动模式结合起来看,市场正逐渐趋同于这样一种理念:编程智能体需要持久上下文、可检查的会话和明确的编排控制,而不仅仅是更好的补全。
智能体研究:测试框架、视野、并行检索与自我进化
多篇论文推进了一个共同主题:harness 如今已成为核心优化目标。来自omarsar0的一篇被广泛分享的 Salesforce 论文摘要显示,在 harness 演化之后,用更强专家的完整轨迹来训练较弱模型,可能使性能下降 4–30 个点,因为微调后的模型采用了一种不兼容的规划风格。所提出的修复方法——只重写较弱模型自身 rollout 中的失败轮次——能够保持模型与 harness 的匹配。与此同时,Sumanth_077 关于字节跳动 HarnessDev 的撰文描述了能够构建并迭代改进自身可运行 harness 的智能体,其泛化表现参差不齐:只有 34/64 项改动在方向上迁移到了留出任务上。长时程与长上下文智能体训练也得到了更具原则性的处理:dair_ai总结了 Qwen 关于 Elastic Horizon 的工作,这是一个闭环控制器,它跟踪成功轨迹长度的第 90 百分位数来调整最大交互时程,在提升成功率的同时最多节省 25% 的轨迹 token。另外,omarsar0重点介绍了 PARSER,它用并行的冻结子智能体 + 一个经 RL 训练的主智能体,在迭代式 scatter-gather 轮次中取代顺序分块读取;报告中的收益包括在 896K 上下文下 +12 个点以及最高降低 11 倍延迟。技能与工具使用数据生成也正在被形式化:dair_ai 关于 SkillAdam将技能自我演化构建为一个离散优化问题,借用类似 Adam 的一阶/二阶矩思想来稳定更新方向和编辑幅度。与此同时,Google Research 的 ToolGrad在提示之前生成真值工具使用链,报告称数据集创建接近 100% 通过率,并带来下游工具使用收益。综合来看,这批工作表明该领域正从“更用力地提示模型”转向对脚手架、轨迹预算、技能文档和工具轨迹的闭环优化。
安全、滥用、可监控性与模型治理
Anthropic 的威胁情报报告主导了安全讨论:该公司发布了迄今为止最详细的滥用报告,涵盖利用 Claude 进行网络攻击、影响力行动、监控、生物学和武器的尝试,并表示其中断了所描述的每一项行动发布推文。大量讨论集中在涉及竞争对手实验室和国家关联滥用的提取/路由模式报道上,pradeepXkapoor、logangraham 以及前 Meta 威胁破坏负责人 David Agranovich 做出了高互动量的回应,后者认为 Anthropic 值得为这种透明度获得赞誉,即便某些表述框架应当受到讨论。第二条讨论主线聚焦于推理可监控性与“神经语”(neuralese)风险:Redwood Research 提出了针对可能削弱或消除思维链可见性的架构的透明度规范,Ryan Greenblatt 则主张,公司在部署大幅降低对 CoT 依赖的架构之前,应发布证据和政策。来自 Neel Nanda 的相关评论将 GPT-6 Astra 解读为无 CoT 推理方面可能令人担忧的跃升,可能表明架构变化超出了普通扩展的范围。前沿实验室员工和校友之间在风险文化上也存在明显分歧:Chris Hayduk 强调 AI 的人道主义益处,而 balesni 和 jkcarlsmith 公开支持超过 10% 的灭绝风险观点。在治理方面,Thom Wolf 宣布 Hugging Face 成立新的 Open Alignment 团队,Richard Ngo 则发表了对 Paul 加入 OpenAI 董事会以及他所认为的安全社区被 AGI 公司俘获的尖锐批评。
按互动量排名的高热度推文
Anthropic 威胁情报报告:@AnthropicAI 发布了一份详细报告,描述了 Claude 在网络、影响力、生物学、监控和武器领域被复杂滥用的情形。OpenAI 因 Astra 容量原因暂停新的 200 美元 Pro 订阅注册:@thsottiaux 表示现有用户不受影响,API/其他套餐仍可使用。GPT-Live-1 API 发布:@OpenAIDevs 将新的全双工语音模型引入 API。ChatGPT Work Data 智能体:@ChatGPT 宣布推出一款连接数据的企业智能体,用于仪表盘、答案和操作。SWE-2 发布:@cognition 推出了一款新的编码模型,声称以显著更低的成本达到接近前沿的评估表现。Cursor Projects:@cursor_ai 推出了带有协调智能体、共享记忆和同步产物的持久项目线程。
AI Reddit 回顾
/r/LocalLlama + /r/localLLM 回顾
1. DeepSeek V4.1 Flash 发布与架构
(活动:317):DeepSeek V4.1 Flash:更强、更快、更易获取DeepSeek 发布了 V4.1 Flash,一个552B
参数的 MoE 模型,原生支持多模态视觉,并采用全新的因果编码器-解码器非对称架构:8B
参数在输入端激活,16B
在输出端激活,声称在更低的推理成本下具备比 V4 Pro 更强的能力(来源,权重,技术报告)。DeepSeek 声称相比上一代,KV 缓存/存储减少了4×
HBM 和8×
SSD,相比其第一代模型减少了437×
;API 用户可以切换到deepseek-flash
,而弃用的deepseek-v4-flash
、deepseek-v4-flash-vision-exp
,以及最终的deepseek-v4-pro
将路由到 V4.1 Flash,并采用新的高峰/非高峰定价。主要技术讨论集中在前沿 LLM 中不寻常地回归编码器-解码器式架构,评论者质疑编码器对长提示和多模态分割的作用。其他人指出,尽管是稀疏激活,552B
总参数使得本地推理不切实际,即使对于多 DGX Spark/Strix 式配置也是如此,因此更小的 V4/Qwen 衍生编码模型对于本地智能体工作流仍然更现实。几位评论者关注所声称的
编码器-解码器/非对称架构,质疑 DeepSeek 如何在现代 GPT 式 LLM 中使用编码器:例如,提示在解码器自注意力之前是被嵌入还是被压缩,以及这如何扩展到按句子、段落或模态分割的长输入。一种解读是,非对称设计可能表明与标准仅解码器 Transformer 相比,生成路径在结构上有所不同。本地推理可行性围绕该模型所报告的
552B
参数规模进行了讨论,评论者认为即使对于高端本地配置(如多个 DGX Spark/Strix 级系统)也不切实际。建议的实用工作流是使用更大的 DeepSeek V4 级模型进行规划,然后使用更小/蒸馏模型,如Q38-27B、Q38-35B-Distill或Ornith35B,在本地智能体编码流水线中执行。该帖中强调的一个技术上值得注意的说法是
437×
自第一代以来的 KV 缓存减少,评论者认为这对长上下文推理成本和内存扩展意义重大。如果准确,这种减少将实质性影响长上下文服务的吞吐量和部署经济性,尤其是与传统的仅解码器注意力缓存相比。
(活动:575):Deepseek V4.1 Flash 是 748B,不是 552B楼主检查了 Hugging Face 的safetensors
并认为 DeepSeek V4.1 Flash 的主干 + engram 约为748.5B
参数——不是284B
、305B
、485B
或522B
——其中主干为551.566B
,engram 为196.929B
;包括可选的 DSpark/MTP(14.225B
)和视觉编码器(0.485B
)后,存储的模型约为763.21B
参数 /511.76 GB
。这种混淆被归因于计数/元数据错误:例如,一个NVIDIA 论坛的估算低估了主干部分,Hugging Face 的485B
很可能将 FP4 打包权重误计为字节,而非每字节两个参数,类似于GLM-5.3-Flash-NVFP4,而vLLM 的配方前后不一致地列出522B
,随后又更正了参数细节。主干部分绝大多数是 MoE FFN 专家:543.582B
参数以 FP4 格式存在,仅有约7.984B
位于注意力/共享/嵌入/其他组件中,这意味着 128–256 GB 的 RAM/VRAM 不足以进行完整的本地使用。一位评论者指出,“Flash”的命名可能与延迟有关,声称其预填充仅使用大约9B
活跃参数。另一个技术问题被提出:针对 engram/ngram 风格查找表的 SSD 卸载,应优先考虑顺序吞吐量还是随机 4K 读取 IOPS,但所提供的评论中没有包含实质性回答。评论者们讨论到,DeepSeek V4.1 Flash可能因包含n-gram
/查找风格组件而报告出大得多的总大小,但一些人认为这些不应像活跃神经参数那样被计算,因为它们可以存储在外部 SSD 上,而不必作为模型权重加载到 VRAM/RAM 中。有人提出一项技术主张,称“Flash”变体之所以快,是因为它在预填充期间仅使用约
9B
参数,这意味着活跃计算路径远小于标题中的748B
数字,并可能解释了以延迟为重点的品牌命名。对于本地部署,一位评论者估计
256GB
系统内存加上64–96GB
VRAM 就足够了,其中n-gram
数据托管在任何 PCIe Gen 3+ NVMe SSD 上。讨论提出了 SSD 性能应优先考虑顺序吞吐量还是4K
随机读取的问题,因为驻留磁盘的查找表可能对访问模式敏感。
(活动:1598):Deepseek 已软性退役 Deepseek V4 Pro图片是一张评论者推测 V4 Pro 的 GA 版本可能遭遇了奖励黑客和扩展性不佳的问题,其中一人指出它是一条推文的截图,称 DeepSeek 实际上正在“软性退役”DeepSeek V4 Pro:V4 Pro 的流量将自动路由到 DS V4.1 Flash,并按更便宜的 Flash 价格计费,直到 V4.1 Pro 发布。所述理由是 V4.1 Flash 在性能、成本、速度和总使用时间上均优于较旧的 V4 Pro,这意味着更小/更便宜的 Flash 变体已成为首选的生产模型,尽管 V4 Pro 的规模更大。*“尽管规模几乎是 Flash 模型的 6 倍,但性能并未显著更好。”*还有关于 DeepSeek 和 Google 是否因独立的训练运行、架构差异或数据混合问题而看到类似的小模型超越大模型效应的争论;另一位评论者抱怨 Flash 在创意写作方面表现不佳,并反映了向编码优化模型转变的更广泛趋势。几位评论者认为
DeepSeek V4 Pro GA 相对于其规模表现不佳,其中一人声称它表现出*“高度的奖励黑客”*,并且尽管规模接近6×,但并未比 Flash 模型显著更好
更大。技术上的担忧在于,Pro 更大的参数/计算规模并未转化为基准测试或实际能力的提升,因此如果推理成本高昂,退役是合理的。一个讨论帖比较了
DeepSeek和Google的案例,其中较小的“Flash”变体表现优于或匹敌更大的模型,表明这些可能并非来自单次大型训练的简单蒸馏。评论者推测,差距可能源于不同的架构选择、训练流程差异或数据混合效应,而非仅仅规模。这引发了一个问题:为什么较小的模型在某些任务上泛化得更好。一些用户区分了 API 退役与模型消失:
DeepSeek 停止了 V4 Pro 的服务,但据称权重仍然可用,这与 OpenAI/Anthropic 完全闭源的退役不同。另一个技术假设是,DeepSeek 可能正在释放推理容量或转向中国推理芯片,优先提供更便宜的 Flash 级服务,即使 Pro 保留了更多对规划/通用任务有用的世界知识。
(活动:537):DeepSeek-V4.1-Flash 令人惊讶 ....该图片是一个反应梗图,但它突出了一个技术主张:DeepSeek-V4.1-Flash 将全局 KV 缓存减少到仅890 字节/令牌
,远低于先前版本,而 DeepSeek-V4.1-Flash-Base 则显示为一个552B
参数的主干,仅激活8B/16B
参数。该帖子将此作为证据,表明未来的中型模型可以结合 MoE 或密集主干、10–15B
“Engram”组件以及 Flash 风格的 KV 缓存优化,以提高长上下文内存效率。评论者推测,微小的 KV 缓存设计可能使高内存本地推理硬件(如M5 Ultra 512GB或多Spark配置)更具吸引力,并且其他模型系列(如Qwen)可能会采用类似的 KV 缩减。一位评论者还纠正了对 Engram 规模的直觉,认为它们大约占参数的1/3–1/2
,例如一个30B
密集主干将搭配约10–15B
的 Engram。评论者关注
内存压力和硬件可行性,指出强大的“AA 分数”可能使极高内存的本地推理设置(如M5 Ultra512GB
和多Spark配置)更具吸引力。一位用户质疑,即使512GB
统一内存是否足以在使用多个子代理时“舒适地”运行 DeepSeek-V4.1-Flash,暗示 KV 缓存和并发开销可能超过原始模型权重成为主导因素。一个技术讨论帖讨论了架构参数分配:
engrams估计约占总参数的1/3
到1/2
,因此一个30B
密集主干将意味着额外的10B–15B
engram 组件,总计约40B–45B
参数。另一位评论者预计Qwen将采用“微小 KV”设计,这可以通过直接降低上下文内存需求来减少对 KV 缓存量化争论的依赖。
