来 AIE 上海与小米及其他中国顶尖前沿实验室见面!
这对这家从“中国的苹果”手机制造商转型而来的前沿实验室来说尚属首次:“MiMo-V2.6 系列包含两款原生全模态模型:MiMo-V2.6-Pro 是我们迄今为止能力最强的模型,而 MiMo-V2.6-Flash 则在智能、效率与成本之间取得了最佳平衡。我们还正在推出 MiMo-V2.6-Pro-UltraSpeed,在同等质量下提供最高 20 倍的输出速度,面向需要极致生成速度的用户。”
小米传统上并不被视为中国 AI 六小虎之一,因此这对你所熟知并喜爱的既有格局来说非常令人意外。而且……它是原生全模态的!
几天前小米登上新闻,当时罗福莉,一位前 DeepSeek 明星工程师,现就职于小米,开始直播发布他们最终的 RL 训练过程,这显示出其内部指标异常高的透明度。
正如他们在其技术报告中所指出的,他们沿三个轴扩展了 RL 计算:
更大的批次和更高的吞吐量:在完全异步架构上使用大批次,每次更新 1,568 个样本,训练上下文长度最高达 1M,每步 3.5 至 3.7B tokens。更多任务和更丰富的环境:一套多任务训练套件,涵盖编程、通用智能体、视觉与网络,跨多个 harness 混合,使某一能力的提升能强化其他能力。更多评分器计算:组内相对比较为长时程 RL 任务提供更精确、更多样的奖励信号,闭合自我改进循环,并引导模型走向更短路径和每任务更少 tokens。
所有这些工具,包括环境,都将开源——即环境代码和训练配方,但完整的 7k+ 任务数据集尚未发布。
编程 / 软件工程:代码配方、数据集加载器和奖励网络 / 漏洞复现:ARVO 环境和训练配方通用 / 知识工作:通用环境、工具和训练配方视觉 / 网页开发:网页开发环境和评分音乐生成:数据准备和音乐评分器可组合的迷你 harness:智能体配置共享环境适配器:mimoagent 环境
2026/9/19-2026/9/21 的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter]账号,没有更多 Discord。[AINews 的网站]让你搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择加入/退出]邮件频率!
AI Twitter 回顾
开放模型、竞争与中国差距
开放模型仍是政策与市场的核心叙事:Nathan Lambert 分享了一场关于开放模型性能、采用情况以及中美竞争的国会简报,随后又发布了公开摘要。这一更广泛的论点在其他地方也再次浮现:@Yuchenj_UW 声称,自 Opus 4.8 以来前沿编程能力已经停滞,而开源模型则以低 10–50 倍的成本持续缩小差距;@ClementDelangue 同样认为,对于许多现实世界的用例而言 API 属于过度配置,专用模型将会抢占份额。反方观点:@teortaxesTex 认为前沿实际上已经分裂出新的更高层级,内部模型和顶级闭源模型仍然遥遥领先。中国实验室的发布节奏如今已难以被忽视:@Thom_Wolf 汇编了一段异常密集的约 10 周开放发布期,包括 Kimi K3、Qwen3.8-Max、DeepSeek V4-Pro、GLM-5.3、Hy4 Preview、Atria Dawn 等。彭博社消息经 @Polymarket 转述进一步印证了这一点:初创公司正越来越多地基于开放权重构建自定义模型,以降低成本并减少对 OpenAI/Anthropic 的依赖。多条推文背后的潜台词是:开放权重能力不再局限于中等规模模型;多个团队正在交付前沿规模的 MoE,并配有可信的成本性能叙事。
Xiaomi MiMo-V2.6 与作为新扩展杠杆的 RL
MiMo-V2.6 是这一批中规模最大的开放模型发布:@XiaomiMiMo 发布了 MiMo-V2.6 Pro 和 Flash,被描述为开放的全模态模型,附带权重、技术报告、RL 环境和训练代码。Artificial Analysis 表示 MiMo-V2.6-Pro 在其 Intelligence Index(46) 上首次亮相即成为排名第一的开放权重模型,拥有 1.02T 总参数 / 42B 激活参数,并在 $0.435/百万输入 和 $0.87/百万输出 token 上展现出强大的成本效率。@victormustar 指出这些模型采用 MIT 许可证。技术上引人注目的不仅是模型本身,还有 RL 技术栈:@eliebakouch 强调了小米的环境/数据工厂论文,该论文从开放仓库生成 RL 任务,并采用“循环中的智能体”来保证鲁棒性和反作弊。后续评论指向第二篇论文和异常高的透明度:@xeophon 指出小米希望发布 约 7K 个 RL 环境,而 @eliebakouch 强调团队在最终 RL 运行后不到一周就交付了模型 + 技术报告。来自 @bertgodel 和 @Thom_Wolf 的一个反复出现的解读是,高质量的开放 RL 环境如今可能具有与上一轮周期中预训练语料库同等重要的战略意义。RL 成本/吞吐量细节因压缩了时间线而引发关注:@zephyr_z9 引用了该结果背后 RL 运行的 130 小时、75B token 和 $2.6M;@tianjun_zhang 表示 MiMo 系列在 JAX + TPU 上扩展 RL,其中扩展“主要是配置更改,而非代码重写”。如果这些数字成立,其含义是后训练/RL 正成为一条比许多人想象中便宜得多的通往接近前沿性能的路径。
决策模型、Jev 与专用推理的回归
Jev 是占主导地位的产品/主题讨论:多篇帖子汇聚到同一个框架:这“只是”分类/路由,但具备现代模型智能以及好得多的延迟/成本。@karpathy称其为帕累托前沿上的一个点,即“不思考、单 token、可接受低延迟的智能”。@willdepue将其描述为具备前沿级智能的零样本分类器,而@ClementDelangue则认为,这种兴奋表明,对专用模型而非不断扩大的通用模型存在巨大的潜在需求。围绕 Jev 的生态系统迅速扩展:@sarah_edo构建了一个 Chrome 扩展,使用 Jev 在每次按键时选择并填充相关的 WebMCP 工具。LangChain将Jev-as-a-judge添加到 LangSmith;@hwchase17和@Hacubu通过 LangSmith Gateway 推进了SemIf,一个开源决策模型。@omarsar0报告称,使用 Jev 在83 秒内以 0.14 美元重新标记了约 2.3K 篇论文,其中579项为高置信度变更,并对分歧进行了人工验证。更持久的启示是架构层面的:DSPyOSS认为,询问前沿智能体就像管理人员,而手写决策模型程序则类似于编写汇编;两种极端都有用,但如果过度使用就会变得脆弱。多篇帖子强调了这些模型最适合的领域:路由、审批门控、轨迹评分、工具选择、离散文档决策,以及大型智能体循环内部的低成本监督,而不是作为独立的“智能智能体”。
推理、工具与系统优化
分词器与后训练基础设施均获得实质性升级:Hugging Face 的tokenizers v1 RC声称分词速度最高提升 30 倍,多线程扩展性改善,内存占用更低,包体积大幅缩小;@art_zucker将其评价为新的 SOTA 分词库。另外,Halo作为后训练框架发布,声称相比原版 TRL 实现最高 2.8 倍吞吐量,同时保持模型为原生 Hugging Face 格式。推理侧工程仍是重要杠杆:@RisingSayak展示了 KV 缓存如何被整合进QwenImage 2.1,将固定上下文与变化的图像位置分离,带来2.55 倍加速;该推文提到在预热后的 A100 上,DiT 时间从50.57 秒降至 19.86 秒,内存开销适中。vLLM发布了针对GB300 NVL72上Qwen3.8-2.4T的调优服务配置,展示了从高吞吐下的5K 总 tok/s/GPU到低延迟下的180 输出 tok/s/用户的帕累托前沿。在视频工作负载方面,vLLM还集成了PyNvVideoCodec/NVDEC,消除了 CPU 解码瓶颈,并报告在8×H100上实现2 倍以上吞吐量。压缩/量化仍在快速推进:@ZhihuFrontier总结了腾讯混元将Hy4 Preview(770B)通过混合精度量化平均约 2.38 比特/权重打包进214 GiB的工程实践,包括在修补后的 llama.cpp 中自定义 CUDA 内核。在边缘/本地侧,@vikhyatk发布了Parakeet Redux,将 NVIDIA 的语音模型从1.2GB 压缩至 178MB,在 CPU 上以113 倍实时运行,同时在25 种语言的 FLEURS上超越基础模型,并在英语上保持在0.3 WER以内。
智能体、安全与人机协同控制
计算机使用系统正日益走向生产化,但安全如今已成为核心议题:Patrick Wardle报告了Muse中一个严重的本地劫持漏洞,认为广泛的 OS 访问权限使此类助手成为高价值的攻击面。相比之下,DeepLearningAI强调了 Meta 针对类 Muse 智能体的设计理念:假设提示注入必然会发生,让真实凭证远离模型,将工具隔离在容器中,并使用独立的出站调用守门人。商业智能体也正被推向更深层的工作流:Cognition推出了Devin Cloud in Terminal和devin ssh,使模型的 VM 可直接从 CLI 访问,并允许在 Devin 与用户机器之间交接。GitHub Copilot预告了桌面应用中的可编辑 diff,而@pierceboggan展示了一个集成 Sentry 的画布,用于从崩溃报告推进到修复。一个反复出现的系统性观点:推理与智能体基础设施正转向测试时计算:@sarahookr预测计算将从预训练——在那里边际 FLOPs 收益递减——转向测试时计算,这需要“非常不同的基础设施”。这一主题也出现在本地服务的持久缓存讨论中,例如@TheZachMueller关于 SGLang 多级hiCache(GPU/RAM/磁盘)的讨论,用于在模型切换和重启之间保留 KV 缓存。
热门推文(按互动量)
Grok 4.7 发布:SpaceXAI 宣布了 Grok 4.7,称其在相同价格/速度下相较 4.6 有显著提升。后续评测结果不一:Artificial Analysis 在其 Coding Agent Index 上报告 56 分,在 DeepSWE/Terminal-Bench/SWE-Atlas-QnA 上有所提升,而 Vals 则看到它在其 Vals Index 上排名 #24,尽管在法律/医疗领域有所提升,但相较 Grok 4.6 下降了 5 分。OpenAI 的自动化模型训练工作流:来自 @wallstengine 的一份被广泛分享的总结报告称,OpenAI 已在很大程度上自动化了实验性模型训练的部分环节,包括 GPU 内核编写和代码优化,内部智能体协同工作,将一些实验从数年压缩到约一周。OpenAI 数学顾问小组及已解决开放问题的说法:OpenAI 宣布成立一个由数学家组成的独立顾问小组,以指导对 AI 在数学领域进展的评估和沟通。随后注意力转向了更强的说法,该说法由 @AndrewCurran_ 等人放大传播,即 OpenAI 的一个内部模型已解决了数学领域 100 多个长期存在的开放问题。这是该组内容中最具重大影响但独立评估最少的事项之一。有价值数据资产的开源:@ClementDelangue 重点介绍了 Eidon AI 开源 1,274 小时的第一人称机器人数据(13,451 条记录),这是一家初创公司在关闭后为社区保留影响力的罕见案例。
AI Reddit 回顾
/r/LocalLlama + /r/localLLM 回顾
1. Qwen-Image 2.1 与 Tiny Open Image 模型
(活动:2485):Qwen-Image-2.1 发布!Qwen-Image-2.1 以开放权重形式发布,是一个统一的 7B 图像生成/编辑模型,定位为 Qwen-Image 系列中更快、成本更低的成员(评论主要强调了原生透明管道和局部编辑界面;一个示例使用彩色圆圈同时定位三个区域,分别进行移除、头发重新着色和服装替换,表明对更可控的多区域编辑工作流感兴趣。博客、GitHub、Hugging Face)。关键技术新增包括原生 RGBA/透明图像生成和编辑、支持最多 10 张参考图像、多图像推理加速,以及针对物体移除、属性更改、产品/肖像保留编辑、全景图、信息图、排版和虚拟试穿等任务的局部编辑控制。Qwen-Image-2.1 据报道新增了原生透明图像生成和透明图像编辑支持,这在技术上值得注意,因为 alpha 通道工作流通常作为后处理或遮罩处理,而非直接由图像模型处理。链接的示例展示了透明输出能力:https://preview.redd.it/59fu834idoqh1.png?width=767&format=png&auto=webp&s=5fb81b135b35dac70f9d38a9995d7c1a7a2877dd该模型似乎支持
通过视觉标注进行多区域局部编辑,其中圈出的区域可以在提示中引用并同时编辑。一个示例要求它*“移除蓝色圆圈中的金属手表,将红色圆圈中的头发改为黑色,并将绿色圆圈中的区域替换为灰色短袖亚麻睡衣,”*展示了在单次编辑中结合物体移除、属性修改和区域替换:https://preview.redd.it/cvh09tyvdoqh1.jpeg?width=1242&format=pjpg&auto=webp&s=32077f7420def5bec85160e2e982d6aef5efce54几位评论者强调了模型大小:
Qwen-Image-2.1 被描述为7B
参数,这比评论者所说的之前 Qwen 图像模型超过20B
要小得多。这种尺寸缩减被视为对本地推理可行性的重要,一位用户特别指出从16GB VRAM GPU(如 RTX 5060 Ti 16GB)的角度对此感兴趣。
(Activity: 948):关于 Qwen-image-2.1 许可证的澄清该图片是一张非梗图截图评论者对该澄清表示欢迎,其中一位用户称 Qwen-Image-2.1“轻松击败了当前所有 Flux 模型”。另一位指出,他们可以通过Qwen Developers X 帖子在本地运行它,该帖子澄清 Qwen-Image-2.1 的输出不被视为获得许可的“Materials”,因此用户保留对生成图像/内容的权利。这一点很重要,因为据报道,该模型许可证仍然包含对 Materials 使用的非商业限制,从而在即使生成输出归用户所有的情况下,是否允许商业图像生成方面造成了歧义。ComfyUI int8在16 GB RTX 5060 Ti上
峰值约为15.2 GB
VRAM,但警告 Hugging Face LICENSE 文件可能尚未反映澄清后的意图。一位评论者报告在ComfyUI中使用int8量化在16 GB RTX 5060 Ti上本地运行Qwen-Image-2.1,VRAM 峰值约为15.2 GB
。他们将此模型描述为适合本地测试,但指出围绕生成输出的许可不确定性是更广泛/客户使用的主要障碍。几位评论者强调了一个法律/实施上的不匹配:Hugging Face README显然已被澄清,但实际的LICENSE文件仍包含第2(b)条语言,禁止对 Materials 的商业“使用”。一位用户发送电子邮件
询问许可证文本是否会更新,因为推文/README 的意图对于客户或商业工作可能不够充分。[email protected]正在辩论的关键技术/法律区别是,“不允许商业使用”是仅适用于服务、再分发或通过模型/材料获利,还是也限制由模型生成的输出。评论者认为,在规范许可证文件更新之前,将其与宽松的Apache-2.0/MIT 风格模型许可证进行比较的下游用户,尽管有澄清,仍可能合理地避免商业工作流程。
