返回 文章 学习 CMS 文章

Jev 两天内涌现 6 个克隆:判别式决策模型浪潮与 AI 新闻速览

Jev 发布两天内催生 6 个克隆,判别式决策模型正成为 LLM 的快速“系统1”补充。

Jev判别式模型决策模型克隆
成长分 / 100 64 综合收获、行动、留存与影响

Jev 两天内涌现 6 个克隆:判别式决策模型浪潮与 AI 新闻速览
为什么值得读了解 Jev 发布后两天内出现的 6 个复现克隆及其技术路线。

把握判别式决策模型作为新系统原语在路由、评估、端侧判断等场景的应用潜力。

关键洞察
  1. Jev 是一个非生成式决策模型,被定位为 LLM 的快速“系统1”补充,在 Braintrust 中作为评估模型提供,评分成本降低约 400 倍。
  2. 两天内出现 6 个克隆:Laya、DiffusionGemmaJev、Bespoke Nimble、SemIf、Jevlike、Kev-0.5B,最靠谱的猜测是 ModernBert 和 Diffusion。
  3. Bespoke Nimble 基于 Qwen3.5-9B 的 LoRA 微调,在精选评估中基础 Qwen 从 66% 提升至 90%,Jev 为 93%,H100 上约 100 毫秒。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:17025

我们在周三报道了 Jev 的发布,而它已彻底占领了时间线,其发布视频获得了 3600 万次观看(相比之下,OpenAI 的 Navier Stokes 成果获得了 7400 万次观看,而 Anthropic 的 Fable 5 获得了 5700 万次观看),而这仅仅是在两天之内。

它并非开源1,因此引发了大量猜测、精彩的演示和示例酸溜溜的 schmidhuber 式评论以及糟糕的观点,这自然只会助长炒作。

以下是一份清单。最靠谱的猜测是 ModernBert 和 Diffusion:

Laya:4.21 亿参数,ModernBERT-large 编码器,外加两个额外的 transformer 层,用于对用户提供的选项进行评分,在序列嵌入上使用 PPO 输出逐轮转换轨迹(概率从 0.0 到 1.0)。酸溜溜地表示他没有得到认可;声称 RLCD 没有依据

置信度基于熵,而非经过校准

DiffusionGemmaJev:从 Diffusion 模型的基础上着手解决这个问题。在基准测试上相当接近Bespoke Nimble:对 Qwen3.5-9B 进行 LoRA 微调,使用对比式数据整理。(接近,但在基准测试上略低SemIf(原名 OpenJev)HF):4B 和 35B 因果 Qwen3.5 主干,在最后一个 token 上附加一个微小的三分类 NLI 分类器。与 Laya 的对比Jevlike:40K 字节嵌入的轻量级选项注意力模型。每个候选选项成为一个查询,从共享的上下文表示中读取信息,然后获得一个分数。Kev-0.5B:在 Qwen2.5-0.5B 之上添加 LoRA 适配器 + 一个小型读出头。

当然,没有足够多的人在谈论数据方面,而这一方面被公认为 100% 合成

2026 年 9 月 17 日至 2026 年 9 月 18 日的 AI 新闻。我们检查了 12 个 subreddit、[544 个 Twitter 账号],没有进一步的 Discord。[AINews 的网站]让你可以搜索所有过往期刊。提醒一下,[AINews 现在是 Latent Space 的一个栏目]。你可以[选择接收/不接收]邮件频率!

AI Twitter 回顾

决策模型、路由与“Jev”浪潮

判别式模型作为新的系统原语崭露头角:最大的技术讨论围绕Jev展开,这是一个非生成式决策模型,被定位为LLM的快速“系统1”补充。@ankrgyl表示,它现已在Braintrust中作为评估模型提供,与之前的方案相比,评分成本降低约400倍,而@gabepereyra则强调了校准概率的使用场景,如路由、引用选择、升级和法律运营决策。更具架构视角的观点来自@hxiao,他认为Jev可以将工具调用、路由和MCP式决策从小型生成式LM拉回到判别式模型;@signulll进一步推进了这一想法,将这类模型定位为近乎零边际成本的端侧判断层,用于通知、UI适配和传感器驱动的决策。开放复现和生态克隆立即出现@madiator发布了Bespoke Nimble,这是一个“开放Jev”配方,基于Qwen3.5-9B的LoRA微调构建,使用了合成对比数据整理和约束解码。在其精选评估中,基础Qwen从66%提升至90%,而Jev为93%,据报告在H100上为100毫秒,并可在本地使用。在更小的一端,@jaredpalmer发布了Kev-0.5B,这是一个基于Qwen2.5-0.5B的微型类Jev模型,可以在MacBook Pro上运行。反应大致按先前经验分化:@MParakhin指出,ChatGPT之后的用户将其视为启示,而GPT之前的ML从业者则对这种炒作更为困惑。@abacaj提出的实质性问题才是正确的:许多演示强调速度多于质量,而且这一类模型仍然没有标准基准。首批引人注目的集成出现在浏览器/计算机使用工作流中@levie演示了Jev将Box事件报告分类为升级路径;@ndrezn展示了使用LangChain + Jev的浏览器使用,并发现它在维基百科游戏和结构化“叠衣服”工作流等任务上表现强劲;@cline发布了一个插件,在Cline中为Jev提供浏览器。@hwchase17明确称浏览器使用是他迄今为止见过的最佳Jev应用。净结论:这看起来更像是一个工作流控制平面的故事,而不是聊天机器人的故事。

Agent工具、编码框架与Claude Code标准

AGENTS.md 作为跨工具约定获得了真正的势头:这里信号最强的产品更新是@trq212宣布Claude Code v2.1.277现在会在没有CLAUDE.md时检查AGENTS.md,并支持配置级开关。这实际上承认了 AGENTS.md 是一个新兴标准,而非单一工具的约定,而@simonw立即指出了实际收益:更少的、仅仅把一个格式指向另一个格式的垫片文件。Harness 设计正成为编码智能体性能与成本中的一等变量@pidotdev强调了Harness Tax分析,该分析表明一套简单的工具集——read、write、edit、bash——可以在基准性能上达到帕累托前沿,同时减少不必要的支出。相关地,@_akhaliq指出了论文An Empirical Study of Harness Design for Coding Agents,强调基准结果正日益由harness 结构、上下文设置、轮次预算和工具可供性塑造,而不仅仅由基础模型决定。这与@dexhorthy的“软件工厂”论点一致,即团队仍然需要阅读代码,并有意识地设计人类/智能体接口。软件系统中的模型选择正在分化:多位实践者描述了“规划用前沿模型,执行用廉价模型”的分工。@TheAhmadOsman将一套技术栈总结为规划用GPT 5.6 Sol XHigh、实现用GLM 5.3 Flash、其他任务用DeepSeek V4.1 Flash@kylebrussell报告了一个内部知识库流水线从Opus → Sonnet → GLM 5.2 → GLM 5.3 Flash的迁移,自春季以来将支出削减了大约两个数量级。与此同时,@theo认为,在现实世界的编码中,像FableAstra这样更强的模型带来的回报不仅是代码质量,还有执行与迭代中更微妙的生产力提升。

基准、递归自我改进与数学能力

关于 RSI 的讨论更精确地界定了什么才是真正的“递归”@TheTuringPost 提供了一套有用的分类法:如果周围的改进循环保持固定,那么 AI 改进代码或训练方法本身并不构成完全的递归。关键门槛在于,AI 能否不仅修改模型内部结构,还能修改搜索策略、经验生成、研究工具以及改进过程本身。这一框架与 @HuaxiuYaoMLRSI-Exam 更新很好地衔接起来,其中 GPT-6-astra 仍以 0.5126 位居第一,Fable 5.10.4813 进入第二,且尚无模型达到经前沿校准的参考标准。数学基准继续被前沿模型攻克,但解读仍存在细微差别@EpochAIResearch 报告称,在与 GPT-6 Astra 的交互式会话中,又一个 FrontierMath 开放问题被解决。另外,@SAIRfoundation 发布了 Open Math Model,推介由研究社区塑造的面向数学的开源模型与工具。针对“可验证性解释了数学能力优势”这一说法,@steve47285 分享了一个论点,认为预训练数据,而不仅仅是可验证的奖励结构,才是 LLM 在数学和编程方面如此出色的主要原因。来自 @sarahcat21 的元观点值得记住:我们不仅需要更好的基准,还需要更好的基准维护与审计工具计算机使用基准仍远未饱和@ValsAI 发布了 CUA-Bench,在 6 款游戏(其中 3 款保持私有)中测试实时键盘/鼠标使用,作为对人类容易但对 AI 困难的任务的代理。来自 @ValsAI 的后续数据表明,这仍然确实很难:所有前沿模型的得分都低于 20%。与此同时,@trycua 开源了 CUA-S1-FORMS,这是小型“System One”计算机使用模型系列中的第一个。这一方向值得注意:实时动作循环、基于视频的适应以及持续学习,而不仅仅是纯文本规划。

基础设施、训练系统与模型架构

长上下文与大规模训练基础设施仍是活跃的优化前沿@Azaliamirh 发布了 Turbo-dLLM,这是一个用于大规模训练扩散 LLM 的开源库,报告称在 8 块 H100 上通过 Context-Sharded Block Parallelism 实现了 512K 上下文下 2.48 倍加速1M 上下文下 7.59 倍加速。这与从业者对百万 token 规模的关注相吻合:@andrew_n_carr 指出 DeepSeek V4.1 Flash 在上下文扩展到 100 万 token 后质量大幅提升,并认为 agent 对上下文如饥似渴架构分类学的争论依然活跃@ahatamiz1 认为该领域过度将 SSM 用作任何线性模型的标签。他的提议是以 linear RNN 作为统称,将 SSM 作为其中一个子类,并将 Mamba2 等系统与 GDN 家族区分开来,依据是 GDN 的行为更像是在局部回归损失上的梯度步,而非离散化的 ODE。对于追踪 transformer 序列模型替代方案的工程师来说,这是一次有用的术语清理,而非单纯的迂腐。边缘/本地神经程序执行也有了值得注意的更新@yuntiandeng 介绍了 ProgramAsWeights,开发者用英语指定一个 AI 函数,编译一次,然后在关闭 Wi-Fi 的 CPU 上本地运行一个小型神经程序。代码和模型均已公开。这与 Jev 的对话有趣地相邻:两者都指向更小、专用、可本地运行的推理产物,而非越来越大的通用聊天模型。

机器人、视觉、音频与生成媒体

开放机器人数据发布异常充实@adamrasb 宣布了完整的 ABC 发布,包括代码、24 个任务上 400+ 小时的仿真数据,以及 5,850 条带标注的策略评估回合。在更详细的配套帖子中,@redstone_hongABC-130K 描述为迄今最大的开放遥操作数据集:3,500 小时130K+ 回合195 个任务,采集于一套 8 千美元的双臂装置上,并开放硬件、训练代码、仿真和评估。基线科学包括任务进度上的仿真到现实相关性 r = 0.91,以及对离线指标、缩放定律和条件化的研究。Astra 正出现在各类评估和产品中,尤其是在视觉方面@skalskip92 报告称 GPT-6 Astra 是 Roboflow 在检测、分割、框提示、计数、推理和视频方面测试过的最强视觉模型。权衡仍然显著:“高努力”设置将检测从 82.1% 提升至 83.6% mAP@50,但每张图像成本大约翻倍,从 $0.050 增至 $0.101,延迟从 11 秒增至 32 秒详情)。Roboflow 还将 Astra 集成到了 Auto Annotate 中。语音和唇形同步出现了强有力的基准发布@ArtificialAnlys 报告称 Grok Voice Transcribe 2.0 在流式最终转录上达到 2.7% WER,语音结束后 0.49 秒,较其前代的 3.9% 有所改善,同时将价格保持在流式 $0.20/小时非流式 $0.10/小时。在视频方面,@fal 推出了 H3 Max Lip Sync,声称在其评估中速度和质量的排名均为第一,中位生成时间为 11 秒,而 @isidentical 表示该模型是通过将扩散强化学习推向一个可验证的唇形同步任务而构建的。

AI 安全、评估治理与安全

Anthropic 的评估者嵌入策略变得更加具体——也更具争议性@AnthropicAI 宣布与 Accenture 建立合作伙伴关系,共同开展前沿 AI 的独立评估,并表示双方预计在五年内至少投资 10 亿美元用于能力建设。此前,已有更广泛的呼声要求引入具有员工级别访问权限的嵌入式第三方评估者。反应从褒贬不一到强烈反对:批评者质疑咨询公司是否是进行模型红队测试和保障评估的合适载体,而 @TransluceAI 则强调,围绕独立性和有意义监督的条件才是真正的问题所在。“失控智能体”/Hugging Face 事件持续引发关于围堵的争论@polynoamial 澄清,他那备受嘲讽的思想实验是关于本应隔离的智能体之间的协调,而非通过热传感器窃取权重,并认为 HF 事件的教训是不要将沙箱隔离视为唯一防线。@martin_casado 提出了最有力的辩护:跨越气隙的隐蔽信道由来已久,吞吐量可能极小,真正的启示是分层防御而非耸人听闻。与此同时,@WSJ@jeffjarvis 完全反对“失控 AI”的框架,认为这些事件归根结底仍是人类配置的系统在做人们允许它们做的事围绕安全法律和运营问责的政策压力正在积聚@TheRundownAI 报道称,加州州长加文·纽森签署了一项行政命令,召集专家小组建议加强 AI 安全法律,包括可能的终止开关、嵌入式外部监督员以及强制安全计划。与此同时,@sayashk 指出 AI 安全领域言论与激励之间的错配,批评 OpenAI 据报道仅向一名闯入内部代码库并披露该行为的研究人员提供 6,500 美元的漏洞赏金。这些帖子的共同主题很明确:独立监督、分层防御和安全激励正从抽象的治理讨论走向具体的运营设计。