返回 讨论 学习 CMS 文章

Jev 并非新技术:其营销瞄准了以为 AI 始于 LLM 的人

Jev 只是现代零样本分类器,其营销通过对比 LLM 制造新颖性假象。

Jev零样本分类LLM分类器
成长分 / 100 59 综合收获、行动、留存与影响

为什么值得读了解 Jev 被质疑为普通分类器而非新范式的原因。

获取关于零样本分类器与 LLM 对比的误导性营销分析。

关键洞察
  1. Jev 输出受约束选项上的概率,不进行自回归生成,无法输出无效类别,这些是零样本/NLI 分类器、嵌入模型、交叉编码器和重排序器多年来的常见能力。
  2. 大多数令人印象深刻的 Jev 对比都是针对 LLM 的,但专用分类器比 LLM 更快更便宜并非新发现,有意义的对比应与强大的现有分类器进行。
  3. 已有 BTZSC 基准测试在 22 个数据集上评估了数十个零样本分类器,但 Jev 尚未在该全景中得到恰当基准测试。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:3623

我不断看到 Jev 被描述为某种新型决策模型,但被宣传的大部分内容不过是现代零样本能力下的普通分类器行为。

它输出受约束选项上的概率,不进行自回归生成,无法输出无效类别,并且可以使用推理时定义的标签。这些都不是新东西。零样本/NLI 分类器、嵌入模型、交叉编码器和重排序器多年来一直在做这类变体。

奇怪的是,大多数令人印象深刻的 Jev 对比都是针对 LLM 的。当然,专用分类器比让自回归 LLM 生成答案更快、更便宜。这并不能确立一种新范式。有意义的对比应该是与强大的现有分类器进行比较。这样做的目的是误导。

已经有像 BTZSC 这样的基准测试,在 22 个数据集上评估了数十个零样本分类器,包括 NLI 模型、嵌入模型和重排序器。我还没有看到 Jev 在那个全景中得到恰当的基准测试。

(

https://proceedings.iclr.cc/paper_files/paper/2026/hash/417e1c15b3d49852fceded8aa104107d-Abstract-Conference.html

)

在人们将 Jev 与传统分类器进行比较的地方,情况就没那么神奇了。一个 Banking77 实验中,BGE-small + 逻辑回归得到 93.3%,而 Jev 为 83.2%,本地运行约 9ms。

(

https://github.com/ickma2311/jev-baselines-eval

)

一些营销也进入了误导性领域。例如,“不会产生幻觉”的说法非常可疑。他们自己的解释承认 0% 幻觉数字并非经验性的,他们实际保证的是 Jev 返回与允许模式匹配的答案。这防止了无效输出,但并不能防止自信地选择错误的有效答案。(

https://typesafe.ai/blog/introducing-system-one-models-and-jev

)

所以把我算作怀疑者吧。看,Jev 甚至可能是个好产品。也许他们未公开的架构或 RLCD 训练方法确实是新颖的。但到目前为止我们看到的一切都没有确立“系统一模型”是一类新的 AI。公开证据主要确立的是,使用专用分类器进行分类比使用自回归 LLM 便宜和快速得多,这一点我们早就知道了。只有当你的 AI 概念始于并终于 LLM 时,它听起来才新颖。

阅读更多

讨论精选

puzzleheadbutbig (104↑):奇怪的是,大多数令人印象深刻的 Jev 对比都是针对 LLM 的 奇怪的是,Jev 开发者明确表示 Jev 不是 LLM(或 SLM)

那些将其与 LLM 比较并认为它可以替代他们正在使用的任何模型的人,要么就是错了,要么就是他们只是将 LLM 用于错误的任务。

caldazar24 (80↑):我以前训练过分类器,但我对零样本分类器的经验是,它们比 LLM 笨得多。在我尝试过的任何问题上,提示 LLM 输出一些 JSON,然后使用其中任何一个,效果都要好得多。 可能 Jev 没什么特别的,只是“嘿,让我们投入更多资源到一个大型零样本分类器上,至少在我们用来训练 LLM 的资源几个数量级之内”。那仍然很棒!它在市场上占据非常有价值的位置,即使它不是突破性科学。

GPT-2 和后来的 GPT-3 基本上也只是“嘿,让我们做更...

Space_Brilliant_7273 (49↑):我使用 spaCy 和 scikit-learn 对句子和词语进行分类已经超过 10 年了,看到人们在 2026 年才发现 NLP 分类,我觉得挺好笑。 在我看来,Jev 几乎和 spaCy 以及 scikit-learn 一样。