我不断看到 Jev 被描述为某种新型决策模型,但被宣传的大部分内容不过是现代零样本能力下的普通分类器行为。
它输出受约束选项上的概率,不进行自回归生成,无法输出无效类别,并且可以使用推理时定义的标签。这些都不是新东西。零样本/NLI 分类器、嵌入模型、交叉编码器和重排序器多年来一直在做这类变体。
奇怪的是,大多数令人印象深刻的 Jev 对比都是针对 LLM 的。当然,专用分类器比让自回归 LLM 生成答案更快、更便宜。这并不能确立一种新范式。有意义的对比应该是与强大的现有分类器进行比较。这样做的目的是误导。
已经有像 BTZSC 这样的基准测试,在 22 个数据集上评估了数十个零样本分类器,包括 NLI 模型、嵌入模型和重排序器。我还没有看到 Jev 在那个全景中得到恰当的基准测试。
(
)
在人们将 Jev 与传统分类器进行比较的地方,情况就没那么神奇了。一个 Banking77 实验中,BGE-small + 逻辑回归得到 93.3%,而 Jev 为 83.2%,本地运行约 9ms。
(
https://github.com/ickma2311/jev-baselines-eval
)
一些营销也进入了误导性领域。例如,“不会产生幻觉”的说法非常可疑。他们自己的解释承认 0% 幻觉数字并非经验性的,他们实际保证的是 Jev 返回与允许模式匹配的答案。这防止了无效输出,但并不能防止自信地选择错误的有效答案。(
https://typesafe.ai/blog/introducing-system-one-models-and-jev
)
所以把我算作怀疑者吧。看,Jev 甚至可能是个好产品。也许他们未公开的架构或 RLCD 训练方法确实是新颖的。但到目前为止我们看到的一切都没有确立“系统一模型”是一类新的 AI。公开证据主要确立的是,使用专用分类器进行分类比使用自回归 LLM 便宜和快速得多,这一点我们早就知道了。只有当你的 AI 概念始于并终于 LLM 时,它听起来才新颖。
阅读更多
讨论精选
puzzleheadbutbig (104↑):奇怪的是,大多数令人印象深刻的 Jev 对比都是针对 LLM 的 奇怪的是,Jev 开发者明确表示 Jev 不是 LLM(或 SLM)
那些将其与 LLM 比较并认为它可以替代他们正在使用的任何模型的人,要么就是错了,要么就是他们只是将 LLM 用于错误的任务。
caldazar24 (80↑):我以前训练过分类器,但我对零样本分类器的经验是,它们比 LLM 笨得多。在我尝试过的任何问题上,提示 LLM 输出一些 JSON,然后使用其中任何一个,效果都要好得多。 可能 Jev 没什么特别的,只是“嘿,让我们投入更多资源到一个大型零样本分类器上,至少在我们用来训练 LLM 的资源几个数量级之内”。那仍然很棒!它在市场上占据非常有价值的位置,即使它不是突破性科学。
GPT-2 和后来的 GPT-3 基本上也只是“嘿,让我们做更...
Space_Brilliant_7273 (49↑):我使用 spaCy 和 scikit-learn 对句子和词语进行分类已经超过 10 年了,看到人们在 2026 年才发现 NLP 分类,我觉得挺好笑。 在我看来,Jev 几乎和 spaCy 以及 scikit-learn 一样。