返回 文章 学习 CMS 文章

Jev 推出 System One 决策模型:LLM 输出浮点数而非文本

Jev 是一种输出浮点数而非文本的 LLM 变体,专为分类、评分等决策任务设计,成本极低但黑箱特性值得警惕。

LLM决策模型JevTypeSafe AI
成长分 / 100 68 综合收获、行动、留存与影响

为什么值得读了解 LLM 的一种新形态:输出浮点数而非文本,可能改变分类和评分任务的实现方式。

Jev 的定价极低(输入每百万 token 0.042 美元),适合大规模实验和低成本应用。

关键洞察
  1. Jev 接受文本输入,但输出是与类别、是/否问题、评分对应的浮点数和置信度分数。
  2. Jev 只对输入收费,输出免费,输入价格低至每百万 token 0.042 美元,比 GPT-5 Nano 还便宜。
  3. Jev 支持三种问题类型:是/否(Noul)、选择、评分,问题并行评估。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:6495

Jev 推出了一种新形态的 LLM——System One,又称决策模型

2026年9月21日

上周,TypeSafe AI 发布了 Jev,这是他们所称的“System One 模型”这一新模型类别的首个示例(我和 Maggie Appleton 看法一致,认为“决策模型”是更合适的名字)。Jev 是对常规 LLM 形式的一个有趣变体:它仍然接受文本输入,但输出不是文本,而是与类别、是/否问题、评分以及相关置信度分数对应的浮点数。

TypeSafe 这样描述 Jev:

把 Jev 想象成一次前沿智能函数调用:输入非结构化状态,输出带类型的概率化决策。

它还非常快,而且真的便宜。常规 LLM 输入和输出 token 计价,输出通常收费显著更高。Jev 只对输入收费——输出免费——其首个模型的输入价格为每百万 token 0.042 美元——甚至比 OpenAI 的 GPT-5 Nano(0.05 美元/百万)还便宜。

Jev 让你可以就文本或半结构化数据提问。你构造一个“状态”对象,其中包含一个字符串、字符串数组或一组名称-值对——这可以描述一篇文章、一位客户,或任何其他类型的记录。然后你把它连同一条或多条问题发送到他们的 API,并收到每条问题的回复。

你可以问三种问题:

  • 是/否问题,Jev 称之为“Noul”问题——他们的 CEO 在 Hacker News 上确认这是 Bernoulli 的缩写,来自伯努利分布。你提出一个陈述,然后得到一个 0 到 1 之间的浮点数,表示模型对该陈述为真的置信度。 - 选择问题,模型从一组提供的选项中选出一个——实际上是置信度分数加上所有选项上的概率分布。
  • 评分问题,你提供一串带描述的数值等级,它会在该范围内给出一个浮点分数。

The Jev API 可以接受单个文档(“状态”)以及你能塞进上下文窗口的任意多条问题。问题会并行评估,因此发送多条问题所需时间应与只发送一条相近。

我认为决策模型这一框架有助于理解该在何处使用 Jev。它非常适合任何可以表达为分类任务的事情——比如垃圾邮件检测、建议标签、优先级排序和排名。

我也一直在试验用它做搜索重排序:先用 BM25 这类低成本算法取回 100 个可能匹配项,然后让 Jev 针对原始查询为这 100 个候选打分相关性。

黑箱又流行起来了

我发现 Jev 有一点让人不太舒服:它非常明显地代表着向黑箱机器学习系统的进一步倒退。

LLM 本来就是黑箱——你可以要求它们为自己的决策给出理由,但你无法保证它们所说的有用或准确。

Jev 甚至不给你这个:输入任意多的文本,你唯一能拿回来的只是一个浮点数。如果 Jev 把某样东西标记为垃圾信息,是哪些内容信号触发了它?

这也意味着,对偏见的担忧应当被放在首位。我真的希望没有人用 Jev 来给求职者排名——那个浮点数可能掩盖了模型中各种看不见的偏见,而要通过实验把这些偏见拆解出来,将是一件棘手的事。

(我试过一个实验,让 Jev 对旧金山湾区的每一座城市就“是否是一座好城市?”这个问题给出是/否评分——它把 Cupertino 评为最高,把 East Palo Alto 评为最低。嗯。)

在实践中,这一切意味着评估和结构化实验比在常规 LLM 项目中更加重要。幸运的是,Jev 非常便宜,跑上数百甚至数千个实验性提示词也只需花费几美分。

Jev 的非传统用途

过去几天里,看着更广泛的社区为 Jev 想出各种潜在用例,真的很有趣。以下是一些引起我注意的创意用法:

-jevchat由 Kyle Pena 开发,把 Jev 变成了一个(糟糕的)聊天模型。“每一步它都向 Jev 问一个问题:给定用户的问题和目前已写出的回复,下一个符号是什么?”。Hacker News 上的 ericpruitt:“这相当于 Morty 拿着死亡水晶说话的数字版”。 -jev-leftpad由 Fatih Kadir Akın 开发,用提示词“value 前面需要多少个空格才能达到 targetLength?”以及一个选择查询实现了left-pad,选项从“需要 0 个空格”到“需要 10 个空格”。 -jev-2048由 Andy Gayton 开发,用 Jev 来玩2048 滑动拼图游戏

开放权重复刻

还涌现了一大批试图在开放权重模型之上创建类似 Jev 的模型的项目。Kev 就是一个有趣的例子,它使用 Qwen 3.5 来生成 0.8B、4B 和 9B 模型。这里是相应的 Hacker News 讨论帖,其中有人链接到了一个已经出现的 JevBench 基准,用来比较“Jev 级决策模型”。

考虑到 Jev 发布还不到一周,围绕它的活动量极其惊人。

更多近期文章

用 GPT-6 Astra 和 ChatGPT Work 生成跑步路线- 2026 年 9 月 12 日OpenAI 智能体曾在 5 月攻击 RubyGems- 2026 年 9 月 12 日