返回 文章 学习 CMS 文章

TypeSafe 发布 System One 模型与 Jev:面向自动化的快速结构化决策模型

TypeSafe 推出 System One 模型 Jev,用校准决策强化学习替代字符串生成,为自动化提供快速、结构化、无幻觉的决策接口。

TypeSafeSystem One ModelsJevRLCD
成长分 / 100 67 综合收获、行动、留存与影响

TypeSafe 发布 System One 模型与 Jev:面向自动化的快速结构化决策模型
为什么值得读了解一种不同于主流 LLM 聊天范式的新模型类别:专为自动化决策设计,输出带类型的概率化决策而非字符串。

获取 Jev 在速度、成本、置信度校准和类型安全方面的具体技术主张与评估方法。

关键洞察
  1. System One 模型专为快速、结构化、可供软件直接使用的决策而构建,Jev 是首个公开模型,已开放早期访问。
  2. Jev 采用校准决策强化学习(RLCD),优化目标是给出认识论上诚实的概率答案,每次输出都传达置信度和不确定性。
  3. Jev 放弃字符串生成,针对结构化输出优化,不会产生幻觉,可视为前沿智能的函数调用:输入非结构化状态,输出带类型的概率化决策。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:12037

公司新闻

2026年9月15日

推出 System One 模型与 Jev

Diogo Almeida,TypeSafe 创始人

多年来,模型在聊天方面已超越人类水平,那么自动化究竟在哪里?

这是我过去四年一直思考的核心问题。在 OpenAI 期间,我参与构建了使语言模型能够有效遵循指令并与人类对话的方法。这项工作最终成为了 ChatGPT 背后的研究基础。当时,我以为聊天模型或许能通向 AGI,但尽管炒作不断,我逐渐清楚地意识到,有些极其重要的东西仍然缺失。

经过两年的隐身开发、无数技术挑战和研究突破……我无比激动地宣布,今天,TypeSafe AI 正式发布我们的首个 System One 模型:一类全新的前沿模型,专为做出快速、结构化、可供软件直接使用的决策而构建。

我们构建了一套完全专注于自动化的全新技术栈:包括全新的模型架构、用于最大化效率的并行采样器,以及我们称之为“校准决策强化学习”(RLCD)的训练方法。

我们的首个公开模型是 Jev,即日起开放早期访问。在 System One 任务上,Jev 达到了与现有 LLM 相近的智能水平,同时速度快了两个数量级,效率也更高。虽然 Jev 放弃了字符串生成,但它针对结构化输出进行了优化,并且不会产生幻觉。

可以把 Jev 看作一个前沿智能的函数调用:输入非结构化状态,输出带类型的概率化决策。

非凡的主张需要非凡的证据,所以请看下方的凭据。💅

前沿,新旧对比

优化方式
优化目标
输入
输出
采样
成本
速度
置信度
使用场景

证据 / 技术结果

我们喜欢怀疑者,我们自己也是怀疑者。

有些主张你可以轻松验证:

每次调用速度:我们确实有那么快,尽管我们发布的评估通常是在西海岸的笔记本电脑上运行的(这是我们服务目前所在的地方)。每次调用成本:我们让定价透明。我们无法证明它没有补贴;我们需要长期来证明我们定价的可持续性(我们预计它会下降,而不是上升)。无类型错误:这很容易用一个反例来证伪,但在数学上是不可能的。

对于我们更大胆的主张,我们希望尽可能提供细微差别。

并排演示

我们的并排演示展示了我们的模型与LLM之间的一个关键区别:Jev并行输出所有概率,而不是按token自回归生成。字符串极其强大和通用,但代价高昂。“放弃”字符串实际上给了我们很多超能力!

细微差别

对于早期访问TypeSafe的人,这里是

实际查询。查询被高度简化,questions

被选择为具有描述性的、人类可读的键,以便屏幕上的输出易于理解。

state

也是一个简短、密集且详细的段落,以强调采样方法的差异。相对较短的输入使我们的模型处于有利地位。

对于眼尖的人来说,在录制的运行中,与GPT-5.6 Terra的唯一分歧在于“流失可能性水平”。实际答案对我们来说似乎真的模棱两可。

我们在这个例子中使用了默认推理的GPT-5.6 Terra,因为我们发现它在智能上平均与Jev最具可比性。

有趣的事实:一个类似的演示说服了我们全力投入System One Models的方向!

工作流评估

我们制作了一种新型评估来衡量AI在代码中的工作效果。我们不针对真实分类进行优化,也不允许测试框架和模型改变(可能通过框架工程导致过拟合)。相反,我们假设存在一个正确的计算图(用代码表示的“工作流”),并使用最大、最智能、最昂贵的外部模型的预测作为参考概率。

换句话说:每个模型都得到相同的工作流。我们测试它们与最智能模型(在这种情况下是Astra和Fable)的平均值相比如何。

Jev超出了图表——在几乎两个数量级上占据了帕累托前沿。我们还与使用生成提示在其思维链中完成所有逻辑的模型进行了比较,但这往往比使用工作流本身差得多。

请注意,这里的调用比上面的并排演示要复杂得多。这是因为它们更能代表真正业务自动化所需的生产工作负载类型。下面是我们发布的4个工作流中最简单的一个:

最可靠的现实世界工作流往往有许多独立的、分解的问题,其细粒度行为依赖于概率而不是离散决策。最终结果是离散分支,但我们如何得出最终答案涉及大量需要高度一致完成的领域特定工程。

请访问我们的工作流评估网站查看所有细节:示例、分歧、完整查询以及每个工作流。

细微差别

这就是我们主页上宣称的 193.6 倍更快、444.6 倍更便宜的数据来源,我们预计这些数字处于实际收益的较高端。

这些工作流的内容并非刻意挑选或构建以让我们的模型看起来更好,也不在我们的训练分布中。然而,它们是由我们模型能力团队的成员制作的,因此可能存在一些偏差。

我们使用 GPT-6 Astra 和 Fable 5.1 的平均值作为参考答案,这会使答案偏向 OpenAI 和 Anthropic 的模型。我们可能低估了我们模型和 DeepSeek 模型的相对性能。

这些 LLM 使用了我们的

System One LLM 封装器,该封装器约束 LLM 输出与我们的 API 兼容的结构化决策。我们发现这是从 LLM 获取决策的最准确方式,但相比不提供概率的决策方式,这往往更慢且更昂贵。

幻觉与类型安全

幻觉与类型安全本质上是相关的,我们认为后者是自动化的基本要求。在智能体中,一个幻觉的工具调用可能只是不便,但如果它是具有延迟保证的系统的一部分,或者深埋在依赖链的几层之下,那就是绝对不可接受的。现有模型,无论多么智能,仍然会产生幻觉并出现类型错误。

细微差别

LLM 的数据来自 OpenRouter,即这里几乎肯定存在偏差:更复杂的查询可能会被路由到更好的模型。

我们的数字不是经验性的。模式匹配是有保证的,因此我们可以自信地在图表中加入 0%。

趣味演示

也许我们工作中最令人兴奋的部分是启用新的用例。我们还有很多要展示给您,但以下是团队最喜欢的几个:

Doom

我们喜欢这个 doom 演示展示了实时智能以及代码 + AI 能做什么。背后的工程师担心每秒 10 次查询(最终成本约为 7 美元/小时),但我们其他人一致认为这低于预期!这太有趣了,我们不仅打算发布深入的演练,还计划举办一些活动来对此进行黑客攻击。

细微差别

该演示基于结构化状态作为带有文本的数据结构,而不是图像(目前……)

一个非 AI 的 doom 机器人可能玩得更好,但我们想要一个能对不同游戏状态表示做出反应的机器人,最重要的是……遵循指令真是太酷了!

Wikiracing

游戏的目标是从一个维基百科页面开始,仅使用你在浏览过程中遇到的链接到达另一个特定的维基百科页面。每一步都可能意味着在数百到数千个链接之间进行选择!这是一个绝佳的试验场,不仅可以展示每秒智能,还可以展示在高基数选择中不产生幻觉的复合收益。

细微差别

据我们所知,第二次和第三次挑战都以“Rubber Duck”开始完全是随机的。作者只是在团队指出时才注意到。

我们这里的加速比往往远低于之前的演示。这是因为这次对比的是模型的非推理模式(除了 Astra,它被设置为最低推理设置)。这也是 Jev 倾向于用更少步骤完成的原因(这是更高智能的标志)。这样做是为了让演示更易于观看。在启用推理的情况下,LLM 在这项任务上的表现要差得多。

Jev 支持最高 255 的基数。对于更高的基数选择,我们采用两阶段系统:先独立评分,然后做出明确选择,因此偶尔会出现速度变慢。

下一步

我们仍处于 Jev 的早期阶段。我们还有很多在筹备中,非常兴奋能继续发布 🔥。

今天,我们开放了早期访问,并正在尽快让开发者从等待名单中移出。我们想听听你需要自动化哪些决策,Jev 在哪些方面有效,以及在哪些方面不足。告诉我们你想构建什么样的科幻!

我们创立 TypeSafe 是因为我们相信 AI 需要一个软件可以依赖的接口。我们迫不及待地想看到新的用例持续扩散到社区和经济中。

我们提供常见问题解答

“System One Models”和“Jev”这两个名字从何而来?

我们受到 Daniel Kahneman 的《思考,快与慢》的启发。模型类名借鉴了快速、直觉的系统 1 思维与缓慢、深思熟虑的系统 2 推理之间的区别。

“系统 1 思维”也暗示了容易出错。出于我们未来会探讨的原因,我们相信 System One Models 可以比其替代方案更可靠。

我们以 William Stanley Jevons 的名字命名 Jev。我们预计机器智能将遵循与煤炭类似的路径,在蒸汽机效率提高后导致需求增加。智能成本每下降一个数量级,就会解锁多几个数量级的用例。

为什么需要新的训练算法?

Jev 适用于哪些用例?

Jev 只是一个更小的 LLM 吗?

Jev 在公开基准测试中的表现如何?

我们的训练数据来自哪里?

这些结果有点疯狂——这怎么可能?

∵ ⩆

⩆ ∵