介绍 System One 模型与 Jev
Diogo Almeida,TypeSafe 创始人
公司动态 · 2026 年 9 月 15 日
模型在对话(chat)方面达到超人水平已经很多年了,那为什么我们期待的自动化却迟迟没有到来?
过去四年,这一直是我反复追问自己的问题。在 OpenAI 工作期间,我曾参与构建让语言模型能够遵循指令并与人对话的关键方法,这项工作后来成为 ChatGPT 背后的研究基础。当时,我以为对话模型或许能通向通用人工智能(AGI),但现实让我越来越清楚地意识到——一定有什么关键的东西被忽略了。
经过两年的潜心研发、无数次技术挑战以及研究上的突破,我无比激动地宣布:今天,TypeSafe AI 正式发布我们的首个 System One 模型——这是一类全新的前沿模型(frontier model),专注于做出软件可直接调用的快速、结构化决策。
我们打造了一整套全新的技术栈,目标完全聚焦于自动化:包括全新的模型架构、用于极致效率的并行采样器,以及我们称之为「校准决策强化学习(Reinforcement Learning for Calibrated Decisions,简称 RLCD)」的训练方法。
我们首个公开发布的模型名为 Jev,今天起开放早期访问。在 System One 任务上,Jev 在智能水平上与现有大语言模型(LLM)相当,但速度与效率高出两个数量级。Jev 放弃了字符串生成(string generation),转而针对结构化输出(structured output)进行深度优化,并且不会产生幻觉(hallucination)。
可以把 Jev 理解为一次「前沿智能级别的函数调用」:输入为非结构化的状态,输出为类型化的概率性决策。
非凡的主张需要非凡的证据,请阅读下文获取全部技术细节与佐证。💅
旧前沿与新前沿
| 现有大语言模型(LLMs) | System One + Jev | |
|---|---|---|
| 优化方式 | 基于人类反馈的强化学习(RLHF)/ 可验证奖励的强化学习(RLVR) | 用于校准决策的强化学习(RLCD) |
| 优化目标 | 人类偏好:人类评分员更喜爱的写作与聊天回复。可验证奖励:可通过程序自动验证的输出。 | 校准决策:在 System One 任务上给出认知上诚实的概率的答案。 |
| 输入 | 非结构化数据(如文本),侧重于顺序消息。 | 非结构化数据(如文本),侧重于结构化程序状态。 |
| 输出 | 字符串 / 生成文本。 字符串灵活可变,可以是任何内容:聊天回复、代码、幻觉、拒绝回复,甚至是类型安全的结构化值。要在软件中使用,回复需要经过解析与校验。同时,AI 始终存在"脱轨"的潜在风险。 | 类型安全的结构化值。 可能的输出与结构预先定义。模型永远不会犯类型错误。所有答案都附带校准后的概率与置信度分数。 |
| 采样方式 | 顺序生成。 一次生成一个 token,每个 token 都以上一个为条件。 | 并行生成。 在单次查询中生成所有输出。极为高效,且对硬件友好。 |
| 成本 | 输入 token:0.20 美元至 10 美元 / 百万 token。输出 token:约为输入 token 成本的 5 倍。 | 输入 token:0.042 美元 / 百万 token(每十亿 token 42 美元)。输出 token:免费(便宜到无法计量)。 |
| 速度 | 端到端响应时间为3 至 329 秒,面向前沿模型。用于与人交互时足够快,但集成到代码中会成为显著瓶颈。 | 端到端响应时间为 70 毫秒至 500 毫秒(TypeSafe)。对于 System One 形态的查询,在同等前沿智能水平下,速度可提升 40 至 200 倍。 |
| 置信度 | 即便被要求给出置信度估计,模型往往仍然过度自信且前后不一致。若模型 95% 的时间都能完成某项任务,却不指出自己处在 5% 失败情形中的哪些时刻,那么它就无法自动化该任务。 | 始终随每次输出一起传达置信度与不确定性。经过校准:置信度越高,准确率也越高。更为一致:对相似输入会返回相似答案。 |
| 适用场景 | 人在环路任务(聊天机器人、Copilot、编程 Agent)。 通用且强大,但因自由度大而需要人类监督,避免其脱轨。可验证问题(数学证明、内核优化)。 当正确性可以被低成本自动检验时,LLM 可生成、测试并迭代,直至找到可行方案。Demo 原型。 字符串的灵活性使其非常适合快速搭建"仅在某些时候能工作"的原型。 | AI 驱动的工作流 / 智能 if 语句。 结构化输出可以像模糊决策规则一样嵌入普通软件中:用于分类、路由、打分、抽取或分支判断,弥补手写逻辑过于脆弱的不足。外围代码约束了模型的自由度,使其更易于组合进可靠系统。对大数据的 Map-Reduce 处理。 将 PB 级数据转化为特征与洞察。实时应用。 100 毫秒级的速度意味着可在用户体验至关重要的应用中使用 AI。全方位验证。 对 LLM 提示词、推理过程与(或)输出进行打分、评判、校验、加护栏,以及检测越狱行为。 |
证据 / 技术成果
我们喜爱怀疑论者,我们自己也是怀疑论者。
有一些声明你可以轻松自行验证:
- 单次调用速度: 我们真的有那么快,不过我们公开的评测一般是我们在西海岸的笔记本电脑上运行的(这是我们服务目前部署的位置)。
- 单次调用成本: 我们让定价保持透明。我们无法证明定价没有被补贴;我们需要用更长的时间来证明我们定价的可持续性(我们预期价格会下降,而不是上涨)。
- 无类型错误(No type errors): 这是一件只要举出一个反例就能轻易推翻的事,但它在数学上是不可能的。
对于我们更大胆的声明,我们希望尽可能给出充分的细微说明。
并排演示
我们的并排演示展示了我们模型与大语言模型(LLM)之间一个关键区别:Jev 并非以自回归方式逐 token 生成,而是并行输出所有概率。字符串极其强大且通用,但代价高昂。“放弃”字符串实际上赋予了我们许多超能力!
细微说明(Nuance)
- 对于已获得 TypeSafe 早期访问权限的用户,可以查看实际查询。
- 查询经过了高度简化,
questions(问题)特意选用了描述性的、易于人类阅读的键,以便屏幕上的输出易于理解。 state(状态)也是一段简短、紧凑且详细的段落,旨在凸显采样方法的不同。相对更短的输入让我们的模型显得更有优势。
- 查询经过了高度简化,
- 对于目光敏锐的人:在这次记录的运行中,与 GPT-5.6 Terra 唯一的分歧在于“流失可能性等级(Churn likelihood level)”。我们认为实际答案本身确实是模棱两可的。
- 我们在这个示例中使用了 GPT-5.6 Terra 的默认推理模式,因为我们发现它在平均智能水平上与 Jev 最为可比。
- 有趣的事实:一个类似的演示正是说服我们全力投入“一型系统模型(System One Models)”方向的原因!
工作流评测(Workflow evals)
我们创造了一种新型评测,用来衡量 AI 在代码内部的表现如何。我们不会针对某个“真实分类(ground truth classification)”进行优化,也不会允许评测框架(harness)和模型被改动(因为这可能通过“框架工程(harness engineering)”造成过拟合)。相反,我们假设存在一个正确的计算图(以代码表示的“工作流”),并将最大、最智能、最昂贵的外部模型的预测结果作为参考概率。
换句话说:每个模型都使用同一个工作流。我们测试它们相对于最智能模型(此处为 Astra 和 Fable)平均表现的水平。
!
Jev 的表现远超图表——在近 2 个数量级的范围内占据了帕累托前沿。我们也将其与那些通过生成式提示(prompt)在思维链中完成所有逻辑的模型进行了对比,但这种方式的表现明显不如直接使用工作流本身。
请注意,这里的调用比上面的并排演示要复杂得多。这是因为它们更能代表实现真正业务自动化所需的生产级工作负载类型。下面是我们将发布的 4 个工作流中最简单的一个:
!
最可靠的真实世界工作流往往包含许多独立的、经过分解的问题,并且其细粒度的行为依赖于概率而非离散决策。最终结果是离散分支,只是我们得出最终答案的过程涉及大量需要高度一致地完成的专业工程。
请访问我们的工作流评测网站以了解所有细节:示例、分歧点、完整查询,以及每个工作流。