BlackHalo logo
Published on

TypeSafe AI 推出 System One 模型 Jev:快两个数量级的自动化决策引擎

Authors
  • Name
    albelfio
    typesafe.ai
TypeSafe AI 的 System One 模型 Jev 的架构示意图:并行采样输出结构化概率与置信度
头图来源: 来源页面

从聊天模型到自动化:一个缺失的拼图

TypeSafe AI 创始人 Diogo Almeida 曾是 OpenAI 的研究员,参与构建了 ChatGPT 背后的指令跟随方法。他观察到尽管聊天模型在对话上已超越人类,但自动化 —— 让软件直接使用 AI 决策 —— 却迟迟未能落地。原因是现有模型输出的是字符串,需要解析、验证,且容易产生幻觉,无法在低延迟、高可靠性要求的生产环境中使用。

经过两年的秘密研发,TypeSafe 今日发布了 System One 模型 —— 一种全新类别的前沿模型,专门用于在软件内部做出快速、结构化的决策。其首个公开模型 Jev 现已开放早期访问。

Jev 核心能力:非结构化输入 → 类型安全的结构化输出

Jev 放弃了传统 LLM 的字符串生成能力,转而直接输出“类型安全的结构化概率值”。换句话说,它接收任意非结构化文本或程序状态,返回预定义类型字段及其置信度分数。

  • 输入:非结构化数据(如文本、程序状态),强调结构化程序状态而非顺序对话。
  • 输出:类型安全的结构化值,所有可能输出和结构提前定义,模型永远不会出现类型错误,且每次输出都附带经过校准概率和置信度。
  • 采样方式:并行生成所有输出,而不是像传统 LLM 那样逐个 token 自回归。这使得单次查询即可获得完整决策向量。

对比传统 LLM:全面的效率碾压

维度传统 LLMJev
训练方法RLHF / RLVR(优化人类偏好)RLCD(强化学习校准决策,优化校准概率)
输入成本$0.20~$10 / 百万 token$0.042 / 百万 token
输出成本约输入成本的 5 倍免费(过于低廉以至于无法计费)
端到端速度3~329 秒(前沿模型)70~500 毫秒
置信度过度自信且不一致每次输出都给出校准概率,高置信度对应高精确度
幻觉必然发生数学上不可能发生(输出受类型约束)
用例需要人工监督的聊天/代码代理可嵌入软件的智能 if 判断、实时审核、大规模数据过滤

典型应用场景包括:AI 驱动的工作流(分类、路由、评分、提取)、实时 API 决策、大规模数据 map-reduce 转换、以及作为 LLM 输出验证器(检测幻觉/越狱)。

实证证据:速度、成本与无类型错误

TypeSafe 提供了多种验证方法:

  • 速度:在标准测试(西海岸笔记本运行)中,Jev 达到 70~500ms,而 GPT-5.6 Terra 等模型需数秒至数分钟。
  • 成本:定价完全透明,且承诺长期会下降而非上升。
  • 无类型错误:由于输出结构在定义时固定,模型不可能产生类型错误;这是数学保证,而非经验统计。

为了展示与 LLM 的差异,团队做了并排演示:同一输入(客户数据)发给 Jev 和 GPT-5.6 Terra,Jev 在 70ms 内并行输出所有字段的概率(如“流失可能性:高(85%)”),而 GPT 则逐 token 生成字符串,需后处理且缺乏校准置信度。

工作流评估:在真实代码中的 Pareto 最优

团队设计了 4 种代表真实业务自动化的“工作流”测试(如多条件路由、概率分支)。结果显示,Jev 在智能水平(参考模型为 GPT-6 Astra 和 Fable 5.1 的平均预测)与成本/延迟的权衡上,占据了近两个数量级的 Pareto 前沿。

  • Jev 平均比 LLM 快 193.6 倍,便宜 444.6 倍。
  • 即使采用约束 LLM 输出结构化决策的专用封装,传统模型仍因需逐个 token 生成且无法并行而显著落后。

趣味演示:实时决策的潜力

  • Doom 游戏 AI:以每秒 10 次查询(约 $7/小时)实时决策,基于文本化游戏状态(而非像素)做出反应,证明毫秒级智能决策的可行性。
  • Wikiracing 游戏:从“橡胶鸭”页面出发,通过链接寻找目标页面。Jev 在每一步从数百个链接中并行评估,不产生幻觉,路径更优且步数更少(智能水平更高)。

展望未来

Jev 仍处于早期阶段,团队计划发布更深入的技术图解、举办黑客松活动,并持续优化架构。对于希望将 AI 可靠嵌入软件的企业,TypeSafe 提供了一种新范式:不再需要“AI + 人工审查”,而是让 AI 直接成为代码中的“智能 if 语句”。

原标题:Introducing System One Models and Jev。 HN 原始发布时间:2026年9月16日星期三。当前记录为 865 分、278 条评论。

阅读原文 · 查看 HN 讨论