- Published on
TypeSafe AI 推出 System One 模型 Jev:快两个数量级的自动化决策引擎
- Authors
- Name
- albelfio
- typesafe.ai

从聊天模型到自动化:一个缺失的拼图
TypeSafe AI 创始人 Diogo Almeida 曾是 OpenAI 的研究员,参与构建了 ChatGPT 背后的指令跟随方法。他观察到尽管聊天模型在对话上已超越人类,但自动化 —— 让软件直接使用 AI 决策 —— 却迟迟未能落地。原因是现有模型输出的是字符串,需要解析、验证,且容易产生幻觉,无法在低延迟、高可靠性要求的生产环境中使用。
经过两年的秘密研发,TypeSafe 今日发布了 System One 模型 —— 一种全新类别的前沿模型,专门用于在软件内部做出快速、结构化的决策。其首个公开模型 Jev 现已开放早期访问。
Jev 核心能力:非结构化输入 → 类型安全的结构化输出
Jev 放弃了传统 LLM 的字符串生成能力,转而直接输出“类型安全的结构化概率值”。换句话说,它接收任意非结构化文本或程序状态,返回预定义类型字段及其置信度分数。
- 输入:非结构化数据(如文本、程序状态),强调结构化程序状态而非顺序对话。
- 输出:类型安全的结构化值,所有可能输出和结构提前定义,模型永远不会出现类型错误,且每次输出都附带经过校准概率和置信度。
- 采样方式:并行生成所有输出,而不是像传统 LLM 那样逐个 token 自回归。这使得单次查询即可获得完整决策向量。
对比传统 LLM:全面的效率碾压
| 维度 | 传统 LLM | Jev |
|---|---|---|
| 训练方法 | RLHF / RLVR(优化人类偏好) | RLCD(强化学习校准决策,优化校准概率) |
| 输入成本 | $0.20~$10 / 百万 token | $0.042 / 百万 token |
| 输出成本 | 约输入成本的 5 倍 | 免费(过于低廉以至于无法计费) |
| 端到端速度 | 3~329 秒(前沿模型) | 70~500 毫秒 |
| 置信度 | 过度自信且不一致 | 每次输出都给出校准概率,高置信度对应高精确度 |
| 幻觉 | 必然发生 | 数学上不可能发生(输出受类型约束) |
| 用例 | 需要人工监督的聊天/代码代理 | 可嵌入软件的智能 if 判断、实时审核、大规模数据过滤 |
典型应用场景包括:AI 驱动的工作流(分类、路由、评分、提取)、实时 API 决策、大规模数据 map-reduce 转换、以及作为 LLM 输出验证器(检测幻觉/越狱)。
实证证据:速度、成本与无类型错误
TypeSafe 提供了多种验证方法:
- 速度:在标准测试(西海岸笔记本运行)中,Jev 达到 70~500ms,而 GPT-5.6 Terra 等模型需数秒至数分钟。
- 成本:定价完全透明,且承诺长期会下降而非上升。
- 无类型错误:由于输出结构在定义时固定,模型不可能产生类型错误;这是数学保证,而非经验统计。
为了展示与 LLM 的差异,团队做了并排演示:同一输入(客户数据)发给 Jev 和 GPT-5.6 Terra,Jev 在 70ms 内并行输出所有字段的概率(如“流失可能性:高(85%)”),而 GPT 则逐 token 生成字符串,需后处理且缺乏校准置信度。
工作流评估:在真实代码中的 Pareto 最优
团队设计了 4 种代表真实业务自动化的“工作流”测试(如多条件路由、概率分支)。结果显示,Jev 在智能水平(参考模型为 GPT-6 Astra 和 Fable 5.1 的平均预测)与成本/延迟的权衡上,占据了近两个数量级的 Pareto 前沿。
- Jev 平均比 LLM 快 193.6 倍,便宜 444.6 倍。
- 即使采用约束 LLM 输出结构化决策的专用封装,传统模型仍因需逐个 token 生成且无法并行而显著落后。
趣味演示:实时决策的潜力
- Doom 游戏 AI:以每秒 10 次查询(约 $7/小时)实时决策,基于文本化游戏状态(而非像素)做出反应,证明毫秒级智能决策的可行性。
- Wikiracing 游戏:从“橡胶鸭”页面出发,通过链接寻找目标页面。Jev 在每一步从数百个链接中并行评估,不产生幻觉,路径更优且步数更少(智能水平更高)。
展望未来
Jev 仍处于早期阶段,团队计划发布更深入的技术图解、举办黑客松活动,并持续优化架构。对于希望将 AI 可靠嵌入软件的企业,TypeSafe 提供了一种新范式:不再需要“AI + 人工审查”,而是让 AI 直接成为代码中的“智能 if 语句”。
原标题:Introducing System One Models and Jev。 HN 原始发布时间:2026年9月16日星期三。当前记录为 865 分、278 条评论。