BlackHalo logo
Published on

Laya:33毫秒的多语言System 1决策引擎——非自回归模型在AI中的突破

Authors
  • Name
    nandakishor_ml
    laya.convaiinnovations.com
Laya决策引擎架构图,显示三个检查点与路由模块
头图来源: Wikimedia Commons(请在文件页查看原作者与许可条款)

背景:从非自回归决策到Laya

一年前,作者在arXiv上发表了关于非自回归决策模型的论文,并开源了权重和数据集。然而,去年9月,一家前沿实验室推出了类似概念的产品Jev,并将其宣传为全新突破。为了证明开放研究的价值,作者基于先前经验重新设计了架构,推出了Laya——一个完全开源、支持100多种语言、推理速度仅33毫秒的System 1决策引擎。

核心思想:System 1 vs System 2

当前AI管线存在巨大瓶颈:我们常常用生成式大语言模型来执行简单的反射式决策。例如判断工单应该路由到哪个部门、邮件是否为钓鱼攻击、提示词是否试图越狱等。调用8B或70B的生成式模型完全是过度杀伤——需要等待500到2000毫秒输出token,还得编写正则表达式或JSON解析器来提取标签。更糟糕的是,LLM会幻觉并生成虚假的置信度。

Laya的设计模仿人类大脑的System 1:快速反射式决策,并提供真实校准的概率。在标准硬件上,推理时间仅需30到35毫秒。

三种决策原语

Laya通过单个前向传播对任意状态(文本、邮件、工单或JSON文档)进行类型化决策,依赖三种原语:

  • choice:从一组条件中选取一项。返回选中键、所有选项的概率分布和校准后的置信度。
  • score:将状态置于序数量表上(如0、1、2等级)。返回期望等级、概率分布和置信度。
  • noul:直接布尔问题,返回校准后的概率P(true)(0到1)。

由于输出空间全是概率和数字,模型不会生成文本,不可能产生幻觉,模式违反或错误JSON在物理上不可能发生。

三个检查点与集线器架构

不同任务和语言需要不同模型,因此Laya在Hugging Face上发布了三个专门检查点:

  • convaiinnovations/laya:基于ModernBERT-large(421M参数,512上下文),用于英文文本分类、护栏、邮件分类。
  • convaiinnovations/laya-multilingual:基于mmBERT-base(256k词表,322M参数,1024上下文),支持100+语言,速度快2.2倍。
  • convaiinnovations/laya-typed-decisions:基于ModernBERT-large(421M参数,1024上下文),用于Agent可观测性、客服、发票处理、安全告警。

主仓库bundles全部三个检查点,用户通过Hugging Face的allow_patterns仅下载所需子目录,避免下载2.5 GB全部权重。

路由的重要性

在51种语言测试中,英文模型在非拉丁字母脚本上表现惨败:高棉语准确率0.000但置信度0.952,亚美尼亚语准确率0.050(相当于随机猜测)但置信度0.885。模型自身置信度无法预警语言问题。因此必须在推理前决定使用哪个模型。

Laya内置路由器,通过检查输入文本的Unicode脚本(22个字母系统)和拉丁停用词分布来判断语言。标准英文检测开销0.09毫秒,梵文/印度文字0.54毫秒,大型JSON文档0.73毫秒。路由器支持预加载所有模型到显存/内存,避免冷切换损失。

头对头对比:Laya vs TypeSafe Jev

在公开数据集和标准基准上,Laya显著优于Jev:

  • 类型决策准确率:0.766 vs 0.727(+3.9%),甚至超过教师模型天花板0.735。
  • AG News分类:0.950 vs 0.910。
  • DAIR情感识别:0.595 vs 0.480,且Jev有16%的零概率问题。
  • 校准误差(ECE):0.081 vs 0.246,校准精度高3倍。
  • 延迟(单问题):32.8 ms vs 236-276 ms,快7.8倍。
  • 批量10问题延迟:72.3 ms(每问题7.2 ms)vs 约1500 ms,快20倍。
  • 可用语言:Laya覆盖51种语言中的45种,Jev未公布。
  • 成本:Laya完全免费自托管(Apache 2.0),Jev按API收费0.042美元/百万token。

在9个实际工作流中,Laya也展现出生产就绪的决策质量:垃圾邮件过滤准确率0.993,检测钓鱼0.980,LLM护栏(ToxicChat)达0.762,50%选择性覆盖下准确率达0.931。

诚实的局限性

  • 当choice选项超过20个时性能下降:Banking77(77个标签)测试中仅0.425(Jev为0.870)。建议限制选项数或用两步粗到细层次结构。
  • 零样本性能较差:基模型在类型决策基准上约0.35,需在训练集上微调才能达到0.766。应将Laya视为可快速特化的基础模型,而非全知零样本预言机。
  • 温度校准:基权重使用原始温度,需为每个问题类型拟合一个标量温度,可将校准误差从0.466降至0.081。

快速开始

安装Laya:pip install laya>=0.3.3

示例代码展示了如何初始化路由器(预加载避免交换延迟)、定义包含多个问题(choice、score、noul)的字典,并自动进行语言路由。整个过程只需几行代码,在30秒内完成。

原标题:I built non-autoregressive decision models with RL a year ago。 HN 原始发布时间:2026年9月19日星期六。当前记录为 1114 分、278 条评论。

阅读原文 · 查看 HN 讨论