BlackHalo logo
Published on

Cloudflare 开源决策模型 Clef 与强化学习微调平台

Authors
  • Name
    jasondavies
    blog.cloudflare.com
Cloudflare Clef 决策模型架构示意图
头图来源: 来源页面

决策模型 Clef 的发布背景

Cloudflare 近日正式发布了两款自研决策模型——Clef 和 Clef-flash,并托管于 Workers AI 平台。决策模型是一种能够基于输入状态快速输出结构化分类结果(含概率)的 AI 模型,适用于智能体工作流中的决策环节。与传统的 LLM 不同,决策模型具有确定性、低延迟和低成本的特点,无需频繁重新训练即可适应新的分类类别。

Cloudflare 在威胁情报团队中已实际测试 Clef:通过 Browser Run 获取网站域名内容后,Clef 可在 2.2 秒内完成抓取、渲染和分类,而最快的通用 LLM(gpt-oss-120b)需要 4.7 秒且仅返回两个分类。这种 2 倍以上的延迟节省显著提升了恶意或合法域名的识别效率。

Clef 的技术特性与优势

Clef 相比其他决策模型(如 Jev)具备三大独特优势:

  • 视觉编码能力:可接收图像并分类视觉内容,而 Jev 仅支持文本分类。
  • 64k 上下文窗口:是 Jev(32k)的两倍,允许用户输入更多状态信息。
  • 高精度与低延迟:在 Jev Decision Index 定义的多个基准测试中,Clef 综合得分领先。

Cloudflare 还公布了详细的基准测试结果,涵盖 BFCL、ToolRet、API-Bank 等 8 项指标。例如在 BFCL case exact 上 Clef 得分 98.47,Clef-flash 得分 98.76,均高于 Jev 的 95.75。在延迟方面,Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,远低于 Jev 的 524.1ms。

模型架构与训练方法

Clef 基于 Qwen 作为骨干模型,经过后训练以适应决策场景。推理时采用预填充(prefill-only)方式,然后并行对所有有效模式进行评分,整个过程非自回归,无需逐 token 生成中间文本,因此速度显著快于自回归 LLM。

架构核心是两阶段注意力路由:每个有效选项从提示中提取相关上下文,各字段参数相互交叉注意力,最终基于模式约束进行评分。训练时冻结 Qwen3.8-27B(Clef)或 Qwen3.5-9B(Clef-flash),联合优化路由头与秩 256 的低秩适配器。后训练使用标签平滑交叉熵损失和 Brier 损失来校准概率。

Cloudflare 还开发了强化学习校准决策(RLCD)作为二次优化目标,对相邻序数选项给予部分奖励,对精确记录输出给予完全奖励,并施加参考惩罚以防止分布偏移,从而提升准确性和泛化能力。

强化学习微调平台

Cloudflare 推出新的强化学习(RL)产品,允许客户使用自有数据对 Clef 进行微调。内部团队已有多个用例:评估信任与安全提交、分类支持请求、判断爬虫是否为良性等。这些场景需要高度定制化的分类器,而微调可以在牺牲部分通用性能的前提下大幅提升特定领域的准确率。

Cloudflare 提供两种微调服务:

  • 前向部署工程师(FDE)团队:与客户紧密合作,手动微调模型。
  • 自助服务平台(即将推出):客户可自行捕获数据、微调并重新部署模型,全部在 Cloudflare 基础设施上完成。

开放性与兼容性

Clef 和 Clef-flash 已以 Apache 2.0 许可证在 Hugging Face 上完全开源,用户可本地运行和实验。模型完全兼容 Jev API,可轻松替换。Cloudflare 承诺不读取、存储或训练用户请求/响应数据(除非用户主动使用微调产品)。

开发者可通过 Workers AI 直接调用 Clef,示例 curl 命令展示了如何传入状态和问题定义,返回结构化概率输出。Cloudflare 还提供开发者文档和 Hugging Face 仓库供用户探索。

总结与展望

Clef 的发布标志着 Cloudflare 在 AI 决策领域迈出重要一步。通过开源模型和微调平台,Cloudflare 希望赋能开发者构建更快速、更可靠的智能体工作流。未来,Cloudflare 计划将 Clef 集成到更多内部产品(如 Bot 管理、支持系统)中,并持续优化模型性能。

原标题:Clef: Open-weight decision models, and new RL fine-tuning platform。 HN 原始发布时间:2026年10月2日星期五。当前记录为 620 分、215 条评论。

阅读原文 · 查看 HN 讨论