BlackHalo logo
Published on

Kimi K3与Fable对决:路由结合实现新SOTA

Authors
  • Name
    piotrgrabowski
    fireworks.ai
Kimi K3与Fable在不同任务类型上的准确率与成本对比图
头图来源: Wikimedia Commons(请在文件页查看原作者与许可条款)

引言

Fireworks AI 近期发布了一篇研究报告,对比了开源模型 Kimi K3 与封闭模型 Fable 5 在约1000个代理任务上的表现。结果显示,两者虽然整体精度相差无几,但各自拥有独特的专长领域。通过路由策略将任务分配给最合适的模型,可以同时获得最高质量和最低成本,实现新的 SOTA。

测试方法

为了全面评估模型能力,研究团队设计了五个任务族,覆盖不同工作类型:

  • SWE:真实仓库的 bug 修复(类似 SWE-bench),共460个任务。
  • Terminal:长时间代理操作,包括安全、密码学、逆向工程、系统管理等,共89个任务。
  • Algorithmic:LeetCode / AtCoder 风格的算法题,共100个任务。
  • Multi-Language:跨六种编程语言的实现任务,共225个任务。
  • Legal:法律代理基准(由律师评分),共120个任务。

所有任务都在真实的代理循环中运行,并使用相同的测试框架进行评分。

K3 是一个好模型

从宏观角度看,K3 和 Fable 5 在整体平均准确率上非常接近。例如在 SWE 基准测试中,K3 获得 92.4%,Fable 5 获得 92.6%。在其他任务族中,两者差距通常不超过几个百分点,仅 Fable 在多语言编码广度上略微领先。

然而,表面数字背后隐藏着重要差异:两个模型在不同任务类型上表现出了明显的分工。

两个模型优于一个

深入分析单个基准测试内部,可以发现更多细节。以 SWE 任务为例,虽然总体准确率打平,但按问题领域拆分后:

  • K3 在符号数学、开发工具类任务上表现更佳。
  • Fable 在网页、数据可视化任务上占优。

在多语言任务中,Fable 覆盖了 Java、Python 和 C++,而 K3 在 JavaScript 和 Rust 上与之持平。

在长时间终端操作任务中,K3 展现了真正的实力。它成功解决了一批 Fable 从未完成的任务,包括 7z 哈希破解、FEAL 密码分析、秘密泄露检测、实时漏洞修复和失控异步任务处理。在89个终端任务中,K3 有11个独家胜利,Fable 有7个,K3 在安全和密码学领域明显领先。

K3 成本可低至 50 倍

虽然质量上两者接近,但成本差距巨大。成本差异源于三个因素:Token 定价、提示缓存和每任务工作量。

  • 在 SWE 任务中,K3 平均需要约55轮、130万 token,而 Fable 仅需21轮、13万 token。但得益于提示缓存,K3 的成本仍然低于 Fable。
  • 在终端任务中,情况相反:Fable 会陷入长时间循环,平均64轮、150万 token,有时甚至超时。

总体而言,K3 在所有任务族中均比 Fable 更便宜,成本优势最高可达 50 倍。

不要选择模型,要路由

如果每个任务都交给最擅长它的模型,结果不会落在两者之间,而是超越两者。每任务路由总是优于任何单一模型。

在 Oracle 路由(理想情况)下,K3 被选为72% - 96%的任务处理者。这意味着一个贴近实际的智能路由器是可以实现的,它需要学习日常任务与真正前沿工作之间的差异。

通过这样的路由架构,总体质量超过任一单独模型,成本接近仅使用成本优化模型时的水平。一个强大且成本优化的模型(如 K3)成为默认选择,而高成本模型仅作为例外。

单一模型不再是最优

Kimi K3 与 Fable 路由结合,释放了它们各自的最佳品质,同时以最优价格呈现。单一模型提供者、Token 最大化的时代正在结束。任务级数据表明,这些模型是不同价格的专业化专家。最好的 AI 不再来自单一实验室,而是模型的混合体。

实际意义:

  • 开源模型作为默认。像 K3 这样成本低 50 倍的开源模型应作为基础,因为路由器会将大部分流量分配给它。
  • 路由器是你的护城河。路由器必须根据你的工作负载量身定制,持续学习任务/模型分割是保持领先的最佳机会。

该研究为 AI 部署提供了新思路:通过路由策略,企业可以同时获得高精度和低成本,而不再依赖单一“全能”模型。

原标题:Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA。 HN 原始发布时间:2026年7月22日星期三。当前记录为 853 分、432 条评论。

阅读原文 · 查看 HN 讨论