- Published on
Kimi K3与Fable对决:路由结合实现新SOTA
- Authors
- Name
- piotrgrabowski
- fireworks.ai

引言
Fireworks AI 近期发布了一篇研究报告,对比了开源模型 Kimi K3 与封闭模型 Fable 5 在约1000个代理任务上的表现。结果显示,两者虽然整体精度相差无几,但各自拥有独特的专长领域。通过路由策略将任务分配给最合适的模型,可以同时获得最高质量和最低成本,实现新的 SOTA。
测试方法
为了全面评估模型能力,研究团队设计了五个任务族,覆盖不同工作类型:
- SWE:真实仓库的 bug 修复(类似 SWE-bench),共460个任务。
- Terminal:长时间代理操作,包括安全、密码学、逆向工程、系统管理等,共89个任务。
- Algorithmic:LeetCode / AtCoder 风格的算法题,共100个任务。
- Multi-Language:跨六种编程语言的实现任务,共225个任务。
- Legal:法律代理基准(由律师评分),共120个任务。
所有任务都在真实的代理循环中运行,并使用相同的测试框架进行评分。
K3 是一个好模型
从宏观角度看,K3 和 Fable 5 在整体平均准确率上非常接近。例如在 SWE 基准测试中,K3 获得 92.4%,Fable 5 获得 92.6%。在其他任务族中,两者差距通常不超过几个百分点,仅 Fable 在多语言编码广度上略微领先。
然而,表面数字背后隐藏着重要差异:两个模型在不同任务类型上表现出了明显的分工。
两个模型优于一个
深入分析单个基准测试内部,可以发现更多细节。以 SWE 任务为例,虽然总体准确率打平,但按问题领域拆分后:
- K3 在符号数学、开发工具类任务上表现更佳。
- Fable 在网页、数据可视化任务上占优。
在多语言任务中,Fable 覆盖了 Java、Python 和 C++,而 K3 在 JavaScript 和 Rust 上与之持平。
在长时间终端操作任务中,K3 展现了真正的实力。它成功解决了一批 Fable 从未完成的任务,包括 7z 哈希破解、FEAL 密码分析、秘密泄露检测、实时漏洞修复和失控异步任务处理。在89个终端任务中,K3 有11个独家胜利,Fable 有7个,K3 在安全和密码学领域明显领先。
K3 成本可低至 50 倍
虽然质量上两者接近,但成本差距巨大。成本差异源于三个因素:Token 定价、提示缓存和每任务工作量。
- 在 SWE 任务中,K3 平均需要约55轮、130万 token,而 Fable 仅需21轮、13万 token。但得益于提示缓存,K3 的成本仍然低于 Fable。
- 在终端任务中,情况相反:Fable 会陷入长时间循环,平均64轮、150万 token,有时甚至超时。
总体而言,K3 在所有任务族中均比 Fable 更便宜,成本优势最高可达 50 倍。
不要选择模型,要路由
如果每个任务都交给最擅长它的模型,结果不会落在两者之间,而是超越两者。每任务路由总是优于任何单一模型。
在 Oracle 路由(理想情况)下,K3 被选为72% - 96%的任务处理者。这意味着一个贴近实际的智能路由器是可以实现的,它需要学习日常任务与真正前沿工作之间的差异。
通过这样的路由架构,总体质量超过任一单独模型,成本接近仅使用成本优化模型时的水平。一个强大且成本优化的模型(如 K3)成为默认选择,而高成本模型仅作为例外。
单一模型不再是最优
Kimi K3 与 Fable 路由结合,释放了它们各自的最佳品质,同时以最优价格呈现。单一模型提供者、Token 最大化的时代正在结束。任务级数据表明,这些模型是不同价格的专业化专家。最好的 AI 不再来自单一实验室,而是模型的混合体。
实际意义:
- 开源模型作为默认。像 K3 这样成本低 50 倍的开源模型应作为基础,因为路由器会将大部分流量分配给它。
- 路由器是你的护城河。路由器必须根据你的工作负载量身定制,持续学习任务/模型分割是保持领先的最佳机会。
该研究为 AI 部署提供了新思路:通过路由策略,企业可以同时获得高精度和低成本,而不再依赖单一“全能”模型。
原标题:Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA。 HN 原始发布时间:2026年7月22日星期三。当前记录为 853 分、432 条评论。