BlackHalo logo
Published on

Strata:让 1250 亿参数大模型在消费级显卡上跑出 100 Token/秒

Authors
  • Name
    snehesht
    github.com
Strata 推理引擎在消费级显卡上运行大模型的示意图
头图来源: Picsum

项目概述

Strata 是一个开源的推理引擎,旨在让 Qwen3.8-Flash-Next 这一拥有 1250 亿参数的大语言模型在普通消费级硬件上运行。该项目由 Niko1221 开发,在 GitHub 上已获得 14.2k 星标和 1.2k 次 fork。它支持 Windows 和 Linux 系统,兼容 NVIDIA 和 AMD 显卡,要求显存至少 12 GB,内存至少 32 GB,磁盘空间约 80 GB。Strata 提供一键安装脚本,用户只需双击或运行命令即可完成部署。

性能表现

Strata 在普通游戏 PC 上实现了令人瞩目的性能。以 RTX 5070(12 GB 显存)搭配 Ryzen 5 7600 处理器和 64 GB 内存为例,使用 Q2_0 量化模型时,生成速度可达每秒 94 个 token,读取提示词的速度为每秒 2650 个 token。在 AMD RX 9070 XT(16 GB 显存)上,Q2_0 模型的生成速度为每秒 60 个 token。项目说明指出,显存更大的显卡(如 RTX 3090 的 24 GB)预计可达到每秒 100-140 个 token 的生成速度。这些数据表明,Strata 能够将原本需要服务器级硬件的大模型带到桌面端。

工作原理

Strata 的核心创新在于将模型的工作负载分散到整个 PC 的各个组件上。它采用类似厨房的比喻:常用数据放在台面上(显存),其余数据存放在储藏室(内存)和地窖(SSD)。具体来说,Qwen3.8-Flash-Next 模型由 24,576 个小型专家组成,每个词仅需激活其中 10 个。Strata 将最常用的数千个专家保存在显卡显存中,所有专家都加载到系统内存,处理器同时处理部分计算,而 SSD 则存储一个大型查找表。此外,Strata 还采用“猜测后验证”策略:一个小型辅助模型先预测接下来的几个词,再由大模型一次性验证,从而将响应速度提升 1.6 至 1.8 倍。长文本被分批读取(每次最多 8192 个 token),处理速度超过每秒 1000 个 token。

安装与使用

Strata 的安装过程设计得极为简便。用户可以从 GitHub 下载并解压,Windows 用户双击 START-HERE.bat,Linux 用户运行 ./setup.sh。安装程序会自动检测显卡并配置相应的引擎,用户只需回答几个问题(选择模型、上下文长度、是否支持图像输入),然后按回车接受推荐选项。模型下载约 70 GB,支持断点续传。首次启动时,PC 可能会卡顿 1 到 3 分钟,因为 Strata 会将 35-55 GB 数据加载到内存并锁定部分供显卡使用,这是正常现象。启动后,浏览器会自动打开 http://127.0.0.1:8080 的本地应用界面,提供聊天、监控和设置功能。

模型选择与兼容性

Strata 提供多种量化版本的模型,以适应不同配置的硬件。对于 32 GB 内存的 PC,推荐使用 Coder 版本(专为代码优化,但中文能力较弱);48 GB 内存推荐 IQ2_XS 或 Q2_0;64 GB 内存推荐 IQ2_XS,也可选择 IQ3_XXS 或 IQ3_S;96 GB 以上内存则可运行 IQ3_S 或 Unsloth 的 UD-IQ4_XS 版本。项目还支持多 GPU 配置,并兼容一些较旧的显卡(如 Tesla P40、GTX 10 系列等),但性能可能较低。此外,Strata 支持通过 OpenAI 或 Anthropic 兼容 API 与外部应用(如 Claude Code、Cursor)集成,并提供了 MCP 服务器供 AI 工具自动安装和配置。

社区与许可

Strata 采用 MIT 许可证,完全免费开源。项目鼓励用户支持开发,并提供了详细的文档(包括多语言 README)。模型本身由 Qwen 团队开发,压缩工作由 ISTA-DASLab、UkisAI 和 Unsloth 完成,Strata 还使用了 llama.cpp/ggml 的部分代码。社区成员积极贡献,包括对旧显卡和 Intel Arc 的实验性支持。项目还提供了故障排除指南,帮助用户解决常见问题,如内存不足、端口占用等。总体而言,Strata 代表了大模型本地部署的一个重要进展,让个人用户能够在隐私保护的前提下,体验前沿 AI 模型的能力。

原标题:Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s。 HN 原始发布时间:2026年10月4日星期日。当前记录为 911 分、412 条评论。

阅读原文 · 查看 HN 讨论