5070ti16g单卡跑qwen 3.8 flash next 新方案最高90t/s Hermes调用60t/s

项目地址:https://github.com/Niko1221/Strata

模型地址:https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main/IQ3_XXS

 

 

windows直接到github中直接下载安装就能使用,Linux需要自己编译,下方是我装的ubuntu系统来使用的。

先说结论

9月1日我发过一篇《5070ti16g单卡跑qwen 3.8 flash next iq4x gguf Hermes调用 18tokens/s》,当时用 llama.cpp + IQ4_XS 量化,单卡输出速度最高 18-19 t/s。

这次更新:同一台机器、同一张 5070 Ti 16G,换用 Strata 引擎 + ISTA-DASLab 的 GSQ-RCO IQ3_XXS 量化,输出速度最高到 90 t/s,Hermes 日常调用稳定在 60 t/s 左右——基本追平云端模型的手感,长任务不再需要盯着进度条等。

速度提升 3-5 倍,靠的不是更强的显卡,而是两件事:换引擎(Strata)+ 换量化方案(GSQ-RCO)。

Hermes调用 基本和云端模型差不多,非常流畅,加载也不想之前等半天才能运行,这个方案非常靠谱。

我的电脑配置

  • i5 12代处理器
  • 64G DDR4 内存
  • RTX 5070 Ti 16G(本次单卡运行,3070 8G 不参与)
  • 2T NVMe 高速硬盘
  • 系统:Ubuntu 26.04(上次是 Win11,这次换 Linux,Windows 下同样可以跑)

模型和引擎

模型(IQ3_XXS 量化版,两个分卷共 75.8GB):

引擎:

为什么从 18t/s 变成 60-90t/s

上次 llama.cpp 的玩法是 attention 上 GPU、expert 走 CPU(--n-cpu-moe / auto-fit),每个 token 都要大量 CPU 读 expert 权重,16G 显存卡在这类 MoE 上天花板就是 20 t/s 附近。

Strata 的做法完全不同,实测下来三个关键点:

  1. expert 全放内存 + GPU expert cache:40GB expert 一次性装进内存(加载约 52 秒),GPU 显存里只放一个”热点 expert 缓存”——实测缓存了 4167 个 expert、占 6.78GB 显存,运行中命中率 67-71%。大部分 token 的 expert 计算直接在显存里完成,不再反复走 CPU。
  2. MTP 投机解码:Strata 单独提取 draft 层做 speculative decoding(--spec 4),配合 0.1.27 之后把 draft 词表扩到全部中文字符,中文输出再快 15-38%。
  3. IQ pack 预处理:首次启动会把 GGUF 重排成 pack 格式(约 30-60 分钟,期间机器会卡),之后每次秒起。重排后的 expert 布局对 CPU/GPU 分工做了优化。

实测速度(160160 上下文)

场景速度
短输出 / 缓存热了之后最高 90 t/s
Hermes agent 日常调用(工具调用、长任务)稳定 60 t/s 上下
thinking 阶段52-66 t/s
prompt 读取(prefill)32K token 约 4 秒

对比上次 llama.cpp IQ4_XS 方案的 18-19 t/s:同样的硬件,输出速度 3-5 倍,上下文还从 128K 提到了 160K。

和上次一样,预热很重要:expert cache 需要一段时间填满,刚启动的头几个请求偏慢,跑热之后速度非常稳定。Hermes 长时间挂机会把缓存命中率越跑越高(我这边从 67% 爬到 71%+)。

部署要点(Linux)

# 1. 下载源码(release 只有 Windows 预编译包,Linux 走源码)
wget https://github.com/Niko1221/Strata/archive/refs/tags/v0.1.28.tar.gz

# 2. 一键 setup + 起服务(首次会编译引擎 + 构建 pack,共 40-80 分钟)
cd Strata-main
.venv/bin/python setup.py --family qwen --model IQ3_XXS --context 160160 \
  --vision none --gguf-dir /path/to/Qwen3.8-Flash-Next-GSQ-RCO-GGUF-iq3xxs \
  --port 8080 --host 0.0.0.0 --api-key "你的key" --yes

起好后就是标准 OpenAI 接口,Hermes / OpenWebUI 直接对接:

curl -H "Authorization: Bearer 你的key" \
  http://192.168.123.133:8080/v1/chat/completions \
  -d '{"model":"qwen3.8-flash-next-iq3_xxs","messages":[{"role":"user","content":"你好"}]}'

几个要注意的坑

  1. 内存要求硬:64GB 是及格线(expert 占 40GB),机器上别同时跑大东西。
  2. 160K 上下文下显存很紧:实测 15.6/16.3GB(96%)。如果碰到 OOM 或卡顿,把上下文降到 131072,显存压力会小很多。
  3. Ubuntu 26.04 + CUDA 13.1 编译必挂(glibc 2.43 头文件冲突),装 cuda-toolkit-13-3 解决;nvcc 的 host 编译器要强制用 g++-13。
  4. setup.py 有个 128K 封顶逻辑会把 160160 压回 131072,改一行 ctx > 131072 → ctx > 200000 即可放行。
  5. 别升 0.1.27:它的中文 draft 词表更新有显存 bug,16G 卡会卡死请求,直接上 0.1.28。
  6. 对外监听一定带 API key:--host 0.0.0.0 时 setup 的 --api-key 会保护所有端点,无 key 直接 401。

总结

  • 上次:llama.cpp + IQ4_XS,18-19 t/s,能用但慢
  • 这次:Strata 0.1.28 + GSQ-RCO IQ3_XXS,最高 90 t/s,Hermes 调用 60 t/s,160K 上下文
  • 16G 显存跑 125B MoE,瓶颈从来不在显存大小,在引擎怎么调度 expert。Strata 把”expert 放内存 + 显存缓存热点 expert + 投机解码”这条路走通了,本地模型和云端模型的速度差距第一次小到可以忽略。
  • 代价是首次 pack 构建 30-60 分钟和 64GB 内存门槛,一次构建长期收益。

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

Scroll to Top