开源项目 Strata 已能在 12GB 显存的消费级显卡上运行阿里 Qwen 团队的 Qwen3.8-Flash-Next(1250 亿参数)。作者公布的测试中,GeForce RTX 5070 在压缩最多的版本上可达每秒 94 个 token。
发生了什么?
开发者 Niko1221 在 GitHub 发布了适用于 Windows 和 Linux 的免费软件 Strata。目标是在没有专用 AI 服务器的情况下运行 Qwen 于 2026 年 8 月 26 日发布的 Qwen3.8-Flash-Next。该模型是多模态混合专家网络,每个 token 只激活一部分参数:主体 1250 亿,另有约 510 亿的 n-gram 嵌入表,每 token 激活约 60 亿。原生上下文窗口为 26.2 万 token。
Qwen 把 Qwen3.8-Flash-Next 描述为 Qwen4 架构的预览,采用 Gated DeltaNet 与 Gated Attention 混合设计。Strata 并非阿里官方运行时,而是第三方引擎,可加载量化版本,其中包括 Coder 变体。
为什么重要?
这一量级的模型若整体装入显卡,通常需要数十 GB 显存。Strata 把显存当作缓存:常用专家留在 GPU,其余放在系统内存,大型查表则留在 SSD。仓库列出的最低配置是 NVIDIA 或 AMD 显卡 12GB 及以上、32GB 内存、80GB 存储,以及 Windows 10/11 或 Linux。
在项目 README 中,RTX 5070(12GB)配 Ryzen 5 7600 和 64GB 内存时,Q2_0 写答速度为每秒 94 token,IQ2_XS 为 79,IQ3_XXS 为 62,IQ3_S 为 53。Q2_0 读取 3.2 万 token 提示词可达每秒 2650 token。Radeon RX 9070 XT(16GB)配 Ryzen 9 3900X 和 47GB 内存时,Q2_0 为每秒 60 token。这些是作者自测,并非独立实验室结果。
实际上会改变什么?
已有 12GB 显存游戏 PC 且内存充足的用户,可以不租云就试跑大型开源模型。Windows 从 START-HERE.bat 开始,Linux 运行 setup.sh。仓库还建议把提示词贴给编程助手,按 AI_SETUP.md 安装。
- Q2_0 最快,RAM 与显存合计约 37.6GB。
- IQ2_XS 是项目推荐的通用规格,约 39.2GB。
- IQ3_S 最重,约 54.8GB;作者称在已发布测试中接近完整模型,仅限原始版,不包括 Coder。
2 比特量化以质量换速度。Strata 并不能在所有任务上替代闭源前沿模型,效果也取决于系统内存:内存不够时,更大的规格根本装不下。IT之家于 2026 年 10 月 6 日根据 Gigazine 报道和仓库数据转述了该项目。
来源:Strata GitHub、Qwen3.8-Flash-Next 官方仓库与IT之家。
作者:GeekikiBot