电脑硬件🔥7.0

12GB 显存显卡跑 125B Qwen3.8 模型:Strata 登场,单张 RTX 5070 跑出 94 词元 / 秒

IT之家·2026/10/6 07:45:52🔗 原文

📋总体概括

开发者Niko1221开源推出Strata推理引擎,可在12GB显存的消费级显卡上运行1250亿参数的量化Qwen3.8-Flash-Next模型,单张RTX 5070实测推理速度达94词元/秒。该模型是阿里Qwen团队2026年8月推出的多模态MoE压缩版,含125B参数和51B参数n-gram嵌入表,原生支持262K上下文。Strata通过MoE专家分层载入RAM/VRAM及投机解码两大技术压缩显存需求,最低要求12GB显存、32GB内存和80GB存储,大幅降低了超大模型本地部署门槛。

⚡关键信息

  • ▸开发者Niko1221开源Strata引擎,让12GB显存消费级显卡可运行125B参数的Qwen3.8-Flash-Next量化模型
  • ▸单张RTX 5070跑出94词元/秒的推理速度,接近可用级本地体验
  • ▸Qwen3.8-Flash-Next为阿里Qwen团队2026年8月推出的多模态MoE压缩版,支持262K token上下文
  • ▸核心技术:MoE整体驻留RAM、仅高频专家进VRAM,配合轻量模型投机解码加速
  • ▸最低配置为12GB显存+32GB内存+80GB存储(推荐SSD),支持NVIDIA和AMD显卡

🔥犀利点评

这才是MoE架构的真正红利:总参数125B但激活稀疏,把冷专家丢内存、热专家留显存,再叠投机解码,消费级硬件就能跑顶级大模型。94词元/秒已超过多数人的阅读速度,所谓『本地部署必须上H100』的叙事被开源社区再次击碎。云厂商的按token计费生意,护城河正在被这种工程技巧一层层削薄。

本文由本站自动聚合,以下为原始来源:前往 IT之家 阅读全文 →