8GB显存就够,Strata 让普通电脑也能运行千亿参数大模型

Wait 5 sec.

青小蛙帮你们试过了,可行!RTX 5070、RTX 3060、RTX 4060 Ti、RX 9070 XT、RX 9060 XT、RX 7800 XT、RTX 3090,甚至多年前的 Quadro RTX 4000 和 TITAN RTX…以上这些常见的显卡,只要有 8GB 显存、16GB 内存,一台普通电脑,就有机会在本地运行拥有 1250 亿参数的大模型 Qwen3.8-Flash-Next。这就是最近几天,开源项目 Strata 带来的震撼:https://github.com/Niko1221/Strata甚至,青小蛙觉得,这可能是普通人,第一次能够在普通电脑上,以如此低的硬件门槛,运行一个真正「能用起来」的千亿参数大模型。8GB 显存,究竟能运行多强的大模型?Qwen3.8-Flash-Next,这是2026年8月发布的开源模型,1250 亿参数,在部分编程和推理测试中,成绩已经超过 Claude Opus 4.6。不过,8GB 显存显然无法运行完整的 Qwen3.8-Flash-Next,即使经过压缩,模型仍然需要几十 GB 的存储空间。Strata 巧妙的将模型的一部分放到系统内存之中,甚至还有一部分放到 SSD 中,这样显卡内存的需求量就没那么大了。于是普通电脑才有了机会。(注意,不要使用机械硬盘,青小蛙试过了,太慢,慢死)Strata 的用户反馈了非常多的测试结果:显存显卡型号系统内存模型版本生成速度8GBRTX 4060 Ti32GBCoder IQ1_M19~21 tok/s8GB × 2Quadro RTX 4000 × 296GBSwift IQ2_XS18~23 tok/s12GBRTX 306064GBIQ3_XXS30 tok/s12GBRTX 507064GBQ2_094 tok/s12GBRTX 507064GBIQ3_S53 tok/s16GBRX 7800 XT约 121GiBCoder IQ1_M38~44 tok/s16GBRX 9060 XT64GiBCoder IQ1_M27.1 tok/s16GBRX 9070 XT47GBQ2_060 tok/s16GBRTX 4060 Ti96GB DDR3Q2_048.1~55.8 tok/s16GBRTX 4060 Ti96GB DDR3IQ3_S30.5~35.1 tok/s24GBRTX 309064GBIQ3_XXS50~60 tok/s24GBRTX 309064GB DDR4IQ3_S60~77.9 tok/s24GB × 2TITAN RTX × 2125GiBIQ3_S70.9~77.3 tok/s在本地运行大模型,最重要的体验就是生成速度了,青小蛙觉得能达到40tok/s就可以用了,60tok/s以上则非常流畅。但是!Strata 虽然对显卡要求不高,但是对内存要求极高。三个门槛:32GB 内存:入门级。适合运行经过大幅压缩的 Coder 等精简模型,需要牺牲部分模型能力。48GB 内存:进阶级。可以尝试 Q2_0、IQ2_XS 等低精度量化版本,保留完整的专家结构。64GB 内存:推荐级。可以运行 IQ3_XXS、IQ3_S 等更高精度的量化版本,更适合日常使用。96GB 内存:高配级。可以尝试 IQ4 等更高精度的模型,进一步减少量化带来的能力损失。而需要360GB显存的原始 Qwen3.8-Flash-Next 模型,在部分编程测试中已经超过 DeepSeek-V4-Flash,甚至在部分项目中领先 Claude Opus 4.6。虽然没办法直接比较模型能力,青小蛙觉得入门级的 Strata 也足够一般家庭的大模型使用了,比如跑个龙虾在家运行小任务、智能家居、智能问答、处理文档、识别图片等等,甚至就帮你安装、维护 Linux 这一项,就很赞啊。最重要的是,只需要电费,完全不需要任何 API 费用,并且不限量。推荐给有显卡的各位试试。N卡的都在跑 Strata,我们 AMD 试试 gufo是的了,AMD 也有自己的 Strata:https://github.com/gufo-org/gufo原文:https://www.appinn.com/strata/©2021 青小蛙 for 小众软件 | 加入我们 | 投稿 | 订阅指南 3659b075e72a5b7b1b87ea74aa7932ff 点击这里留言、和原作者一起评论[ 点击前往获取链接 ]