16G显卡+qwen3.8 27B上下文200K,个人经验总结(更新llamacpp推荐)
本帖最后由 qwased 于 2026-10-2 14:48 编辑这是目前个人使用比较舒适的一个组合,仅供参考
最终效果:Qwen3.8 27B 保留视觉 + 长上下文(iq3xxs mtp开 130K/mtp关 200K + 思维链正常输出)
1. 硬件与环境准备
GPU 型号 / 显存本记录针对16GB显卡挖掘潜力,12GB也可以根据自己的情况尝试调整
CPU / 内存 需要将视觉模型交给CPU处理,当你需要频繁使用视觉能力的时候CPU越强越好,内存32G即可
13600K级别的cpu处理一次720P图片需要大约30秒
2. 模型与量化选择:
https://hf-mirror.com/ISTA-DASLa ... -RCO-GGUF/tree/main
质量非常好的高压缩率量化,推荐使用IQ3S,如果用IQ3XXS切记保持思考强度XHIGH,作者说他们只校准了XHIGH强度,medium会导致明显的质量下降
https://huggingface.co/ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF
后训练思维链缩短版本,试用了一下感觉就是把思维链里面打草稿的习惯改成直接在正文输出了
https://modelscope.cn/models/Merkyor/Qwen3.8-27B-EfficientThink-K3-Opus5-Grok4.6-GPT5.6Sol-SFT-SimPO-DFlash2-GGUF
b站大佬后训练的思维链缩短版本,Q2量化也用了GSQ RCO算法,质量比上面那个高,但是体积也更大。
无审查版本,huihui、merkyor、Bucoid这几个人做的都可以用,但是目前所有破甲技术都会损害智力,非必要不使用。
Mmoprj是视觉模型,和LLM模型放在一起即可。可以去抱脸找一下Q6或者Q8量化的视觉模型来省显存或者让CPU跑的更快
3. llama.cpp 分支选择:
https://github.com/Anbeeld/beellama.cpp
目前推荐这一个分支。之前的kv streaming方案测试出来在超长上下文的时候会降智
https://github.com/kvmem/kvmem-llama.cpp
实验方案,B站现在比较火的一个分支,他会剔除上下文中不重要的部分,只计算最关键的KV cache,灌满250K上下文也可以保持满速,但是长程任务会有幻觉
https://github.com/Ryan-gsq/ninfer-16g-5070ti-5080-5090-qwen3.8-27b-gsq-rco
强烈推荐,这个版本的ninfer速度起飞了
4. 思维链修复补丁 chat template
https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templatesqwen思维链修复补丁,阿里官方的输出格式有问题导致模型无法退出思考,使用该补丁后不再出现数万token的超长无效思考
组装:解压llamacpp,将模型和chat template文件放在含有llama-server.exe的目录下
llama.cpp 启动参数解释
将下面这段代码保存为.bat文件即可使用
@echo off
cd /d "%~dp0"
llama-server.exe ^
-m "./model/Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf" ^
--mmproj "./model/Qwen3.8-27B-mmproj-hybrid-Q8_0-F16.gguf" ^
--no-mmproj-offload ^
--image-min-tokens 1024 ^
--image-max-tokens 4096 ^
-c 130000 ^
-ngl 99 ^
-ctk kvarn5 ^
-ctv kvarn5 ^
--kv-tail-tokens 1024 ^
--kv-tail-type f16 ^
-fa on ^
--temp 1.0 ^
--top-p 0.95 ^
--top-k 20 ^
--min-p 0.0 ^
--presence-penalty 0.0 ^
--cache-ram 8192 ^
-np 1 ^
-b 2048 ^
-ub 512 ^
--reasoning-preserve ^
--jinja ^
--host 127.0.0.1 ^
--port 24548 ^
--load-mode none ^
--chat-template-file chat_template.jinja ^
-fit off ^
--reasoning-loop-guard off
pause
重点参数的实际作用
--no-mmproj-offload 将视觉模型交给cpu处理,可以节约1GB左右的显存
-c 130000 上下文长度
-ctk-ctv 指定KV量化使用 KVarN 5-bit 量化
--kv-tail-tokens 1024 --kv-tail-type f16对末尾1024token使用f16精度,LLM注意力集中在开头和结尾,这样设置可能尽可能减少智力损失
--cache-ram 8192在内存里面建立8G缓存
--jinja --chat-template-file chat_template.jinja替换输出格式文件
--host 127.0.0.1 --port 24548监听端口
--load-mode none不将模型副本保存在内存中
--reasoning-loop-guard off beellama自带了一个死循环监控,用了一下感觉过于敏感,关掉
使用投机解码加入下列参数,注意MTP会明显降低质量,并且上下文长度要减半
--spec-type ngram-mod,draft-mtp ^
--spec-draft-n-max 3 ^
--spec-ngram-mod-n-min 8 ^
--spec-ngram-mod-n-max 64 ^
--spec-ngram-mod-n-match 48 ^
这样设置在我的显卡上从50tps提高到80tps(输出代码),写小说、RP之类的场景会倒吸
7. 伪无限上下文:pi harness + pi vcc
16GB显卡的显存和核心性能都不足以支持太长的上下文,需要使用极简harness以及上下文插件使用
建议搭配:oh my pi+pi vcc / DSH+ dsh-compaction-instant
篇幅太长不多赘述,提供下载地址自行试用
https://github.com/can1357/oh-my-pi
https://github.com/sting8k/pi-vcc
https://github.com/deepseek-ai/deepseek-harness
https://github.com/TsFreddie/dsh-compaction-instant 似乎已经放弃维护了,建议让agent自己修一下
让gemini写了一个设计方案给qwen实现,感觉效果超出预期
泥潭归墟的帖子会自动关闭,这种教程贴最好让管理员解一下,或者发数码版更好吧 城北无尘 发表于 2026-8-27 17:57
泥潭归墟的帖子会自动关闭,这种教程贴最好让管理员解一下,或者发数码版更好吧 ...
其实自己就能关,只是自己关的帖子如果出事了就会吃二狗铁拳 挺好,有空捣鼓一下,我是10850k+5070 Ti+64G DDR4。之前本地跑了qwen3.6 27B Q4 XS with MTP,上下文只敢开16k,速度平均35-40 tk/s,简单需求效果还行
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99 大暴死 发表于 2026-8-27 18:09
挺好,有空捣鼓一下,我是10850k+5070 Ti+64G DDR4。之前本地跑了qwen3.6 27B Q4 XS with MTP,上下文只敢 ...
16G显存的卡开MTP收益很差
等bonsai出新的三元量化27B吧,他那个量化能把Q4质量压到9GB大小,MTP和上下文都能拉满了 我是用m4pro macmini+27b mtp d3,速度勉强达到20t/s,预填充虽然慢,但已经比半年前3.6那会强多了
梁文峰时段用它度过垃圾时间基本够用 DFlash和MTP该选哪个?让codex测试是前者更快一点 lubo 发表于 2026-8-27 18:20
DFlash和MTP该选哪个?让codex测试是前者更快一点
Dflash2好,但是也很吃显存 手动mark一下 32g单卡能跑什么?
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0 有老哥在 Mac OS 上布置这一套吗?我在折腾这一套,但是现在反正看下来是不可用。你比如说代码,它就永远在思考,但是从不落在纸面上。
—— 来自 S1Fun 古畑任三郎2015 发表于 2026-8-27 18:12
我是用m4pro macmini+27b mtp d3,速度勉强达到20t/s,预填充虽然慢,但已经比半年前3.6那会强多了
梁文峰 ...
大哥能详细说说配置吗?
—— 来自 S1Fun 本帖最后由 qwased 于 2026-8-27 21:48 编辑
umamusume 发表于 2026-8-27 18:31
32g单卡能跑什么?
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
5090直接上ninfer全套 真红之闪电 发表于 2026-8-27 18:41
有老哥在 Mac OS 上布置这一套吗?我在折腾这一套,但是现在反正看下来是不可用。你比如说代码,它就永远在 ...
装思考修复 这是派什么用处的? qwased 发表于 2026-8-27 18:48
装思考修复
我装了这个东西,就是昨天在Deepseek那个楼里我就问你了。 qwased 发表于 2026-8-27 18:11
16G显存的卡开MTP收益很差
等bonsai出新的三元量化27B吧,他那个量化能把Q4质量压到9GB大小,MTP和上下文 ...
但不开mtp的话tk/s美不看,还好我(当时)没有特别长的上下文需求
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99 真红之闪电 发表于 2026-8-27 18:53
我装了这个东西,就是昨天在Deepseek那个楼里我就问你了。
是不是你给他的任务太难了?你试试先用别的大模型把任务分解成最小单元再给他做看看 真红之闪电 发表于 2026-8-27 18:41
大哥能详细说说配置吗?
—— 来自 S1Fun
我是64g,从用量来看48g也够
不过我基本不用它跑代码,只测试过dsh用它做俄罗斯方块和计算器小程序,前者20分钟,后者一小时,都是无中断做完,自己反复优化抓bug几轮 要是32g现存推荐哪个模型?内存96G
另外ollama能用吗?我很久以前尝试自己本地模型用的是ollama
能到什么水平,这个月fable拉满已经干了8000刀了,老板直呼受不了 古畑任三郎2015 发表于 2026-8-27 18:57
我是64g,从用量来看48g也够
不过我基本不用它跑代码,只测试过dsh用它做俄罗斯方块和计算器小程序,前者 ...
不是问的系统配置,我是问你模型怎么配。是不是 MLX?
如果是:
用什么 server?mlx-lm 自带?oMLX?还是其他项目? 真红之闪电 发表于 2026-8-27 18:59
不是问的系统配置,我是问你模型怎么配。是不是 MLX?
如果是:
用什么 server?mlx-lm 自带?oMLX?还是 ...
我用mtplx,模型是mtplx-qwen38-27b-optimized-speed 如果要尝试捣鼓AI,是不是退役的10980xe+128G内存反而比现役的9800X3D+64G内存要好用?显卡有4090,另外还有张2080ti。
要不就10980xe+128G+4090搞AI,9800X3D+64G+2080ti玩游戏?反正现在也就只玩玩暗黑4。 downforce 发表于 2026-8-27 19:08
如果要尝试捣鼓AI,是不是退役的10980xe+128G内存反而比现役的9800X3D+64G内存要好用?显卡有4090,另外还 ...
取决于你跑什么,内存容量够用的情况下带宽越高越好 子虚乌有 发表于 2026-8-27 18:57
要是32g现存推荐哪个模型?内存96G
另外ollama能用吗?我很久以前尝试自己本地模型用的是ollama
...
可以尝试用freetoken之类的框架部署dsv4 flash了 又是十元 发表于 2026-8-27 18:59
能到什么水平,这个月fable拉满已经干了8000刀了,老板直呼受不了
刚毕业的混子大学生。。吧 qwased 发表于 2026-8-27 19:10
取决于你跑什么,内存容量够用的情况下带宽越高越好
cpu影响不大吗?10980xe毕竟有18个核,内存也是4通道,但是主频低。
两者的理论内存带宽好像是一样的,4通道D4 3200 VS 2通道D5 6400。 qwased 发表于 2026-8-27 19:13
可以尝试用freetoken之类的框架部署dsv4 flash了
收到,我看看哈 downforce 发表于 2026-8-27 19:24
cpu影响不大吗?10980xe毕竟有18个核,内存也是4通道,但是主频低。
两者的理论内存带宽好像是一样的,4 ...
影响不大,哪怕是moe模型把一部分计算交给cpu来跑一般也是纯拖后腿导致降速的结果
给楼主的折腾精神加鹅,不过本地部署,最受不了的就是速度,之前本地跑图,参数配好了,也能跑出很不错的图,但是一张图两三分钟,真的有点受不了。大语言模型这一块,速度慢一点真的是特别难受,毕竟主要的工作就是盯着屏幕看它输出内容 来都来了 发表于 2026-8-27 19:31
给楼主的折腾精神加鹅,不过本地部署,最受不了的就是速度,之前本地跑图,参数配好了,也能跑出很不错的图 ...
上下文10K以内满速45TK/s
30K会掉到30TK/s
50K之后就只有25TK/s了,所以感觉上下文太长也没法用
本地部署想效果好一点花的钱实在太多了,不如买api 哈哈 和楼主一样喜欢折腾的我
我现在拿本地部署的qwen搓一个极其复杂架构的游戏,基本上后期任务新开对话光是要读前面已经做好的东西,他就要读到压缩
但我依然在开开心心的蹬它
保持速度在60左右
其实我拿glm5.3flash测过同一个难度的html游戏任务,qwen反而是又快又稳定哪个。
glm还给我停了。。虽然它的确做出来更好看一点
qwen量化模型就是表现力的确平庸,但稳定能用就行。复杂的好看的再交给api,节约钱包
问个很基础的问题,单位电脑是9950x3d 128g 5070,想本地部署一个模型,用来写一些涉密项目的技术设计书,这种纯文字的需求用哪个模型比较好?
—— 来自 鹅球 v3.5.99 张叔夜 发表于 2026-8-27 19:55
问个很基础的问题,单位电脑是9950x3d 128g 5070,想本地部署一个模型,用来写一些涉密项目的技术设计书, ...
做不了吧,这个配置能跑的模型写技术文档恐怕会胡言乱语 qwased 发表于 2026-8-27 18:47
Qwen3.8-27B-UD-Q6_K+dflash2 Q8+160K以上的上下文吧应该
UD版本谁家强? Q5+256K的话性能损失大吗 squallx 发表于 2026-8-27 20:42
UD版本谁家强? Q5+256K的话性能损失大吗
你有5090的话直接用ninfer和他配套的模型应该是27B最舒服的玩法了,8并发能跑1000tk/s的样子 qwased 发表于 2026-8-27 19:14
刚毕业的混子大学生。。吧
十年程序员,组里被优化的只剩我一人了,反正过两个月也是被优化的命,我当然得使劲蹬 能用nvfp4的吗
—— 来自 HUAWEI NOH-AN00, Android 12, 鹅球 v4.0 16g v100都能跑,而且跑到20t,比之前的27b强太多了