找回密码
 立即注册
搜索
查看: 2633|回复: 43

[科技] 16G显卡+qwen3.8 27B上下文200K,个人经验总结

[复制链接]
     
发表于 2026-8-27 17:39 | 显示全部楼层 |阅读模式
本帖最后由 qwased 于 2026-8-27 23:03 编辑

     这是目前个人使用比较舒适的一个组合,仅供参考
     最终效果:Qwen3.8 27B 保留视觉 + 长上下文(APEX MINI量化 64K,APEX NANO 200K) + 思维链正常输出

1. 硬件与环境准备
       GPU 型号 / 显存  本记录针对16GB显卡挖掘潜力,12GB也可以根据自己的情况尝试调整
       CPU / 内存   需要将视觉模型交给CPU处理,当你需要频繁使用视觉能力的时候CPU越强越好,内存32G即可
       13600K级别的cpu处理一次720P图片需要大约30秒

2. 模型与量化选择:Unsloth vs APEX
        https://huggingface.co/unsloth/Qwen3.8-27B-GGUF  IQ3XXS或IQ4XS
       老牌选择,表现不错,对KV量化非常敏感,建议TB4+4
       https://huggingface.co/mudler/Qwen3.8-27B-APEX-GGUF NANO或者MINI
        实测表现比unsloth同大小量化稍好(据说mini=Q5KS级别的质量),对KV量化不那么敏感
        Mmoprj是视觉模型,和LLM模型放在一起即可

3. llama.cpp 分支选择:atomic-llama-cpp-turboquant
        https://github.com/AtomicBot-ai/atomic-llama-cpp-turboquant  
       支持谷歌turboquant,KV可以做到Q8质量的量化+Q4的容量,50系N卡选择cuda13.3,40及之前的选择CUDA12.4

4. 思维链修复补丁 chat template
https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates  qwen思维链修复补丁,阿里官方的输出格式有问题导致模型无法退出思考,使用该补丁后不再出现数万token的超长无效思考


组装:解压llamacpp,将模型和chat template文件放在含有llama-server.exe的目录下



llama.cpp 启动参数解释

llama-server.exe -m "./model/Qwen3.8-27B-APEX-I-Mini.gguf" --mmproj "./model/mmproj-Qwen3.8-27B-F16.gguf" --no-mmproj-offload --image-min-tokens 1024 --image-max-tokens 4096 -c 65536 -ngl 99 -ctk turbo4 -ctv turbo3 -fa on --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --kv-unified --no-host --cache-ram 0 -np 1 -b 512 -ub 512 --reasoning-preserve --jinja --chat-template-file chat_template.jinja --reasoning-format deepseek --host 127.0.0.1 --port 24548


        重点参数的实际作用
        --no-mmproj-offload 将视觉模型交给cpu处理,可以节约1GB左右的显存
        -c 65536  上下文长度 模型大小14GB时可开64K~80K,大小11GB的模型可开180K~200K。为了足够的上下文长度不建议使用MTP
        -ctk turbo4 -ctv turbo3 分别指定KV量化格式,建议unsloth模型使用4+4,apex可以4+3(刚刚发现3+3会直接报错
        --no-mmap --no-host --cache-ram 0  不将模型在内存另存一套,避免无谓的内存浪费
        --jinja --chat-template-file chat_template.jinja --reasoning-format deepseek 替换输出格式文件,并要求按照deepseek思维链格式输出
        --host 127.0.0.1 --port 24548  监听端口

7. 伪无限上下文:pi harness + pi vcc
       16GB显卡的显存和核心性能都不足以支持太长的上下文,需要使用极简harness以及上下文插件使用
       建议搭配:oh my pi+pi vcc / DSH+ dsh-compaction-instant
       篇幅太长不多赘述,提供下载地址自行试用
       https://github.com/can1357/oh-my-pi
       https://github.com/sting8k/pi-vcc
      https://github.com/deepseek-ai/deepseek-harness
       https://github.com/TsFreddie/dsh-compaction-instant



让gemini写了一个设计方案给qwen实现,感觉效果超出预期

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×

评分

参与人数 7战斗力 +10 收起 理由
静哮苍穹 + 2 好评加鹅
三壮同志 + 1 好评加鹅
龙骑士尹志平 + 2
chaoliu + 2 感谢方案
来都来了 + 1 好评加鹅
cm2104 + 1
CosineG + 1 好评加鹅

查看全部评分

回复

使用道具 举报

发表于 2026-8-27 17:57 | 显示全部楼层
泥潭归墟的帖子会自动关闭,这种教程贴最好让管理员解一下,或者发数码版更好吧
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 18:04 | 显示全部楼层
城北无尘 发表于 2026-8-27 17:57
泥潭归墟的帖子会自动关闭,这种教程贴最好让管理员解一下,或者发数码版更好吧 ...

其实自己就能关,只是自己关的帖子如果出事了就会吃二狗铁拳
回复

使用道具 举报

     
发表于 2026-8-27 18:09 来自手机 | 显示全部楼层
挺好,有空捣鼓一下,我是10850k+5070 Ti+64G DDR4。之前本地跑了qwen3.6 27B Q4 XS with MTP,上下文只敢开16k,速度平均35-40 tk/s,简单需求效果还行

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 18:11 | 显示全部楼层
大暴死 发表于 2026-8-27 18:09
挺好,有空捣鼓一下,我是10850k+5070 Ti+64G DDR4。之前本地跑了qwen3.6 27B Q4 XS with MTP,上下文只敢 ...

16G显存的卡开MTP收益很差
等bonsai出新的三元量化27B吧,他那个量化能把Q4质量压到9GB大小,MTP和上下文都能拉满了
回复

使用道具 举报

     
发表于 2026-8-27 18:12 来自手机 | 显示全部楼层
我是用m4pro macmini+27b mtp d3,速度勉强达到20t/s,预填充虽然慢,但已经比半年前3.6那会强多了
梁文峰时段用它度过垃圾时间基本够用
回复

使用道具 举报

     
发表于 2026-8-27 18:20 | 显示全部楼层
DFlash和MTP该选哪个?让codex测试是前者更快一点
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 18:22 | 显示全部楼层
lubo 发表于 2026-8-27 18:20
DFlash和MTP该选哪个?让codex测试是前者更快一点

Dflash2好,但是也很吃显存
回复

使用道具 举报

     
发表于 2026-8-27 18:24 来自手机 | 显示全部楼层
手动mark一下
回复

使用道具 举报

     
发表于 2026-8-27 18:31 来自手机 | 显示全部楼层
32g单卡能跑什么?

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-27 18:41 | 显示全部楼层
有老哥在 Mac OS 上布置这一套吗?我在折腾这一套,但是现在反正看下来是不可用。你比如说代码,它就永远在思考,但是从不落在纸面上。

—— 来自 S1Fun
回复

使用道具 举报

     
发表于 2026-8-27 18:41 | 显示全部楼层
古畑任三郎2015 发表于 2026-8-27 18:12
我是用m4pro macmini+27b mtp d3,速度勉强达到20t/s,预填充虽然慢,但已经比半年前3.6那会强多了
梁文峰 ...

大哥能详细说说配置吗?

—— 来自 S1Fun
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 18:47 | 显示全部楼层
本帖最后由 qwased 于 2026-8-27 21:48 编辑
umamusume 发表于 2026-8-27 18:31
32g单卡能跑什么?

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0

5090直接上ninfer全套
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 18:48 | 显示全部楼层
真红之闪电 发表于 2026-8-27 18:41
有老哥在 Mac OS 上布置这一套吗?我在折腾这一套,但是现在反正看下来是不可用。你比如说代码,它就永远在 ...

装思考修复
回复

使用道具 举报

     
发表于 2026-8-27 18:50 | 显示全部楼层
这是派什么用处的?
回复

使用道具 举报

     
发表于 2026-8-27 18:53 | 显示全部楼层

我装了这个东西,就是昨天在Deepseek那个楼里我就问你了。
回复

使用道具 举报

     
发表于 2026-8-27 18:55 来自手机 | 显示全部楼层
qwased 发表于 2026-8-27 18:11
16G显存的卡开MTP收益很差
等bonsai出新的三元量化27B吧,他那个量化能把Q4质量压到9GB大小,MTP和上下文 ...

但不开mtp的话tk/s美不看,还好我(当时)没有特别长的上下文需求

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 18:55 | 显示全部楼层
真红之闪电 发表于 2026-8-27 18:53
我装了这个东西,就是昨天在Deepseek那个楼里我就问你了。

是不是你给他的任务太难了?你试试先用别的大模型把任务分解成最小单元再给他做看看
回复

使用道具 举报

     
发表于 2026-8-27 18:57 来自手机 | 显示全部楼层
真红之闪电 发表于 2026-8-27 18:41
大哥能详细说说配置吗?

—— 来自 S1Fun

我是64g,从用量来看48g也够
不过我基本不用它跑代码,只测试过dsh用它做俄罗斯方块和计算器小程序,前者20分钟,后者一小时,都是无中断做完,自己反复优化抓bug几轮
回复

使用道具 举报

     
发表于 2026-8-27 18:57 | 显示全部楼层
要是32g现存推荐哪个模型?内存96G   
另外ollama能用吗?我很久以前尝试自己本地模型用的是ollama
回复

使用道具 举报

发表于 2026-8-27 18:59 | 显示全部楼层
能到什么水平,这个月fable拉满已经干了8000刀了,老板直呼受不了
回复

使用道具 举报

     
发表于 2026-8-27 18:59 | 显示全部楼层
古畑任三郎2015 发表于 2026-8-27 18:57
我是64g,从用量来看48g也够
不过我基本不用它跑代码,只测试过dsh用它做俄罗斯方块和计算器小程序,前者 ...

不是问的系统配置,我是问你模型怎么配。是不是 MLX?
如果是:
用什么 server?mlx-lm 自带?oMLX?还是其他项目?
回复

使用道具 举报

     
发表于 2026-8-27 19:05 来自手机 | 显示全部楼层
真红之闪电 发表于 2026-8-27 18:59
不是问的系统配置,我是问你模型怎么配。是不是 MLX?
如果是:
用什么 server?mlx-lm 自带?oMLX?还是 ...

我用mtplx,模型是mtplx-qwen38-27b-optimized-speed
回复

使用道具 举报

     
发表于 2026-8-27 19:08 | 显示全部楼层
如果要尝试捣鼓AI,是不是退役的10980xe+128G内存反而比现役的9800X3D+64G内存要好用?显卡有4090,另外还有张2080ti。
要不就10980xe+128G+4090搞AI,9800X3D+64G+2080ti玩游戏?反正现在也就只玩玩暗黑4。
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 19:10 来自手机 | 显示全部楼层
downforce 发表于 2026-8-27 19:08
如果要尝试捣鼓AI,是不是退役的10980xe+128G内存反而比现役的9800X3D+64G内存要好用?显卡有4090,另外还 ...

取决于你跑什么,内存容量够用的情况下带宽越高越好
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 19:13 来自手机 | 显示全部楼层
子虚乌有 发表于 2026-8-27 18:57
要是32g现存推荐哪个模型?内存96G   
另外ollama能用吗?我很久以前尝试自己本地模型用的是ollama
...

可以尝试用freetoken之类的框架部署dsv4 flash了
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 19:14 来自手机 | 显示全部楼层
又是十元 发表于 2026-8-27 18:59
能到什么水平,这个月fable拉满已经干了8000刀了,老板直呼受不了

刚毕业的混子大学生。。吧
回复

使用道具 举报

     
发表于 2026-8-27 19:24 | 显示全部楼层
qwased 发表于 2026-8-27 19:10
取决于你跑什么,内存容量够用的情况下带宽越高越好

cpu影响不大吗?10980xe毕竟有18个核,内存也是4通道,但是主频低。
两者的理论内存带宽好像是一样的,4通道D4 3200 VS 2通道D5 6400。
回复

使用道具 举报

     
发表于 2026-8-27 19:26 | 显示全部楼层
qwased 发表于 2026-8-27 19:13
可以尝试用freetoken之类的框架部署dsv4 flash了

收到,我看看哈
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 19:29 | 显示全部楼层
downforce 发表于 2026-8-27 19:24
cpu影响不大吗?10980xe毕竟有18个核,内存也是4通道,但是主频低。
两者的理论内存带宽好像是一样的,4 ...

影响不大,哪怕是moe模型把一部分计算交给cpu来跑一般也是纯拖后腿导致降速的结果
回复

使用道具 举报

发表于 2026-8-27 19:31 来自手机 | 显示全部楼层
给楼主的折腾精神加鹅,不过本地部署,最受不了的就是速度,之前本地跑图,参数配好了,也能跑出很不错的图,但是一张图两三分钟,真的有点受不了。大语言模型这一块,速度慢一点真的是特别难受,毕竟主要的工作就是盯着屏幕看它输出内容
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 19:34 | 显示全部楼层
来都来了 发表于 2026-8-27 19:31
给楼主的折腾精神加鹅,不过本地部署,最受不了的就是速度,之前本地跑图,参数配好了,也能跑出很不错的图 ...

上下文10K以内满速45TK/s
30K会掉到30TK/s
50K之后就只有25TK/s了,所以感觉上下文太长也没法用
本地部署想效果好一点花的钱实在太多了,不如买api
回复

使用道具 举报

     
发表于 2026-8-27 19:51 来自手机 | 显示全部楼层
哈哈 和楼主一样喜欢折腾的我
我现在拿本地部署的qwen搓一个极其复杂架构的游戏,基本上后期任务新开对话光是要读前面已经做好的东西,他就要读到压缩
但我依然在开开心心的蹬它
保持速度在60左右
其实我拿glm5.3flash测过同一个难度的html游戏任务,qwen反而是又快又稳定哪个。
glm还给我停了。。虽然它的确做出来更好看一点
qwen量化模型就是表现力的确平庸,但稳定能用就行。复杂的好看的再交给api,节约钱包
回复

使用道具 举报

     
发表于 2026-8-27 19:55 来自手机 | 显示全部楼层
问个很基础的问题,单位电脑是9950x3d 128g 5070,想本地部署一个模型,用来写一些涉密项目的技术设计书,这种纯文字的需求用哪个模型比较好?

—— 来自 鹅球 v3.5.99
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 20:15 来自手机 | 显示全部楼层
张叔夜 发表于 2026-8-27 19:55
问个很基础的问题,单位电脑是9950x3d 128g 5070,想本地部署一个模型,用来写一些涉密项目的技术设计书, ...

做不了吧,这个配置能跑的模型写技术文档恐怕会胡言乱语
回复

使用道具 举报

     
发表于 2026-8-27 20:42 | 显示全部楼层
qwased 发表于 2026-8-27 18:47
Qwen3.8-27B-UD-Q6_K+dflash2 Q8+160K以上的上下文吧应该

UD版本谁家强? Q5+256K的话性能损失大吗
回复

使用道具 举报

     
 楼主| 发表于 2026-8-27 20:49 | 显示全部楼层
squallx 发表于 2026-8-27 20:42
UD版本谁家强? Q5+256K的话性能损失大吗

你有5090的话直接用ninfer和他配套的模型应该是27B最舒服的玩法了,8并发能跑1000tk/s的样子
回复

使用道具 举报

发表于 2026-8-27 21:24 | 显示全部楼层
qwased 发表于 2026-8-27 19:14
刚毕业的混子大学生。。吧

十年程序员,组里被优化的只剩我一人了,反正过两个月也是被优化的命,我当然得使劲蹬
回复

使用道具 举报

     
发表于 2026-8-27 21:35 来自手机 | 显示全部楼层
能用nvfp4的吗

—— 来自 HUAWEI NOH-AN00, Android 12, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-27 21:44 | 显示全部楼层
16g v100都能跑,而且跑到20t,比之前的27b强太多了
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-28 00:46 , Processed in 0.115079 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表