绯色日照 发表于 2026-9-20 22:25

非常感谢LZ的分享,我是5090DV2,只有24G显存,按你的经验现在已经部署好并连接到DSH了,感觉日常办公搞数据分析蛮好(已经测试过 ),可以当生产力工具了。但我电脑内存只有32G,跑起来内存几乎是满的,也做不了别的事。看回帖的不少坛友都是64G内存,考虑双十一咬牙买个

qwased 发表于 2026-9-20 22:34

本帖最后由 qwased 于 2026-9-20 22:40 编辑

绯色日照 发表于 2026-9-20 22:25
非常感谢LZ的分享,我是5090DV2,只有24G显存,按你的经验现在已经部署好并连接到DSH了,感觉日常办公搞数 ...
--load-mode none加上这个就不吃内存了

体制 发表于 2026-9-20 22:45

请问大佬们,搞个64g的m5 max跑32b的qwen3如何,我看jd官网预约价格25999,这比买个5080便宜,也是办公做数据分析。


—— 来自 鹅球 v4.0-alpha

大暴死 发表于 2026-9-20 22:46

zhl1989666 发表于 2026-9-20 13:38
我现在用DSH,但是主楼里的伪长上下文插件装了后报错,直接启动不了,把错误信息拿去问DS说可能是版本不 ...

0.15的compaction basic有调整之前部署过dsh-compaction-instant的话更新后dsh会加载失败,这个坑我已经踩过了。解决方法是给dsh-compaction-instant单独设一套profile,通过单独的启动指令加载。dsh web启动就是加载常规dsh自带的compaction,dsh --profile web-xxxxx启动就是带dsh-compaction-instant的,这样后续更新如果影响已有插件的至少不会影响dsh本体的启动

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-9-20 22:51

体制 发表于 2026-9-20 22:45
请问大佬们,搞个64g的m5 max跑32b的qwen3如何,我看jd官网预约价格25999,这比买个5080便宜,也是办公做数 ...
flash next或者买api吧
不太建议现在专门买硬件来本地跑模型,直接买api更划算

魔法师lain 发表于 2026-9-20 23:07

本帖最后由 魔法师lain 于 2026-9-20 23:08 编辑

qwased 发表于 2026-9-20 22:16
windows本身要吃1g,算了这个没

iq3xxs搞起来后gpu内存占用11.6g,
bonsai才占用8.7g还有很多剩余。我暂时试的应用都是完全没上下文的纯翻译。另外内存占用也不算很多,服务开起来后,内存占用从10g升到20g而已,还有30g剩余

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99

qwased 发表于 2026-9-20 23:08

魔法师lain 发表于 2026-9-20 23:07
iq3xxs搞起来后gpu内存占用11.6g,
bonsai才占用8.7g还有很多剩余。我暂时试的应用都是完全没上下文的纯 ...

接个DS让他调吧大肥鱼调llamacpp很拿手的

希望之花 发表于 2026-9-20 23:11

所以现在5090突然涨价是因为DSH的原因吗

qwased 发表于 2026-9-20 23:25

希望之花 发表于 2026-9-20 23:11
所以现在5090突然涨价是因为DSH的原因吗

5060ti都被扫了去给小公司跑llm/短剧工作流了
5090就是老黄不放货了

魔法师lain 发表于 2026-9-20 23:28

本帖最后由 魔法师lain 于 2026-9-20 23:46 编辑

qwased 发表于 2026-9-20 23:08
接个DS让他调吧大肥鱼调llamacpp很拿手的

试了一下厅里的htpc的2080ti 11g,bonsai的输出能到40t/s,gpu占用能有99%。看来是a3000魔改驱动的问题咯?不过这pc不像房里服务器那样一直开,且内存只有16g,用起来不是太方便

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99

KT-7 发表于 2026-9-21 08:33

3060 12G是不是只能用用qwen3.6 35B A3B

qwased 发表于 2026-9-21 09:03

KT-7 发表于 2026-9-21 08:33
3060 12G是不是只能用用qwen3.6 35B A3B

gsq iq3xxs或者bonsai2

暗口崩子 发表于 2026-9-21 10:16

体制 发表于 2026-9-20 22:45
请问大佬们,搞个64g的m5 max跑32b的qwen3如何,我看jd官网预约价格25999,这比买个5080便宜,也是办公做数 ...

纯数据工作涉及保密之类的硬性要求吗
没有的话永远不如买api

neptunehs 发表于 2026-9-23 19:24

本帖最后由 neptunehs 于 2026-9-23 19:44 编辑

为啥你们都说hy2mt的翻译好 我不管怎么调整我的关键词 sklep都会翻译成“商店\店铺”这叫翻译吗 这叫查字典吧。。。
然后稍微生僻点的词语都会中文(英文) 也是怎么都关不掉
标签更是被弄得一塌糊涂。。。

然后灰溜溜用回qwen3.6

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

qwased 发表于 2026-9-23 19:45

neptunehs 发表于 2026-9-23 19:24
为啥你们都说hy2mt的翻译好 我不管怎么调整我的关键词 sklep都会翻译成“商店\店铺”这叫翻译吗 这叫查字 ...

粗翻最强就这个了,要精翻肯定得买api,qwen翻出来总是不太像人话

静哮苍穹 发表于 2026-9-23 19:47

体制 发表于 2026-9-20 22:45
请问大佬们,搞个64g的m5 max跑32b的qwen3如何,我看jd官网预约价格25999,这比买个5080便宜,也是办公做数 ...

没有保密要求的话远不如plan乃至api

无尽的牙刷 发表于 2026-9-23 20:05

找了好几个模型,实测16g显存破限写文最好用的是huihui UD-IQ4_XS,其他的要么破得不彻底,要么会英文输出,要么不说人话

qwased 发表于 2026-9-23 20:23

无尽的牙刷 发表于 2026-9-23 20:05
找了好几个模型,实测16g显存破限写文最好用的是huihui UD-IQ4_XS,其他的要么破得不彻底,要么会英文输出 ...

hertic ara iq4xs试了吗

无尽的牙刷 发表于 2026-9-23 20:33

qwased 发表于 2026-9-23 20:23
hertic ara iq4xs试了吗

试了,具体记不清了,不过记录里确实留着这个模型,应该是破限程度不够

icer 发表于 2026-9-23 20:38

发现一个双路3090+128显存跑qwen3.8 flash next的项目,单人用感觉不错

https://github.com/DominikBucko/qwen38-flash-next-2x3090/blob/main/docs/hardware.md

zktz 发表于 2026-9-25 20:01

我用 A6000 稳定在 35token/s

zhl1989666 发表于 2026-9-25 23:35

本帖最后由 zhl1989666 于 2026-9-25 23:37 编辑

qwased 发表于 2026-9-2 18:50
atomicchat的q4量化,llamacpp自己编译最新的

llama-server -m“你的模型路径”--mmproj“你的视 觉模块 ...
就用这个参数一点没改跑鹈鹕骑车1次成功了,而且不知道为什么显卡跑NEXT的温度居然没有跑3.8高,明明跑起来都是几乎满载,热点才70度左右,反而3.8全速上90度了

这样跑应该不会伤固态吧?现在固态太贵了

qwased 发表于 2026-9-26 09:39

zhl1989666 发表于 2026-9-25 23:35
就用这个参数一点没改跑鹈鹕骑车1次成功了,而且不知道为什么显卡跑NEXT的温度居然没有跑3.8高,明明跑起 ...

因为主要是CPU在跑,显卡敲敲边鼓

你要用的是llamacpp的话叫他编译下https://github.com/ggml-org/llama.cpp/pull/29030,SSD流式加载知识库的性能损失会大幅降低,可以让在线模型再排查下llamacpp是不是全部编译了这个模型的cpu加速库,没有的话让它补上,还能再提速

zhl1989666 发表于 2026-9-26 16:21

本帖最后由 zhl1989666 于 2026-9-26 16:24 编辑

qwased 发表于 2026-9-26 09:39
因为主要是CPU在跑,显卡敲敲边鼓

你要用的是llamacpp的话叫他编译下https://github.com/ggml-org/llama ...
今天用了这个试了下,没看出区别,而且无论是昨天的LLAMA还是今天这个新编译的都降速到12t/s,昨天还是16t/s,完全一样的参数。另外--jinja -fit off -fa on这几个参数看说明说是加上比较好,当然我今天测试的时候加不加速度都没变化,还是12t/s。昨天说1次成功了还是有点武断,仔细看了下至少左腿的图层位置不对,要修改一下不要放在最上层


继续期待LZ您的参数,更新一版FLASH NEXT的吧,16G显存的

qwased 发表于 2026-9-26 16:48

zhl1989666 发表于 2026-9-26 16:21
今天用了这个试了下,没看出区别,而且无论是昨天的LLAMA还是今天这个新编译的都降速到12t/s,昨天还是16t ...

qoder能免费白嫖,没有动力折腾了
这个pr解决的是预填充太慢的问题,读文件不用等很久了

夜游宫 发表于 2026-9-26 16:52

无尽的牙刷 发表于 2026-9-23 20:05
找了好几个模型,实测16g显存破限写文最好用的是huihui UD-IQ4_XS,其他的要么破得不彻底,要么会英文输出 ...

12G内存试了下Huihui-Qwen3-14B,只能说写得算是人话。

qwased 发表于 2026-9-26 17:44

更新了一下现在自用的方案,没什么意外的话就等qwen4再更新了

qwased 发表于 2026-9-27 17:24

本帖最后由 qwased 于 2026-9-28 09:59 编辑

https://huggingface.co/ISTA-DASL ... -GSQ-RCO-Coder-GGUF

把编码以外的能力全部剪掉的版本,我来尝尝

输入中文会直接导致崩溃,寄

https://github.com/Niko1221/Strata
这个3.8flash专属引擎好像很快

qwased 发表于 2026-9-28 12:05




核弹瘫坐,有64G内存的可以把27b扔进垃圾桶了




pf67 发表于 2026-9-28 12:19

qwased 发表于 2026-9-28 12:05
核弹瘫坐,有64G内存的可以把27b扔进垃圾桶了

详细讲讲?
我64g内存,但是感觉日常加载27b都时常会导致内存吃紧……,一大堆杂七杂八的也都会狠狠占用内存……

—— 来自 Xiaomi 25042PN24C, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-9-28 12:22

pf67 发表于 2026-9-28 12:19
详细讲讲?
我64g内存,但是感觉日常加载27b都时常会导致内存吃紧……,一大堆杂七杂八的也都会狠狠占用 ...

换上面那个Strata框架跑3.8 flash next
不过你平时内存占用就高的话就不适合了

yhl 发表于 2026-9-28 14:40

llama.cpp像我这样的小白windows下可以用这个,https://github.com/marsempire/LlamaManager,经常换大模型改参数比较方便

最近用ninfer感觉不错,就是差个好的无审查大模型……

taxiom 发表于 2026-9-28 14:51

啊,iq2真的好用吗

qwased 发表于 2026-9-28 14:57

taxiom 发表于 2026-9-28 14:51
啊,iq2真的好用吗

不好用,但是我只有48G内存跑不起IQ3S啊
就当测一下技术了

zhl1989666 发表于 2026-9-28 15:03

本帖最后由 zhl1989666 于 2026-9-28 15:17 编辑

qwased 发表于 2026-9-28 12:05
核弹瘫坐,有64G内存的可以把27b扔进垃圾桶了
这么强吗,但我Q4也能跑16token,下个IQ3_S应该还好吧,但这拉模型是从抱脸主网拉的,有什么方法改成镜像,直接改脚本不知道行不行

taxiom 发表于 2026-9-28 15:14

本帖最后由 taxiom 于 2026-9-28 15:15 编辑

qwased 发表于 2026-9-28 14:57
不好用,但是我只有48G内存跑不起IQ3S啊
就当测一下技术了

我跑了nvfp4的版本176b,对比ds0731 304b差一大截,而27b的q4除了没有1m上下文,某些场景吊打ds0731。所以在我这是3.8fn<ds0731≈27b

qwased 发表于 2026-9-28 15:14

zhl1989666 发表于 2026-9-28 15:03
这么强吗,但我Q4也能跑16token,下个IQ3_S应该还好吧

找个在线模型帮你部署吧,50~70tps的输出稳稳的,配合昨天新发布的GSQ IQ3S刚好

就是这个项目自带的安装脚本完全没考虑中文系统和网络问题,用不了,你下好模型文件叫agent读完readme和安装脚本帮你操作

qwased 发表于 2026-9-28 15:15

taxiom 发表于 2026-9-28 15:14
我跑了nvfp4的版本176b,对比ds0731 284b差一大截,而27b的q4除了没有1m上下文,某些场景吊打ds0731。所 ...

nvfp4的量化质量太低了,特别是那种w4a4的
你换gsq rco iq3s再试试

pf67 发表于 2026-9-28 15:16

绯色日照 发表于 2026-9-20 22:25
非常感谢LZ的分享,我是5090DV2,只有24G显存,按你的经验现在已经部署好并连接到DSH了,感觉日常办公搞数 ...

dsh 发一句你好就已经消耗了14k上下文,我觉得对本地模型开发来说并不友好

—— 来自 Xiaomi 25042PN24C, Android 16, 鹅球 v3.5.99

taxiom 发表于 2026-9-28 15:16

qwased 发表于 2026-9-28 15:15
nvfp4的量化质量太低了,特别是那种w4a4的
你换gsq rco iq3s再试试

回头试试
页: 1 2 3 4 5 [6] 7 8 9
查看完整版本: 16G显卡+qwen3.8 27B上下文200K,个人经验总结(更新llamacpp推荐)