非常感谢LZ的分享,我是5090DV2,只有24G显存,按你的经验现在已经部署好并连接到DSH了,感觉日常办公搞数据分析蛮好(已经测试过 ),可以当生产力工具了。但我电脑内存只有32G,跑起来内存几乎是满的,也做不了别的事。看回帖的不少坛友都是64G内存,考虑双十一咬牙买个
本帖最后由 qwased 于 2026-9-20 22:40 编辑
绯色日照 发表于 2026-9-20 22:25
非常感谢LZ的分享,我是5090DV2,只有24G显存,按你的经验现在已经部署好并连接到DSH了,感觉日常办公搞数 ...
--load-mode none加上这个就不吃内存了
请问大佬们,搞个64g的m5 max跑32b的qwen3如何,我看jd官网预约价格25999,这比买个5080便宜,也是办公做数据分析。
—— 来自 鹅球 v4.0-alpha
zhl1989666 发表于 2026-9-20 13:38
我现在用DSH,但是主楼里的伪长上下文插件装了后报错,直接启动不了,把错误信息拿去问DS说可能是版本不 ...
0.15的compaction basic有调整之前部署过dsh-compaction-instant的话更新后dsh会加载失败,这个坑我已经踩过了。解决方法是给dsh-compaction-instant单独设一套profile,通过单独的启动指令加载。dsh web启动就是加载常规dsh自带的compaction,dsh --profile web-xxxxx启动就是带dsh-compaction-instant的,这样后续更新如果影响已有插件的至少不会影响dsh本体的启动
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
体制 发表于 2026-9-20 22:45
请问大佬们,搞个64g的m5 max跑32b的qwen3如何,我看jd官网预约价格25999,这比买个5080便宜,也是办公做数 ...
flash next或者买api吧
不太建议现在专门买硬件来本地跑模型,直接买api更划算
本帖最后由 魔法师lain 于 2026-9-20 23:08 编辑
qwased 发表于 2026-9-20 22:16
windows本身要吃1g,算了这个没
iq3xxs搞起来后gpu内存占用11.6g,
bonsai才占用8.7g还有很多剩余。我暂时试的应用都是完全没上下文的纯翻译。另外内存占用也不算很多,服务开起来后,内存占用从10g升到20g而已,还有30g剩余
—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99
魔法师lain 发表于 2026-9-20 23:07
iq3xxs搞起来后gpu内存占用11.6g,
bonsai才占用8.7g还有很多剩余。我暂时试的应用都是完全没上下文的纯 ...
接个DS让他调吧大肥鱼调llamacpp很拿手的
所以现在5090突然涨价是因为DSH的原因吗
希望之花 发表于 2026-9-20 23:11
所以现在5090突然涨价是因为DSH的原因吗
5060ti都被扫了去给小公司跑llm/短剧工作流了
5090就是老黄不放货了
本帖最后由 魔法师lain 于 2026-9-20 23:46 编辑
qwased 发表于 2026-9-20 23:08
接个DS让他调吧大肥鱼调llamacpp很拿手的
试了一下厅里的htpc的2080ti 11g,bonsai的输出能到40t/s,gpu占用能有99%。看来是a3000魔改驱动的问题咯?不过这pc不像房里服务器那样一直开,且内存只有16g,用起来不是太方便
—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99
3060 12G是不是只能用用qwen3.6 35B A3B
KT-7 发表于 2026-9-21 08:33
3060 12G是不是只能用用qwen3.6 35B A3B
gsq iq3xxs或者bonsai2
体制 发表于 2026-9-20 22:45
请问大佬们,搞个64g的m5 max跑32b的qwen3如何,我看jd官网预约价格25999,这比买个5080便宜,也是办公做数 ...
纯数据工作涉及保密之类的硬性要求吗
没有的话永远不如买api
本帖最后由 neptunehs 于 2026-9-23 19:44 编辑
为啥你们都说hy2mt的翻译好 我不管怎么调整我的关键词 sklep都会翻译成“商店\店铺”这叫翻译吗 这叫查字典吧。。。
然后稍微生僻点的词语都会中文(英文) 也是怎么都关不掉
标签更是被弄得一塌糊涂。。。
然后灰溜溜用回qwen3.6
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
neptunehs 发表于 2026-9-23 19:24
为啥你们都说hy2mt的翻译好 我不管怎么调整我的关键词 sklep都会翻译成“商店\店铺”这叫翻译吗 这叫查字 ...
粗翻最强就这个了,要精翻肯定得买api,qwen翻出来总是不太像人话
体制 发表于 2026-9-20 22:45
请问大佬们,搞个64g的m5 max跑32b的qwen3如何,我看jd官网预约价格25999,这比买个5080便宜,也是办公做数 ...
没有保密要求的话远不如plan乃至api
找了好几个模型,实测16g显存破限写文最好用的是huihui UD-IQ4_XS,其他的要么破得不彻底,要么会英文输出,要么不说人话
无尽的牙刷 发表于 2026-9-23 20:05
找了好几个模型,实测16g显存破限写文最好用的是huihui UD-IQ4_XS,其他的要么破得不彻底,要么会英文输出 ...
hertic ara iq4xs试了吗
qwased 发表于 2026-9-23 20:23
hertic ara iq4xs试了吗
试了,具体记不清了,不过记录里确实留着这个模型,应该是破限程度不够
发现一个双路3090+128显存跑qwen3.8 flash next的项目,单人用感觉不错
https://github.com/DominikBucko/qwen38-flash-next-2x3090/blob/main/docs/hardware.md
我用 A6000 稳定在 35token/s
本帖最后由 zhl1989666 于 2026-9-25 23:37 编辑
qwased 发表于 2026-9-2 18:50
atomicchat的q4量化,llamacpp自己编译最新的
llama-server -m“你的模型路径”--mmproj“你的视 觉模块 ...
就用这个参数一点没改跑鹈鹕骑车1次成功了,而且不知道为什么显卡跑NEXT的温度居然没有跑3.8高,明明跑起来都是几乎满载,热点才70度左右,反而3.8全速上90度了
这样跑应该不会伤固态吧?现在固态太贵了
zhl1989666 发表于 2026-9-25 23:35
就用这个参数一点没改跑鹈鹕骑车1次成功了,而且不知道为什么显卡跑NEXT的温度居然没有跑3.8高,明明跑起 ...
因为主要是CPU在跑,显卡敲敲边鼓
你要用的是llamacpp的话叫他编译下https://github.com/ggml-org/llama.cpp/pull/29030,SSD流式加载知识库的性能损失会大幅降低,可以让在线模型再排查下llamacpp是不是全部编译了这个模型的cpu加速库,没有的话让它补上,还能再提速
本帖最后由 zhl1989666 于 2026-9-26 16:24 编辑
qwased 发表于 2026-9-26 09:39
因为主要是CPU在跑,显卡敲敲边鼓
你要用的是llamacpp的话叫他编译下https://github.com/ggml-org/llama ...
今天用了这个试了下,没看出区别,而且无论是昨天的LLAMA还是今天这个新编译的都降速到12t/s,昨天还是16t/s,完全一样的参数。另外--jinja -fit off -fa on这几个参数看说明说是加上比较好,当然我今天测试的时候加不加速度都没变化,还是12t/s。昨天说1次成功了还是有点武断,仔细看了下至少左腿的图层位置不对,要修改一下不要放在最上层
继续期待LZ您的参数,更新一版FLASH NEXT的吧,16G显存的
zhl1989666 发表于 2026-9-26 16:21
今天用了这个试了下,没看出区别,而且无论是昨天的LLAMA还是今天这个新编译的都降速到12t/s,昨天还是16t ...
qoder能免费白嫖,没有动力折腾了
这个pr解决的是预填充太慢的问题,读文件不用等很久了
无尽的牙刷 发表于 2026-9-23 20:05
找了好几个模型,实测16g显存破限写文最好用的是huihui UD-IQ4_XS,其他的要么破得不彻底,要么会英文输出 ...
12G内存试了下Huihui-Qwen3-14B,只能说写得算是人话。
更新了一下现在自用的方案,没什么意外的话就等qwen4再更新了
本帖最后由 qwased 于 2026-9-28 09:59 编辑
https://huggingface.co/ISTA-DASL ... -GSQ-RCO-Coder-GGUF
把编码以外的能力全部剪掉的版本,我来尝尝
输入中文会直接导致崩溃,寄
https://github.com/Niko1221/Strata
这个3.8flash专属引擎好像很快
核弹瘫坐,有64G内存的可以把27b扔进垃圾桶了
qwased 发表于 2026-9-28 12:05
核弹瘫坐,有64G内存的可以把27b扔进垃圾桶了
详细讲讲?
我64g内存,但是感觉日常加载27b都时常会导致内存吃紧……,一大堆杂七杂八的也都会狠狠占用内存……
—— 来自 Xiaomi 25042PN24C, Android 16, 鹅球 v3.5.99
pf67 发表于 2026-9-28 12:19
详细讲讲?
我64g内存,但是感觉日常加载27b都时常会导致内存吃紧……,一大堆杂七杂八的也都会狠狠占用 ...
换上面那个Strata框架跑3.8 flash next
不过你平时内存占用就高的话就不适合了
llama.cpp像我这样的小白windows下可以用这个,https://github.com/marsempire/LlamaManager,经常换大模型改参数比较方便
最近用ninfer感觉不错,就是差个好的无审查大模型……
啊,iq2真的好用吗
taxiom 发表于 2026-9-28 14:51
啊,iq2真的好用吗
不好用,但是我只有48G内存跑不起IQ3S啊
就当测一下技术了
本帖最后由 zhl1989666 于 2026-9-28 15:17 编辑
qwased 发表于 2026-9-28 12:05
核弹瘫坐,有64G内存的可以把27b扔进垃圾桶了
这么强吗,但我Q4也能跑16token,下个IQ3_S应该还好吧,但这拉模型是从抱脸主网拉的,有什么方法改成镜像,直接改脚本不知道行不行
本帖最后由 taxiom 于 2026-9-28 15:15 编辑
qwased 发表于 2026-9-28 14:57
不好用,但是我只有48G内存跑不起IQ3S啊
就当测一下技术了
我跑了nvfp4的版本176b,对比ds0731 304b差一大截,而27b的q4除了没有1m上下文,某些场景吊打ds0731。所以在我这是3.8fn<ds0731≈27b
zhl1989666 发表于 2026-9-28 15:03
这么强吗,但我Q4也能跑16token,下个IQ3_S应该还好吧
找个在线模型帮你部署吧,50~70tps的输出稳稳的,配合昨天新发布的GSQ IQ3S刚好
就是这个项目自带的安装脚本完全没考虑中文系统和网络问题,用不了,你下好模型文件叫agent读完readme和安装脚本帮你操作
taxiom 发表于 2026-9-28 15:14
我跑了nvfp4的版本176b,对比ds0731 284b差一大截,而27b的q4除了没有1m上下文,某些场景吊打ds0731。所 ...
nvfp4的量化质量太低了,特别是那种w4a4的
你换gsq rco iq3s再试试
绯色日照 发表于 2026-9-20 22:25
非常感谢LZ的分享,我是5090DV2,只有24G显存,按你的经验现在已经部署好并连接到DSH了,感觉日常办公搞数 ...
dsh 发一句你好就已经消耗了14k上下文,我觉得对本地模型开发来说并不友好
—— 来自 Xiaomi 25042PN24C, Android 16, 鹅球 v3.5.99
qwased 发表于 2026-9-28 15:15
nvfp4的量化质量太低了,特别是那种w4a4的
你换gsq rco iq3s再试试
回头试试