mp5 发表于 2026-9-2 15:02

qwased 发表于 2026-8-31 21:16
内存足够大的话可以考虑上qwen3.8 next了,64G+12G可以保持15tk/s跑200K上下文+Q4量化你跑27b要么智力极 ...

你确认可以吗?刚刚看了一下unsloth的Qwen3.8-Flash-Next-GGUF, UD-Q4_K_XL已经去到120多G了, 64G+12G根本不可能装下

mp5 发表于 2026-9-2 15:03

魔法师lain 发表于 2026-9-1 22:28
拿来跑翻译不太行吗

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99

翻译要么mt2要么gemma4

qwased 发表于 2026-9-2 18:50

mp5 发表于 2026-9-2 15:02
你确认可以吗?刚刚看了一下unsloth的Qwen3.8-Flash-Next-GGUF, UD-Q4_K_XL已经去到120多G了, 64G+12G根本 ...

atomicchat的q4量化,llamacpp自己编译最新的

llama-server -m“你的模型路径”--mmproj“你的视 觉模块路径"--port 8080 --temp 1--top-p 0.95 --top-k 20--min-p 0.0--repeat-penalty 1.0 --presence-penalty 0.0--ctx-size 192000-ng199 --n-cpu-moe 48--no-mmproj-offload --load-mode mmap--cache-type-v q8_0 --cache-type-k q8_0 --ubatch-size 1024

kinfox 发表于 2026-9-2 21:07

今晚特意测试了下,这个Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp意外的相当能打,,,把我几个q4模型都打下去了。
甚至让它做体素建模直出效果也是最好的那个
而且它显存还是占的最少的那个。。意外啊
看来可以好好玩玩了。

qwased 发表于 2026-9-2 21:18

kinfox 发表于 2026-9-2 21:07
今晚特意测试了下,这个Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp意外的相当能打,,,把我几个q4模型都打下去了。
甚 ...
这个团队说编程能力追平满血版本感觉真不是吹牛,确实非常接近了
只是xxs那个版本连中文都理解不了有点搞让gemini看他们的arxiv论文说原因可能是他们用来校准的语料以英文为主

kinfox 发表于 2026-9-2 21:20

qwased 发表于 2026-9-2 21:18
这个团队说编程能力追平满血版本感觉真不是吹牛,确实非常接近了
只是xxs那个版本连中文都理解不了有点搞 ...

哈哈对,我昨天有玩过那个xxs版本,输出的结果惨不忍睹。。今天这个就完全不同了。

zhl1989666 发表于 2026-9-2 22:21

4070tis按照LZ的配置,用Qwen3.8-27B-GSQ-RCO-IQ3_S不用MTP,没有设TURBO_AUTO_ASYMMETRIC=0,150K上下文,占用15.6G显存算正常吗?第一次用这个配置

llama-server.exe -m "Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf" --mmproj "mmproj-Qwen3.8-27B-BF16.gguf" --no-mmproj-offload --image-min-tokens 1024 --image-max-tokens 4096 -c 150000 -ngl 99 -ctk turbo4 -ctv turbo4 -fa on --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --kv-unified --no-host --cache-ram 0 -np 1 -b 512 -ub 512 --reasoning-preserve --jinja --chat-template-file chat_template.jinja --reasoning-format deepseek --host 127.0.0.1 --port 24548




qwased 发表于 2026-9-2 22:31

zhl1989666 发表于 2026-9-2 22:21
4070tis按照LZ的配置,用Qwen3.8-27B-GSQ-RCO-IQ3_S不用MTP,没有设TURBO_AUTO_ASYMMETRIC=0,150K上下文, ...

不加TURBO_AUTO_ASYMMETRIC=0,kv量化会自动回落q8,显存占用翻倍

mp5 发表于 2026-9-2 22:54

qwased 发表于 2026-9-2 18:50
atomicchat的q4量化,llamacpp自己编译最新的

llama-server -m“你的模型路径”--mmproj“你的视 觉模块 ...

谢啦,我明天再试试    Re:Source

zhl1989666 发表于 2026-9-2 22:54

qwased 发表于 2026-9-2 22:31
不加TURBO_AUTO_ASYMMETRIC=0,kv量化会自动回落q8,显存占用翻倍

因为我看那个选项是写在第二个已经不推荐的模型那里了所以就注释掉了。不过我现在重新加了这个设置启动后还是一样占了15.5G,也就是这个影响的是实际开始使用时候的占用吗?

qwased 发表于 2026-9-2 23:10

zhl1989666 发表于 2026-9-2 22:54
因为我看那个选项是写在第二个已经不推荐的模型那里了所以就注释掉了。不过我现在重新加了这个设置启动后 ...

往里面扔点文档叫他总结,如果长一点也没崩溃那就是显存占用没到临界点,上下文还能再多开点
但是不开mtp真的好慢开了mtp就只有最多100K了

qwased 发表于 2026-9-2 23:14

mp5 发表于 2026-9-2 22:54
谢啦,我明天再试试    Re:Source

我差10G内存跑不了,很烦

目灼灼似贼 发表于 2026-9-2 23:29

24G显存,128G内存,能跑的最好的模型是哪个?

qwased 发表于 2026-9-2 23:44

目灼灼似贼 发表于 2026-9-2 23:29
24G显存,128G内存,能跑的最好的模型是哪个?

qwen 3.8 next

qwased 发表于 2026-9-3 02:02

这个gsq模型的mtp好像会导致偶发流口水,好几次出现刚刚做完的事情突然就忘记了又做一遍,换成无mtp版本目前还没看到这种现象

qwased 发表于 2026-9-3 07:27

对比了一下基元律动那个应该是NVFP4?或者至少Q5/Q6以上的27b,GSQ做的demo比基元的强……这模型实力高的出奇

大暴死 发表于 2026-9-3 08:05

本帖最后由 大暴死 于 2026-9-3 08:22 编辑

qwased 发表于 2026-9-1 05:35
Qwen3.8-27B-GSQ-RCO-IQ3_XXS这个模型好像有点东西但是表现很奇怪,作者宣称编程能力对标满血bf16的,但 ...

ISTA的IQ3-S模型昨天我也跑了zx-bench,综合分78.33,通过率83%
不过我没配置AI Judge模型所以生成不了AI报告,大佬AI Judge用的哪个,我应该也就deepseek V4f能用
生成的json丢给gemini 3.7flash,让他进行综合评判。最后总结给的评价确实挺高的:
综合评定与工程结论综合评级:A+(工业级工程可用基准)技术定性:在不借助 AI Judge 人工干预、纯靠自动化测试与代码规则提取(code_repair@3.2.0)的严苛条件下,能够在 195 道覆盖 8 门编程语言的综合题库中拿下 78.33 分、82% 通过率,这一成绩在目前 30B 级别的 3-bit 量化模型中处于顶尖水平;特别是在并发控制、内存屏障、现代 C++ 移动语义与智能指针治理方面,该模型展现出了远超常规小模型的系统级架构理解力;此测试进一步证实:ISTA-DASLab 的 GSQ-RCO 量化配方不仅在推理和博弈论上有惊人表现,其底层的 AST 代码结构表达与编译期类型约束理解,确实完全守住了 Q5~Q6 级别的实战精度。将其作为本地长期驻留的“研发主力大脑”是完全合格且令人放心的。


—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-9-3 08:22

大暴死 发表于 2026-9-3 08:05
ISTA的IQ3-S模型昨天我也跑了zx-bench,综合分78.33,通过率83%
不过我没配置AI Judge模型所以生成不了A ...

就DS呗,然后我让DS生成报告的时候DS说他检查了测试结果认为有好几个测试设计有问题,刚需联网又不检测docker到底能不能联网,我这有10题是无论如何也不可能通过的

qwased 发表于 2026-9-3 16:55

https://github.com/RaymondHuang210129/llama.cpp-adaptive-kv-streaming
这个分支的llamacpp好用,拿内存当显存用也不会导致剧烈降速,只会随着上下文增加慢慢降

大暴死 发表于 2026-9-13 17:52

qwased 发表于 2026-9-3 16:55
https://github.com/RaymondHuang210129/llama.cpp-adaptive-kv-streaming
这个分支的llamacpp好用,拿内 ...

用这个分支,ISTA Daslab量化的iq3-s模型如果开256k上下文,mtp还建议开吗

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-9-13 17:55

大暴死 发表于 2026-9-13 17:52
用这个分支,ISTA Daslab量化的iq3-s模型如果开256k上下文,mtp还建议开吗

—— 来自 Xiaomi 25019PNF3C ...

不开,这个分支感觉对mtp处理有点问题
而且这种量化模型感觉开了mtp之后产物质量下降很严重,不开的时候画3次鹈鹕可以出2次无bug的页面,开了就次次都轮子乱飞

大暴死 发表于 2026-9-13 18:12

qwased 发表于 2026-9-13 17:55
不开,这个分支感觉对mtp处理有点问题
而且这种量化模型感觉开了mtp之后产物质量下降很严重,不开的时候 ...

好滴感谢,昨天我ISTA的模型kv q4 160k上下文关mtp测鹈鹕,直出鹈鹕脚不在踏板而且完全不动。消耗了80%上下文反复修改后才做了个能看的版本,红温了所以想试试kv q8的成色

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99

neptunehs 发表于 2026-9-13 18:14

借贴问下 中译中的最好办法是啥?hy2mt qwen3.6 还是拉一个免费的大模型?
我以前做的mod文字太差 想ai重写

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

qwased 发表于 2026-9-13 18:20

大暴死 发表于 2026-9-13 18:12
好滴感谢,昨天我ISTA的模型kv q4 160k上下文关mtp测鹈鹕,直出鹈鹕脚不在踏板而且完全不动。消耗了80% ...

Q8上下文太小的话我测试下来Q5_1也挺不错的,质量和Q8很接近同时上下文能多很多

用这个分支的llamacpp表现就是降速点延后不少

airshit 发表于 2026-9-13 18:22

M5ultra 256g和两台dgx spark ,哪个比较好啊,有没有谭友研究过的

—— 来自 HUAWEI HOP-AL10, Android 16, 鹅球 v4.0

qwased 发表于 2026-9-13 18:23

neptunehs 发表于 2026-9-13 18:14
借贴问下 中译中的最好办法是啥?hy2mt qwen3.6 还是拉一个免费的大模型?
我以前做的mod文字太差 想ai重写 ...

现在AI写的文字都一股味,感觉没啥必要

qwased 发表于 2026-9-13 18:25

airshit 发表于 2026-9-13 18:22
M5ultra 256g和两台dgx spark ,哪个比较好啊,有没有谭友研究过的

—— 来自 HUAWEI HOP-AL10, Android 1 ...

前者吧,单机跑DSV4F 0731或者QWEN3.8 FLASH NEXT都很好

qwased 发表于 2026-9-16 08:56

QWEN3.8 FLASH NEXT GSQ量化在48G D4+5070TI上跑通,120K Q8 上下文全程稳定prefill 270+decode 15,家用机跑前沿性能大模型还是太炸裂了

大暴死 发表于 2026-9-16 16:16

qwased 发表于 2026-9-16 08:56
QWEN3.8 FLASH NEXT GSQ量化在48G D4+5070TI上跑通,120K Q8 上下文全程稳定prefill 270+decode 15,家用机 ...

妈耶,我是64g ddr4...实测质量如何

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99

DeepFishing 发表于 2026-9-16 16:32


双9700跑fp8的吞吐,整机也能跑flash,不过感觉优化不咋样

DeepFishing 发表于 2026-9-16 17:33

qwased 发表于 2026-9-16 08:56
QWEN3.8 FLASH NEXT GSQ量化在48G D4+5070TI上跑通,120K Q8 上下文全程稳定prefill 270+decode 15,家用机 ...



395用私有优化框架能有这个速度

qwased 发表于 2026-9-16 21:53

DeepFishing 发表于 2026-9-16 17:33
395用私有优化框架能有这个速度
找朋友试了下D5+3090能跑800填充+25解码,还不错
感觉可能两张2080ti 22g把他全塞进显存里面会非常快

zhl1989666 发表于 2026-9-16 22:46

请教一下,64G内存+4070tis最好(一般快+质量高)怎么配模型?用什么组件?能详细说说吗?或者给个关键字我问下AI

目前就用首页的Q3的uncensored版

qwased 发表于 2026-9-16 23:29

zhl1989666 发表于 2026-9-16 22:46
请教一下,64G内存+4070tis最好(一般快+质量高)怎么配模型?用什么组件?能详细说说吗?或者给个关键字我 ...

huihui的3.8 27B GSQ IQ3S破甲版或者不需要干坏事就用GSQ原版,破甲会降智
LLAMACPP用主楼那个KV streaming的,KV量化Q8,上下文长度随便填不够了他会放内存,不怎么降速
这个组合差不多可以prefill 1600 decode 40~50(无mtp)/ prefill 800 decode 80(mtp3)
不嫌慢可以折腾一下新出的qwen3.8 flash next的GSQ,我调好了发配方,慢是真慢不过感觉质量和云端也非常像了

无尽的牙刷 发表于 2026-9-17 00:04

neptunehs 发表于 2026-9-13 18:14
借贴问下 中译中的最好办法是啥?hy2mt qwen3.6 还是拉一个免费的大模型?
我以前做的mod文字太差 想ai重写 ...

试试gemini 3.8 flash吧

DeepFishing 发表于 2026-9-17 00:39

qwased 发表于 2026-9-16 21:53
找朋友试了下D5+3090能跑800填充+25解码,还不错
感觉可能两张2080ti 22g把他全塞进显存里面会非常快 ...

两张9700加起来64G显存只能塞iq3xxs,速度也一般,也不知道是不是农企就没优化,再纠结要不要再插一张卡

—— 来自 Xiaomi 24117RK2CC, Android 15上的 S1Next-鹅版 v2.5.4

qwased 发表于 2026-9-17 00:48

DeepFishing 发表于 2026-9-17 00:39
两张9700加起来64G显存只能塞iq3xxs,速度也一般,也不知道是不是农企就没优化,再纠结要不要再插一张卡
...

prefill 800~1200 decode 50 到这个速度就可用了

qwased 发表于 2026-9-17 02:57

本帖最后由 qwased 于 2026-9-17 02:58 编辑

大暴死 发表于 2026-9-16 16:16
妈耶,我是64g ddr4...实测质量如何

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99 ...

大肥鱼又优化了两个小时,iq3xxs可以prefill 400 decode 16了
等他跑完小参组合刚好天亮,到时候再测鹈鹕,目测应该不会和云端有太大区别

DeepFishing 发表于 2026-9-17 09:14

qwased 发表于 2026-9-17 00:48
prefill 800~1200 decode 50 到这个速度就可用了

优化好肯定不止这么点速度,要求太低了,不知道能不能后面优化的用4卡跑vllm mxfp4这样,来个大几千的吞吐

qwased 发表于 2026-9-17 09:38

DeepFishing 发表于 2026-9-17 09:14
优化好肯定不止这么点速度,要求太低了,不知道能不能后面优化的用4卡跑vllm mxfp4这样,来个大几千的吞 ...

只靠PCIE交换数据还是不太行吧
页: 1 2 3 [4] 5 6 7 8 9
查看完整版本: 16G显卡+qwen3.8 27B上下文200K,个人经验总结(更新llamacpp推荐)