kinfox 发表于 2026-9-17 09:42

这几天看qwen flash的测试数据 我更期待qwen4 27b了,毕竟flash就是后续架构的演示版。感觉本地模型越来越有可玩性了,开源社区就是好啊!
等旅游回去我也要尝试折腾下4090加64内存来跑跑这个模型。。。应该能跑吧 这个gguf版的。😂。

小ghoul 发表于 2026-9-17 09:51

kinfox 发表于 2026-9-17 09:42
这几天看qwen flash的测试数据 我更期待qwen4 27b了,毕竟flash就是后续架构的演示版。感觉本地模型越来越 ...

你要是魔改48g理论能跑fp8单并发262k上下文

qwased 发表于 2026-9-17 10:06

kinfox 发表于 2026-9-17 09:42
这几天看qwen flash的测试数据 我更期待qwen4 27b了,毕竟flash就是后续架构的演示版。感觉本地模型越来越 ...

https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
可以完全塞进显存了,我还在拷打肥鱼让他优化cpu指令集,弄完了把配方也发上来

DeepFishing 发表于 2026-9-17 10:24

qwased 发表于 2026-9-17 09:38
只靠PCIE交换数据还是不太行吧

27b稠密都能加速那么多,没道理moe不行

strangeplace 发表于 2026-9-17 10:33

666    Re:Source

自由之紫roy 发表于 2026-9-17 10:41

本地跑了deepseek v4flash0731和glm 5.3flash,都没感觉比27b fp8强太多。期待qwen4 35b

qwased 发表于 2026-9-17 10:45

自由之紫roy 发表于 2026-9-17 10:41
本地跑了deepseek v4flash0731和glm 5.3flash,都没感觉比27b fp8强太多。期待qwen4 35b


这个用云端3.8flash跑的,前端/体素建模这块比27b强非常多,我试试能不能在本地的3.8fn上复现,这两个模型卡有点微妙的区别

qwased 发表于 2026-9-17 10:51

自由之紫roy 发表于 2026-9-17 10:41
本地跑了deepseek v4flash0731和glm 5.3flash,都没感觉比27b fp8强太多。期待qwen4 35b

你可以用这个提示词复现一下看看是啥样子,0731我试下来很不理想,27b能看,glm5.3f很不错,哈基米3.7f上线第一周是最强的堪比gpt5.6sol,后面降智到现在3.8f都不如glm5.3f
【任务】

请创建一个可运行的 3D体素(Voxel)风格自然景观场景:山+瀑布+穿云效果,用 Three.js 实现,浏览器打开即可观看,风格类似Minecraft体素块拼接。

【场景要求】

1.山体:体素构成的山脉,含主峰与若干次峰,山体轮廓有自然的峰谷起伏,坡度过渡自然

2.瀑布:一道或数道瀑布,从山体高处倾泻而下,水流沿山体表面顺势而下,落向山脚

3.穿云:云雾缭绕于山腰,部分山峰穿出云层,山体与云层有前后遮挡关系

4.环境:山脚可点缀植被,整体光影氛围自然(可含晨昏色调)

【技术要求】

Three.js,工作区完整项目,可直接构建运行-画面流畅:体素数量合理,旋转视角帧率稳定(≥30fps)一页面打开即进入场景,无需操作即可看到全貌

【交付要求】

项目结构完整,说明运行方式(安装与启动命令)如已实际运行,请说明运行结果

zhl1989666 发表于 2026-9-17 11:45

qwased 发表于 2026-9-16 23:29
huihui的3.8 27B GSQ IQ3S破甲版或者不需要干坏事就用GSQ原版,破甲会降智
LLAMACPP用主楼那个KV streami ...

包干坏事的,主楼的kv版本的llama.cpp和普通的启动参数没有区别是吗?huihui的模型也需要用jinja吗?是主楼的还是跟模型一起发布的?谢谢!

qwased 发表于 2026-9-17 12:06

zhl1989666 发表于 2026-9-17 11:45
包干坏事的,主楼的kv版本的llama.cpp和普通的启动参数没有区别是吗?huihui的模型也需要用jinja吗?是主 ...

--kv-stream-stage-mib 2304加这个参数可以开262k上下文,如果prefill跑不动就调小一点这个参数,开mtp要缩到1024,不过我感觉这个模型开mtp会变得很智障

t0mcat 发表于 2026-9-17 14:28

张叔夜 发表于 2026-8-27 19:55
问个很基础的问题,单位电脑是9950x3d 128g 5070,想本地部署一个模型,用来写一些涉密项目的技术设计书, ...

同问,我也想本地部署,用来训练写文字材料需要什么样的配置才能行?还有用什么模型?

waterstars 发表于 2026-9-17 15:02

我有一个AMD的ryzen 395,64显存64内存(统一的,可以改成96/32),我去年抱着把他当成AI主力的目的下单的

结果费劲巴拉起来才发现这玩意100多G内存带宽,跑个涩图能给我跑一个半小时,就扔仓库当办公室配重了

看了这贴,我觉得这东西可以拿出来了,也不知道ROCM现在到哪一步了。

waterstars 发表于 2026-9-17 15:02

本帖最后由 waterstars 于 2026-9-17 15:09 编辑

风怒编辑编辑

waterstars 发表于 2026-9-17 15:02

本帖最后由 waterstars 于 2026-9-17 15:09 编辑

风怒编辑编辑

魔法师lain 发表于 2026-9-17 15:25

qwased 发表于 2026-9-3 16:55
https://github.com/RaymondHuang210129/llama.cpp-adaptive-kv-streaming
这个分支的llamacpp好用,拿内 ...

这个没预编译的下载吗?有gpu的win已经没空间了,无法装那堆开发套件了。

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99

qwased 发表于 2026-9-17 16:29

魔法师lain 发表于 2026-9-17 15:25
这个没预编译的下载吗?有gpu的win已经没空间了,无法装那堆开发套件了。

—— 来自 HUAWEI ALT-AL10, A ...

没有,我也是喊大肥鱼给我编译的

mitzvah 发表于 2026-9-17 16:38

waterstars 发表于 2026-9-17 15:02
我有一个AMD的ryzen 395,64显存64内存(统一的,可以改成96/32),我去年抱着把他当成AI主力的目的下单的
...

你这也慢的太离谱了,我这两天跑测试基本上出图半分钟,5秒视频的h3模型配合加速十分钟是可以的

qwased 发表于 2026-9-17 16:39

waterstars 发表于 2026-9-17 15:02
我有一个AMD的ryzen 395,64显存64内存(统一的,可以改成96/32),我去年抱着把他当成AI主力的目的下单的
...

https://huggingface.co/pfeifferj/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main
你试试这个,那个100G的单词表扔ssd上就行

自由之紫roy 发表于 2026-9-17 16:42

qwased 发表于 2026-9-17 10:51
你可以用这个提示词复现一下看看是啥样子,0731我试下来很不理想,27b能看,glm5.3f很不错,哈基米3.7f上 ...

我现在还是部署qwen 3.8 27b fp8,然后开1M上下文,并发4个可以。
另外的gpu可以放其他模型跑视频啥的。目前需要并发tp2来部署的模型性价比都不如27b,还是等等qwen4看看了。

自由之紫roy 发表于 2026-9-17 17:02

qwased 发表于 2026-9-17 16:39
https://huggingface.co/pfeifferj/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main
你试试这个,那个100G的 ...

这个量化版本实际的效果怎么样?我看专家层可以放ram上感觉不错

qwased 发表于 2026-9-17 17:06

自由之紫roy 发表于 2026-9-17 17:02
这个量化版本实际的效果怎么样?我看专家层可以放ram上感觉不错

我感觉有点奇怪,我在rtx5070ti上跑很蠢,朋友在5090上跑就表现挺好的,有点怀疑是不是cpu跑专家会导致精度误差然后降智

自由之紫roy 发表于 2026-9-17 17:16

qwased 发表于 2026-9-17 17:06
我感觉有点奇怪,我在rtx5070ti上跑很蠢,朋友在5090上跑就表现挺好的,有点怀疑是不是cpu跑专家会导致精 ...

这个权重40多G放不进显卡的吧,都放内存和ssd里吗?

qwased 发表于 2026-9-17 17:23

自由之紫roy 发表于 2026-9-17 17:16
这个权重40多G放不进显卡的吧,都放内存和ssd里吗?

权重必须放显存的就8G,KV Q8 128K需要2G,剩下的能放多少专家放多少就行,单词表扔SSD流式加载

mp5 发表于 2026-9-17 17:45

本帖最后由 mp5 于 2026-9-17 17:50 编辑

测试了好几个27b和flash模型跑鹈鹕骑车动画, 结果能稍微像样点也就这两个

DeepFishing 发表于 2026-9-17 17:47

waterstars 发表于 2026-9-17 15:02
我有一个AMD的ryzen 395,64显存64内存(统一的,可以改成96/32),我去年抱着把他当成AI主力的目的下单的
...

跑图性能还行了,之前我测的都不优化工作流,5060ti 14s,395要22s这样,跑视频性能不太行,虽然也能跑,但是还是严重缺乏优化的感觉。
小主机群的玩法是395再挂个外接显卡,llm和画图就都能同时跑了

—— 来自 Xiaomi 24117RK2CC, Android 15上的 S1Next-鹅版 v2.5.4

卡卡西.R 发表于 2026-9-17 20:38

mark,准备在16+8 上试试看 dog

waterstars 发表于 2026-9-18 21:37

qwased 发表于 2026-9-17 16:39
https://huggingface.co/pfeifferj/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main
你试试这个,那个100G的 ...

今天试了,竟然成了,绝了

回头测试一下过来发结果

neptunehs 发表于 2026-9-19 08:11

Ternary Bonsai 2 27B有了 有人试试看吗

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

zhl1989666 发表于 2026-9-19 19:14

本帖最后由 zhl1989666 于 2026-9-19 20:12 编辑

https://github.com/kvmem/kvmem-llama.cpp
又出了个好东西,可能比主楼的这个更强?
LZ有没有兴趣测一测?我只是跑起来了,但具体怎么样不是太明白,另外里面还提到了一个更小的视觉模型,性能相当,缩小到300多M,可以扔进显存了

有用的话希望LZ能把好用的参数发出来,谢谢。我的是这样的

llama-kvmem-server.exe -m "Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf" --mmproj "mmproj-Qwen3.8-27B-Q5_K-MIX.gguf" --mmproj-offload --image-min-tokens 1024 --image-max-tokens 4096 -c 262144 -n 16384 -ngl 99 -b 256 -ctk q8_0 -ctv q8_0 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0--reasoning-budget 4096 --kvmem-budget 36864 --kvmem-gen-reserve 16384 --jinja --chat-template-file chat_template.jinja--enable-thinking --host 127.0.0.1 --port 24548

qwased 发表于 2026-9-19 22:11

neptunehs 发表于 2026-9-19 08:11
Ternary Bonsai 2 27B有了 有人试试看吗

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

27b里面最垃圾的版本,但是当成9b或者35a3b用那就是最强的

neptunehs 发表于 2026-9-19 22:31

本帖最后由 neptunehs 于 2026-9-19 22:36 编辑

qwased 发表于 2026-9-19 22:11
27b里面最垃圾的版本,但是当成9b或者35a3b用那就是最强的

但按我的理解 9b能干的活不多啊 感觉主要是翻译9b多
text encoder只要2b或4b 而编程或跑agent 真满血27b都微妙


—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

qwased 发表于 2026-9-20 02:21

neptunehs 发表于 2026-9-19 22:31
但按我的理解 9b能干的活不多啊 感觉主要是翻译9b多
text encoder只要2b或4b 而编程或跑agent 真满血27b ...

bonsai的编程和推理能力还是很弱,但是他用工具的能力挺好的,应该适合养虾养马

qwased 发表于 2026-9-20 02:29

zhl1989666 发表于 2026-9-19 19:14
https://github.com/kvmem/kvmem-llama.cpp
又出了个好东西,可能比主楼的这个更强?
LZ有没有兴趣测一测? ...

这个分支现在还是不完善,长任务幻觉率比较高,现阶段建议还是kv streaming配合上下文压缩插件使用

waterstars 发表于 2026-9-20 11:09

qwased 发表于 2026-9-17 16:39
https://huggingface.co/pfeifferj/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main
你试试这个,那个100G的 ...



速度大概就是一秒几个字,说是关闭思考61 tok/s但体感远低于这个数,大概有二三十?开思考则是完全不行,会降低到个位数

瓶颈是上下文,且不说256K够不够用,首先大量上下文会使得推理速度暴降,程序写到后面即使关闭思考模式也是个位数了

其他的测试都还是可以的,程序能够正常写,鹈鹕自行车程序前面都没问题,后面实在太慢了还是让deepseek接手了





qwased 发表于 2026-9-20 12:09

本帖最后由 qwased 于 2026-9-20 12:13 编辑

waterstars 发表于 2026-9-20 11:09
速度大概就是一秒几个字,说是关闭思考61 tok/s但体感远低于这个数,大概有二三十?开思考则是完全不行 ...
`llamacpp pr28136-win` @ `21646e9c8` (= master `d1d3c3396` + PR #28136 two commits + Windows direct-read port + Q2_0 x86 VNNI dot product kernel (upstream PR #26348 locally integrated))
https://github.com/ggml-org/llama.cpp/pull/29030
你叫他调查一下这些PR哪些可以用,特别是29030
另外建议显存多开点,开KV unified测一下并发

感觉你这个模型有点笨,用的啥啊,调优完全乱做的

zhl1989666 发表于 2026-9-20 13:38

qwased 发表于 2026-9-20 02:29
这个分支现在还是不完善,长任务幻觉率比较高,现阶段建议还是kv streaming配合上下文压缩插件使用 ...

我现在用DSH,但是主楼里的伪长上下文插件装了后报错,直接启动不了,把错误信息拿去问DS说可能是版本不兼容,反正0.1.5RC1和RC2都报错了,懒得再下个pi了

魔法师lain 发表于 2026-9-20 19:20

试了一下,bonsai,q3xxs,q3s的速度分别是26t/s,16t/s,8t/s,gpu占用不到20%,显卡是魔改a3000 12g,不知道怎样改善

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99

qwased 发表于 2026-9-20 19:36

魔法师lain 发表于 2026-9-20 19:20
试了一下,bonsai,q3xxs,q3s的速度分别是26t/s,16t/s,8t/s,gpu占用不到20%,显卡是魔改a3000 12g,不 ...

爆显存了

魔法师lain 发表于 2026-9-20 22:07

qwased 发表于 2026-9-20 19:36
爆显存了

q3s有通过ngl分给内存,其他两个模型不开mtp等东西的话本来是撑不爆12g显存的啊,特别bonsai

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99

qwased 发表于 2026-9-20 22:16

魔法师lain 发表于 2026-9-20 22:07
q3s有通过ngl分给内存,其他两个模型不开mtp等东西的话本来是撑不爆12g显存的啊,特别bonsai

—— 来自...

windows本身要吃1g,算了这个没
页: 1 2 3 4 [5] 6 7 8 9
查看完整版本: 16G显卡+qwen3.8 27B上下文200K,个人经验总结(更新llamacpp推荐)