找回密码
 立即注册
搜索
楼主: qwased

[科技] 16G显卡+qwen3.8 27B上下文200K,个人经验总结(65楼更新编程能力跑分对比)

[复制链接]
     
发表于 2026-9-17 09:42 来自手机 | 显示全部楼层
这几天看qwen flash的测试数据 我更期待qwen4 27b了,毕竟flash就是后续架构的演示版。感觉本地模型越来越有可玩性了,开源社区就是好啊!
等旅游回去我也要尝试折腾下4090加64内存来跑跑这个模型。。。应该能跑吧 这个gguf版的。😂。
回复

使用道具 举报

     
发表于 2026-9-17 09:51 | 显示全部楼层
kinfox 发表于 2026-9-17 09:42
这几天看qwen flash的测试数据 我更期待qwen4 27b了,毕竟flash就是后续架构的演示版。感觉本地模型越来越 ...

你要是魔改48g理论能跑fp8单并发262k上下文
回复

使用道具 举报

     
 楼主| 发表于 2026-9-17 10:06 | 显示全部楼层
kinfox 发表于 2026-9-17 09:42
这几天看qwen flash的测试数据 我更期待qwen4 27b了,毕竟flash就是后续架构的演示版。感觉本地模型越来越 ...

https://huggingface.co/ISTA-DASL ... h-Next-GSQ-RCO-GGUF
可以完全塞进显存了,我还在拷打肥鱼让他优化cpu指令集,弄完了把配方也发上来
回复

使用道具 举报

     
发表于 2026-9-17 10:24 | 显示全部楼层
qwased 发表于 2026-9-17 09:38
只靠PCIE交换数据还是不太行吧

27b稠密都能加速那么多,没道理moe不行
回复

使用道具 举报

发表于 2026-9-17 10:33 | 显示全部楼层
666    Re:Source
回复

使用道具 举报

发表于 2026-9-17 10:41 | 显示全部楼层
本地跑了deepseek v4flash0731和glm 5.3flash,都没感觉比27b fp8强太多。期待qwen4 35b
回复

使用道具 举报

     
 楼主| 发表于 2026-9-17 10:45 | 显示全部楼层
自由之紫roy 发表于 2026-9-17 10:41
本地跑了deepseek v4flash0731和glm 5.3flash,都没感觉比27b fp8强太多。期待qwen4 35b


这个用云端3.8flash跑的,前端/体素建模这块比27b强非常多,我试试能不能在本地的3.8fn上复现,这两个模型卡有点微妙的区别

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
 楼主| 发表于 2026-9-17 10:51 来自手机 | 显示全部楼层
自由之紫roy 发表于 2026-9-17 10:41
本地跑了deepseek v4flash0731和glm 5.3flash,都没感觉比27b fp8强太多。期待qwen4 35b

你可以用这个提示词复现一下看看是啥样子,0731我试下来很不理想,27b能看,glm5.3f很不错,哈基米3.7f上线第一周是最强的堪比gpt5.6sol,后面降智到现在3.8f都不如glm5.3f
【任务】

请创建一个可运行的 3D体素(Voxel)风格自然景观场景:山+瀑布+穿云效果,用 Three.js 实现,浏览器打开即可观看,风格类似Minecraft体素块拼接。

【场景要求】

1.山体:体素构成的山脉,含主峰与若干次峰,山体轮廓有自然的峰谷起伏,坡度过渡自然

2.瀑布:一道或数道瀑布,从山体高处倾泻而下,水流沿山体表面顺势而下,落向山脚

3.穿云:云雾缭绕于山腰,部分山峰穿出云层,山体与云层有前后遮挡关系

4.环境:山脚可点缀植被,整体光影氛围自然(可含晨昏色调)

【技术要求】

Three.js,工作区完整项目,可直接构建运行-画面流畅:体素数量合理,旋转视角帧率稳定(≥30fps)一页面打开即进入场景,无需操作即可看到全貌

【交付要求】

项目结构完整,说明运行方式(安装与启动命令)如已实际运行,请说明运行结果
回复

使用道具 举报

     
发表于 2026-9-17 11:45 来自手机 | 显示全部楼层
qwased 发表于 2026-9-16 23:29
huihui的3.8 27B GSQ IQ3S破甲版或者不需要干坏事就用GSQ原版,破甲会降智
LLAMACPP用主楼那个KV streami ...

包干坏事的,主楼的kv版本的llama.cpp和普通的启动参数没有区别是吗?huihui的模型也需要用jinja吗?是主楼的还是跟模型一起发布的?谢谢!
回复

使用道具 举报

     
 楼主| 发表于 2026-9-17 12:06 | 显示全部楼层
zhl1989666 发表于 2026-9-17 11:45
包干坏事的,主楼的kv版本的llama.cpp和普通的启动参数没有区别是吗?huihui的模型也需要用jinja吗?是主 ...

--kv-stream-stage-mib 2304  加这个参数可以开262k上下文,如果prefill跑不动就调小一点这个参数,开mtp要缩到1024,不过我感觉这个模型开mtp会变得很智障
回复

使用道具 举报

     
发表于 2026-9-17 14:28 | 显示全部楼层
张叔夜 发表于 2026-8-27 19:55
问个很基础的问题,单位电脑是9950x3d 128g 5070,想本地部署一个模型,用来写一些涉密项目的技术设计书, ...

同问,我也想本地部署,用来训练写文字材料需要什么样的配置才能行?还有用什么模型?
回复

使用道具 举报

     
发表于 2026-9-17 15:02 | 显示全部楼层
我有一个AMD的ryzen 395,64显存64内存(统一的,可以改成96/32),我去年抱着把他当成AI主力的目的下单的

结果费劲巴拉起来才发现这玩意100多G内存带宽,跑个涩图能给我跑一个半小时,就扔仓库当办公室配重了

看了这贴,我觉得这东西可以拿出来了,也不知道ROCM现在到哪一步了。
回复

使用道具 举报

     
发表于 2026-9-17 15:02 | 显示全部楼层
本帖最后由 waterstars 于 2026-9-17 15:09 编辑

风怒编辑编辑
回复

使用道具 举报

     
发表于 2026-9-17 15:02 | 显示全部楼层
本帖最后由 waterstars 于 2026-9-17 15:09 编辑

风怒编辑编辑
回复

使用道具 举报

发表于 2026-9-17 15:25 来自手机 | 显示全部楼层
qwased 发表于 2026-9-3 16:55
https://github.com/RaymondHuang210129/llama.cpp-adaptive-kv-streaming  
这个分支的llamacpp好用,拿内 ...

这个没预编译的下载吗?有gpu的win已经没空间了,无法装那堆开发套件了。

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99
回复

使用道具 举报

     
 楼主| 发表于 2026-9-17 16:29 | 显示全部楼层
魔法师lain 发表于 2026-9-17 15:25
这个没预编译的下载吗?有gpu的win已经没空间了,无法装那堆开发套件了。

—— 来自 HUAWEI ALT-AL10, A ...

没有,我也是喊大肥鱼给我编译的
回复

使用道具 举报

发表于 2026-9-17 16:38 | 显示全部楼层
waterstars 发表于 2026-9-17 15:02
我有一个AMD的ryzen 395,64显存64内存(统一的,可以改成96/32),我去年抱着把他当成AI主力的目的下单的
...

你这也慢的太离谱了,我这两天跑测试基本上出图半分钟,5秒视频的h3模型配合加速十分钟是可以的
回复

使用道具 举报

     
 楼主| 发表于 2026-9-17 16:39 | 显示全部楼层
waterstars 发表于 2026-9-17 15:02
我有一个AMD的ryzen 395,64显存64内存(统一的,可以改成96/32),我去年抱着把他当成AI主力的目的下单的
...

https://huggingface.co/pfeifferj ... -RCO-GGUF/tree/main
你试试这个,那个100G的单词表扔ssd上就行
回复

使用道具 举报

发表于 2026-9-17 16:42 | 显示全部楼层
qwased 发表于 2026-9-17 10:51
你可以用这个提示词复现一下看看是啥样子,0731我试下来很不理想,27b能看,glm5.3f很不错,哈基米3.7f上 ...

我现在还是部署qwen 3.8 27b fp8,然后开1M上下文,并发4个可以。
另外的gpu可以放其他模型跑视频啥的。目前需要并发tp2来部署的模型性价比都不如27b,还是等等qwen4看看了。
回复

使用道具 举报

发表于 2026-9-17 17:02 | 显示全部楼层
qwased 发表于 2026-9-17 16:39
https://huggingface.co/pfeifferj/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main
你试试这个,那个100G的 ...

这个量化版本实际的效果怎么样?我看专家层可以放ram上感觉不错
回复

使用道具 举报

     
 楼主| 发表于 2026-9-17 17:06 来自手机 | 显示全部楼层
自由之紫roy 发表于 2026-9-17 17:02
这个量化版本实际的效果怎么样?我看专家层可以放ram上感觉不错

我感觉有点奇怪,我在rtx5070ti上跑很蠢,朋友在5090上跑就表现挺好的,有点怀疑是不是cpu跑专家会导致精度误差然后降智
回复

使用道具 举报

发表于 2026-9-17 17:16 | 显示全部楼层
qwased 发表于 2026-9-17 17:06
我感觉有点奇怪,我在rtx5070ti上跑很蠢,朋友在5090上跑就表现挺好的,有点怀疑是不是cpu跑专家会导致精 ...

这个权重40多G放不进显卡的吧,都放内存和ssd里吗?
回复

使用道具 举报

     
 楼主| 发表于 2026-9-17 17:23 | 显示全部楼层
自由之紫roy 发表于 2026-9-17 17:16
这个权重40多G放不进显卡的吧,都放内存和ssd里吗?

权重必须放显存的就8G,KV Q8 128K需要2G,剩下的能放多少专家放多少就行,单词表扔SSD流式加载
回复

使用道具 举报

     
发表于 2026-9-17 17:45 | 显示全部楼层
本帖最后由 mp5 于 2026-9-17 17:50 编辑

测试了好几个27b和flash模型跑鹈鹕骑车动画, 结果能稍微像样点也就这两个

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-9-17 17:47 来自手机 | 显示全部楼层
waterstars 发表于 2026-9-17 15:02
我有一个AMD的ryzen 395,64显存64内存(统一的,可以改成96/32),我去年抱着把他当成AI主力的目的下单的
...

跑图性能还行了,之前我测的都不优化工作流,5060ti 14s,395要22s这样,跑视频性能不太行,虽然也能跑,但是还是严重缺乏优化的感觉。
小主机群的玩法是395再挂个外接显卡,llm和画图就都能同时跑了

—— 来自 Xiaomi 24117RK2CC, Android 15上的 S1Next-鹅版 v2.5.4
回复

使用道具 举报

     
发表于 2026-9-17 20:38 | 显示全部楼层
mark,准备在16+8 上试试看 dog
回复

使用道具 举报

     
发表于 2026-9-18 21:37 | 显示全部楼层
qwased 发表于 2026-9-17 16:39
https://huggingface.co/pfeifferj/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main
你试试这个,那个100G的 ...

今天试了,竟然成了,绝了

回头测试一下过来发结果
回复

使用道具 举报

     
发表于 2026-9-19 08:11 来自手机 | 显示全部楼层
Ternary Bonsai 2 27B有了 有人试试看吗

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-9-19 19:14 | 显示全部楼层
本帖最后由 zhl1989666 于 2026-9-19 20:12 编辑

https://github.com/kvmem/kvmem-llama.cpp
又出了个好东西,可能比主楼的这个更强?
LZ有没有兴趣测一测?我只是跑起来了,但具体怎么样不是太明白,另外里面还提到了一个更小的视觉模型,性能相当,缩小到300多M,可以扔进显存了

有用的话希望LZ能把好用的参数发出来,谢谢。我的是这样的

llama-kvmem-server.exe -m "Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf" --mmproj "mmproj-Qwen3.8-27B-Q5_K-MIX.gguf" --mmproj-offload --image-min-tokens 1024 --image-max-tokens 4096 -c 262144 -n 16384 -ngl 99 -b 256 -ctk q8_0 -ctv q8_0 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0  --reasoning-budget 4096 --kvmem-budget 36864 --kvmem-gen-reserve 16384 --jinja --chat-template-file chat_template.jinja  --enable-thinking --host 127.0.0.1 --port 24548
回复

使用道具 举报

     
 楼主| 发表于 2026-9-19 22:11 来自手机 | 显示全部楼层
neptunehs 发表于 2026-9-19 08:11
Ternary Bonsai 2 27B有了 有人试试看吗

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

27b里面最垃圾的版本,但是当成9b或者35a3b用那就是最强的
回复

使用道具 举报

     
发表于 2026-9-19 22:31 来自手机 | 显示全部楼层
本帖最后由 neptunehs 于 2026-9-19 22:36 编辑
qwased 发表于 2026-9-19 22:11
27b里面最垃圾的版本,但是当成9b或者35a3b用那就是最强的

但按我的理解 9b能干的活不多啊 感觉主要是翻译9b多
text encoder只要2b或4b 而编程或跑agent 真满血27b都微妙


—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
 楼主| 发表于 2026-9-20 02:21 来自手机 | 显示全部楼层
neptunehs 发表于 2026-9-19 22:31
但按我的理解 9b能干的活不多啊 感觉主要是翻译9b多
text encoder只要2b或4b 而编程或跑agent 真满血27b ...

bonsai的编程和推理能力还是很弱,但是他用工具的能力挺好的,应该适合养虾养马
回复

使用道具 举报

     
 楼主| 发表于 2026-9-20 02:29 来自手机 | 显示全部楼层
zhl1989666 发表于 2026-9-19 19:14
https://github.com/kvmem/kvmem-llama.cpp
又出了个好东西,可能比主楼的这个更强?
LZ有没有兴趣测一测? ...

这个分支现在还是不完善,长任务幻觉率比较高,现阶段建议还是kv streaming配合上下文压缩插件使用
回复

使用道具 举报

     
发表于 2026-9-20 11:09 | 显示全部楼层
qwased 发表于 2026-9-17 16:39
https://huggingface.co/pfeifferj/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main
你试试这个,那个100G的 ...



速度大概就是一秒几个字,说是关闭思考61 tok/s但体感远低于这个数,大概有二三十?开思考则是完全不行,会降低到个位数

瓶颈是上下文,且不说256K够不够用,首先大量上下文会使得推理速度暴降,程序写到后面即使关闭思考模式也是个位数了

其他的测试都还是可以的,程序能够正常写,鹈鹕自行车程序前面都没问题,后面实在太慢了还是让deepseek接手了





本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
 楼主| 发表于 2026-9-20 12:09 | 显示全部楼层
本帖最后由 qwased 于 2026-9-20 12:13 编辑
waterstars 发表于 2026-9-20 11:09
速度大概就是一秒几个字,说是关闭思考61 tok/s但体感远低于这个数,大概有二三十?开思考则是完全不行 ...

`llamacpp pr28136-win` @ `21646e9c8` (= master `d1d3c3396` + PR #28136 two commits + Windows direct-read port + Q2_0 x86 VNNI dot product kernel (upstream PR #26348 locally integrated))
https://github.com/ggml-org/llama.cpp/pull/29030
你叫他调查一下这些PR哪些可以用,特别是29030
另外建议显存多开点,开KV unified测一下并发

感觉你这个模型有点笨,用的啥啊,调优完全乱做的
回复

使用道具 举报

     
发表于 2026-9-20 13:38 | 显示全部楼层
qwased 发表于 2026-9-20 02:29
这个分支现在还是不完善,长任务幻觉率比较高,现阶段建议还是kv streaming配合上下文压缩插件使用 ...

我现在用DSH,但是主楼里的伪长上下文插件装了后报错,直接启动不了,把错误信息拿去问DS说可能是版本不兼容,反正0.1.5RC1和RC2都报错了,懒得再下个pi了
回复

使用道具 举报

发表于 2026-9-20 19:20 来自手机 | 显示全部楼层
试了一下,bonsai,q3xxs,q3s的速度分别是26t/s,16t/s,8t/s,gpu占用不到20%,显卡是魔改a3000 12g,不知道怎样改善

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99
回复

使用道具 举报

     
 楼主| 发表于 2026-9-20 19:36 来自手机 | 显示全部楼层
魔法师lain 发表于 2026-9-20 19:20
试了一下,bonsai,q3xxs,q3s的速度分别是26t/s,16t/s,8t/s,gpu占用不到20%,显卡是魔改a3000 12g,不 ...

爆显存了
回复

使用道具 举报

发表于 2026-9-20 22:07 来自手机 | 显示全部楼层

q3s有通过ngl分给内存,其他两个模型不开mtp等东西的话本来是撑不爆12g显存的啊,特别bonsai

—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99
回复

使用道具 举报

     
 楼主| 发表于 2026-9-20 22:16 | 显示全部楼层
魔法师lain 发表于 2026-9-20 22:07
q3s有通过ngl分给内存,其他两个模型不开mtp等东西的话本来是撑不爆12g显存的啊,特别bonsai

—— 来自  ...

windows本身要吃1g,算了这个没
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-9-21 15:27 , Processed in 0.150961 second(s), 6 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表