找回密码
 立即注册
搜索
楼主: qwased

[科技] 16G显卡+qwen3.8 27B上下文200K,个人经验总结(更新llamacpp推荐)

[复制链接]
发表于 2026-10-4 22:34 | 显示全部楼层
qwased 发表于 2026-10-4 20:52
strata支持并发了,这下真的核弹瘫坐了

我日啊,马上试试看
回复

使用道具 举报

     
发表于 2026-10-4 22:38 来自手机 | 显示全部楼层
本帖最后由 noneoneone 于 2026-10-4 22:40 编辑
qwased 发表于 10-04 22:27
是指驱动重置吗
黑屏,驱动报找不到GPU,必须重启电脑才能恢复。
nvidia-smi: Unable to determine the device handle for GPU0: 0000:08:00.0:
GPU is lost. Reboot the system to recover this GPU
No devices were found

影响工作倒还是次要的,我担心老是这样会把GPU整出点什么毛病

——来自 2410DPN6CC 上的 S1er 客户端
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 22:51 来自手机 | 显示全部楼层
noneoneone 发表于 2026-10-4 22:38
黑屏,驱动报找不到GPU,必须重启电脑才能恢复。
nvidia-smi: Unable to determine the device handle for ...

你让大肥鱼看看日志是哪里出问题了吧,strata对显卡的压力非常小的,按道理不应该这样
你看看系统日志里面是不是有whea,可能你的pcie跑不稳,流量一大就炸
回复

使用道具 举报

     
发表于 2026-10-4 22:52 | 显示全部楼层
qwased 发表于 2026-10-4 20:52
strata支持并发了,这下真的核弹瘫坐了

刚刚去搞了 ,感觉很爽
然后ninfer也优化到300多的速度,感觉已经完全可以躺平等qwen4了
开源社区就是好啊!!!!
回复

使用道具 举报

     
发表于 2026-10-4 22:58 来自手机 | 显示全部楼层
qwased 发表于 10-04 22:51
你让大肥鱼看看日志是哪里出问题了吧,strata对显卡的压力非常小的,按道理不应该这样
你看看系统日志里面是不是有whea,可能你的pcie跑不稳,流量一大就炸


现在跑的不是strata,是ninfer。我在让DS帮我分析。现在网页版有哪个ai能力比较强的

——来自 2410DPN6CC 上的 S1er 客户端
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 23:26 | 显示全部楼层
noneoneone 发表于 2026-10-4 22:58
现在跑的不是strata,是ninfer。我在让DS帮我分析。现在网页版有哪个ai能力比较强的

——来自 2410DPN6 ...

那你需要下个最新的hwinfo,看看是不是跑的时候GPU热点温度过105了,50系热点105以上会黑屏保护
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 23:28 | 显示全部楼层
kinfox 发表于 2026-10-4 22:52
刚刚去搞了 ,感觉很爽
然后ninfer也优化到300多的速度,感觉已经完全可以躺平等qwen4了
开源社区就是好 ...

300多咋整的,并发吗
回复

使用道具 举报

发表于 2026-10-4 23:36 | 显示全部楼层
我开到2并发256k了。应该没有任何问题了。
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 23:40 | 显示全部楼层
自由之紫roy 发表于 2026-10-4 23:36
我开到2并发256k了。应该没有任何问题了。

MOE并发开的越多越赚,dgx spark那种破烂都敢开64并发的可以多开点做sub agent提速
回复

使用道具 举报

     
发表于 2026-10-4 23:41 来自手机 | 显示全部楼层
自由之紫roy 发表于 2026-10-4 23:36
我开到2并发256k了。应该没有任何问题了。

卧槽,大佬电脑配置是啥?
回复

使用道具 举报

发表于 2026-10-4 23:56 | 显示全部楼层
本帖最后由 自由之紫roy 于 2026-10-5 00:21 编辑
qwased 发表于 2026-10-4 23:40
MOE并发开的越多越赚,dgx spark那种破烂都敢开64并发的可以多开点做sub agent提速 ...

我让agent帮我设了6并发了,如果只用单路,速度大概只下降10%,多路一起用,总吞吐估计翻倍。

-------------
我测试了一下,单卡并发,总吞吐没有获益。。。只是不要排队了。。。
回复

使用道具 举报

发表于 2026-10-4 23:56 | 显示全部楼层
lzchen 发表于 2026-10-4 23:41
卧槽,大佬电脑配置是啥?

pro5000 72G*2 256G DDR6000 我用的是q4,不过用单卡就可以了,以前要双卡才可以q4,现在空出的卡可以跑视频了。
回复

使用道具 举报

发表于 2026-10-5 00:42 | 显示全部楼层
不过社区后期还会更新补丁,会提高总的吞吐能力。现在四路并发跑任务中,美滋滋地去睡觉了
回复

使用道具 举报

     
发表于 2026-10-5 07:35 来自手机 | 显示全部楼层
大肥鱼太弱智了,没有advisor的情况下都无法独立部署strata,一堆毛病。昨天被advisor按着头把md看完了才发现自己哪里哪里哪里和哪里错了

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-5 16:25 来自手机 | 显示全部楼层
本帖最后由 c月光咖啡 于 2026-10-5 16:29 编辑

如果iq3或者q4要10路并发,上下文64-128k之间,decode速度在50以上的话,什么配置可以做到?

—— 来自 HONOR MAA-AN10, Android 16, 鹅球 v3.5.99-debug
回复

使用道具 举报

     
 楼主| 发表于 2026-10-5 16:51 来自手机 | 显示全部楼层
c月光咖啡 发表于 2026-10-5 16:25
如果iq3或者q4要10路并发,上下文64-128k之间,decode速度在50以上的话,什么配置可以做到?

—— 来自 HO ...

等下个月再看,现在还是不够成熟
回复

使用道具 举报

发表于 2026-10-5 19:18 | 显示全部楼层
c月光咖啡 发表于 2026-10-5 16:25
如果iq3或者q4要10路并发,上下文64-128k之间,decode速度在50以上的话,什么配置可以做到?

—— 来自 HO ...

四卡5090,512G内存。
回复

使用道具 举报

     
发表于 2026-10-5 20:52 来自手机 | 显示全部楼层
strata 等更更再说了  我这低内存模式跑那个无审查模型还有问题 iqxxs 这个 出点啥问题 整个 IO 堵死 长按开关都关不了机 只能拔插座 太伤了
跑 iq2 我还不太甘心

—— 来自 Xiaomi 24122RKC7C, Android 16, 鹅球 v4.0-alpha
回复

使用道具 举报

发表于 2026-10-5 23:28 | 显示全部楼层
https://github.com/kvmem/kvmem-llama.cpp/releases/tag/v0.18.0-ninfer-rc1
kvmem 作者更新了个 ninfer+kvmem 可以试试    Re:Source
回复

使用道具 举报

     
发表于 2026-10-6 08:27 来自手机 | 显示全部楼层
有人知道我12+32跑27b的IQ3XXS,上下文128k,tps大概7 token/s,这个数值正常吗?对了,我用的beellama.cpp,用ninfer会好点吗?

—— 来自 OnePlus PJX110, Android 15, 鹅球 v3.5.99-alpha
回复

使用道具 举报

发表于 2026-10-6 09:31 来自手机 | 显示全部楼层
内存容量重要还是频率重要?
楼主还是内存混插中吗,我显存只有12GB的条件下,16GB*2 6400再插一根16GB 6000的条降点频率能有啥大的收益吗

—— 来自 vivo V2405A, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-10-6 10:07 来自手机 | 显示全部楼层
Penelope 发表于 2026-10-6 09:31
内存容量重要还是频率重要?
楼主还是内存混插中吗,我显存只有12GB的条件下,16GB*2 6400再插一根16GB 600 ...

内存越大越不需要和硬盘交换速度越快

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
 楼主| 发表于 2026-10-6 16:20 | 显示全部楼层
https://github.com/Xxianna/llama.cpp-glm-fast

有128+32以上的可以试试去跑GLM5.3FLASH了,正儿八经的生产力模型
回复

使用道具 举报

     
发表于 2026-10-6 16:24 | 显示全部楼层
tianzrf 发表于 2026-10-5 23:28
https://github.com/kvmem/kvmem-llama.cpp/releases/tag/v0.18.0-ninfer-rc1
kvmem 作者更新了个 ninfer+k ...

感谢提醒,这个在我电脑上运行的效果不赖,是真的能派上用场的本地部署了。
iq3_xxs 128k跑了几个小时真实项目没啥问题。
ds4.1f的评价是:它是一台可靠的“规格执行器”,不是可靠的“自治工程师”。 只要验证回路是真实执行的(而不是它自述的静态检查),它足以承担这个项目绝大部分编码工作。
回复

使用道具 举报

发表于 2026-10-6 19:16 | 显示全部楼层
glm 5.3flash那个,对于内存带宽要求太高,一般机器也用不了的
回复

使用道具 举报

     
 楼主| 发表于 2026-10-6 19:21 来自手机 | 显示全部楼层
自由之紫roy 发表于 2026-10-6 19:16
glm 5.3flash那个,对于内存带宽要求太高,一般机器也用不了的

llamacpp的基础不行,这个框架的效率真是一坨
回复

使用道具 举报

     
发表于 2026-10-7 01:17 | 显示全部楼层
想要本地爽跑llm和视频模型,推断以后的本地模型能力也能进步到可用可撸的程度。是不是干脆砸钱搞个5090算了?就是现在这价格烫手,不知道什么情况下会血亏
回复

使用道具 举报

     
 楼主| 发表于 2026-10-7 01:53 | 显示全部楼层
bixinhaner 发表于 2026-10-7 01:17
想要本地爽跑llm和视频模型,推断以后的本地模型能力也能进步到可用可撸的程度。是不是干脆砸钱搞个5090算 ...

不如买rtx  pro 5000 72G
回复

使用道具 举报

     
发表于 2026-10-7 23:34 | 显示全部楼层
qwased 发表于 2026-10-7 01:53
不如买rtx  pro 5000 72G

好的,研究一下。就是砸钱肉疼,是不是要转变一下观念,现在买卡就是以前买房
回复

使用道具 举报

     
 楼主| 发表于 2026-10-7 23:35 来自手机 | 显示全部楼层
bixinhaner 发表于 2026-10-7 23:34
好的,研究一下。就是砸钱肉疼,是不是要转变一下观念,现在买卡就是以前买房 ...

显存决定能不能跑,速度其实已经是比较次要的因素了
不过没什么特殊需求买来干啥,没法变现啊
回复

使用道具 举报

     
发表于 2026-10-8 23:12 | 显示全部楼层
我的strata已经可以跑到110k以上,还是iq3s,,我已经满足了…………
今天它甚至帮我解决了一个ds一直没搞定,搞了很多次,浪费了我很多钱的一个问题。
现在搭配着你推荐那个大佬写的最终版的27b的ninfer版本,已经可以覆盖我所有的使用场景了。
感觉真的是躺平等下一代了。
本来以前还想升级下显卡,现在感觉可以继续苟一下了。。。
回复

使用道具 举报

     
发表于 2026-10-10 21:27 | 显示全部楼层
[Qwen3.8 27B赛博治疗完结篇,压制了雷霆思考能力比原版还强大的27B如何诞生的后训练全纪实_哔哩哔哩_bilibili](https://www.bilibili.com/video/BV16VHm6sEYB/)  这个咋样
回复

使用道具 举报

     
 楼主| 发表于 2026-10-10 21:57 | 显示全部楼层
奈落的孤火花 发表于 2026-10-10 21:27
[Qwen3.8 27B赛博治疗完结篇,压制了雷霆思考能力比原版还强大的27B如何诞生的后训练全纪实_哔哩哔哩_bilib ...

不错的,别当许愿机用就行,被压制了超长思考之后他完成许愿任务的能力变得非常差了
但是完成明确的任务他可以干的又快又好
回复

使用道具 举报

     
发表于 2026-10-10 22:21 | 显示全部楼层
问了一下GPT说还是推荐qwen flash,因为我的需求是至少512K上下文


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
 楼主| 发表于 2026-10-10 22:30 | 显示全部楼层
奈落的孤火花 发表于 2026-10-10 22:21
问了一下GPT说还是推荐qwen flash,因为我的需求是至少512K上下文

你可以先去用qoder里面的免费qwen3.8flash,觉得满意再想办法弄本地部署的
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-10-11 05:22 , Processed in 0.105963 second(s), 6 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表