找回密码
 立即注册
搜索
楼主: qwased

[科技] 16G显卡+qwen3.8 27B上下文200K,个人经验总结(更新llamacpp推荐)

[复制链接]
     
 楼主| 发表于 2026-10-2 13:50 来自手机 | 显示全部楼层
lzchen 发表于 2026-10-2 13:31
那也原来本地的27B强得多哈。。。推AGENT能基本推动了不?

轻易可以,现在就是本地部署的黄金时代了,0731级别的智力可以放在本地随便用
回复

使用道具 举报

     
 楼主| 发表于 2026-10-2 14:48 | 显示全部楼层
https://github.com/Ryan-gsq/ninf ... qwen3.8-27b-gsq-rco

27b的专武,实现了IQ3S 1600prefill 110decode
回复

使用道具 举报

发表于 2026-10-3 00:59 | 显示全部楼层
长上下文(227K token prompt,256K 原生档,needle 测试)
请求        prompt        prefill 耗时/速度        decode        MTP 接受        命中率        盘读
串行 #A        227,843        61.42 s / 3709.4 t/s        80 tok @ 82.6 t/s        47/62 (75.8%)        96.5%        1302 blob
串行 #B        227,846        61.24 s / 3720.4 t/s        80 tok @ 96.2 t/s        53/76 (69.7%)        97.2%        2604 blob
串行 #C        227,855        61.49 s / 3705.7 t/s        80 tok @ 117.3 t/s        55/69 (79.7%)        98.9%        3906 blob
并发 #A        227,843        61.60 s / 3699.0 t/s        80 tok @ 108.4 t/s        50/65 (76.9%)        98.3%        5208 blob
并发 #B        227,846        61.77 s / 3688.8 t/s        65 tok @ 128.2 t/s        44/51 (86.3%)        98.7%        6510 blob
并发 #C        227,855        61.92 s / 3679.9 t/s        73 tok @ 124.1 t/s        48/61 (78.7%)        99.0%        7812 blob
关键观察:

prefill 速度在 227K 长度下并发零劣化(3709 → 3680 t/s,-0.8% 在噪声内)
decode 从短文 96 → 长文 108-128 t/s 不降反升(MTP 接受率 55%→79%,长文重复结构利于草稿命中)
专家命中率随使用自适应爬升:96.5%(首条 227K)→ 99.0%(第六条)——adaptive swap 把热专家持续换进显存,盘读是"预热代价"不是稳态
单路 227K 全流程(prefill+decode)62-63 s  

震惊瘫坐,q4精度100多token 227kprompt,predill+decode只要一分钟。而且显存占用64G,内存116G。速度比之前的双pro5000 72Gq4部署方案要快一倍多。这方案比之前27b fp8方案都要好很多了。毕竟3.8 flashnext q4权重118G,而27b fp8只有29G,同样条件220kprompt下,速度比flashnext q4慢30%。
回复

使用道具 举报

发表于 2026-10-3 01:04 | 显示全部楼层
让gpt6sol再优化一下专家加载策略,看看,有没有机会跑更快。
回复

使用道具 举报

发表于 2026-10-3 01:36 | 显示全部楼层
0.1.36出了,仓库自动更新了优化方案了
回复

使用道具 举报

     
发表于 2026-10-3 11:09 | 显示全部楼层
本帖最后由 kinfox 于 2026-10-3 11:11 编辑

https://www.bilibili.com/video/BV15VaD6EEQQ
恐怖,我用了这个框架速度最高的时候飙到了200以上…………感觉比ds api还快。。。
而且内存显存占用也很低,,,,才70%多
上下文还拉满了256k。。。无敌啊
这个搭配着strata两个一起用,可以愉快的等待qwen4了
回复

使用道具 举报

     
 楼主| 发表于 2026-10-3 11:11 | 显示全部楼层
kinfox 发表于 2026-10-3 11:09
https://www.bilibili.com/video/BV15VaD6EEQQ/?spm_id_from=333.1007.top_right_bar_window_history.conte ...

显存有余力的话可以开并发,ninfer的并发效率非常高
回复

使用道具 举报

     
发表于 2026-10-3 11:28 来自手机 | 显示全部楼层
qwased 发表于 2026-10-3 11:11
显存有余力的话可以开并发,ninfer的并发效率非常高

不是说27b的gsqrco用mtp有问题吗?解决了?
回复

使用道具 举报

     
 楼主| 发表于 2026-10-3 11:34 | 显示全部楼层
zhl1989666 发表于 2026-10-3 11:28
不是说27b的gsqrco用mtp有问题吗?解决了?

ninfer可以换dflash2啊
而且我测完发现mtp降智是llamacpp独有的bug
回复

使用道具 举报

发表于 2026-10-3 11:48 | 显示全部楼层
用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持平稍微强一点
现在速度
prefill 500tps
推理20tps
这样
回复

使用道具 举报

     
 楼主| 发表于 2026-10-3 11:50 | 显示全部楼层
璇瑢子R 发表于 2026-10-3 11:48
用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持 ...

qwen跑翻译感觉确实不行,b站那个qwen微调的翻译模型出来的文字比hy mt2烂多了
回复

使用道具 举报

     
发表于 2026-10-3 11:54 | 显示全部楼层
qwased 发表于 2026-10-3 11:11
显存有余力的话可以开并发,ninfer的并发效率非常高

好像说和KVMem不兼容,我开并发会导致下降。。神奇
还在继续研究持续优化的方向。。。
回复

使用道具 举报

     
 楼主| 发表于 2026-10-3 12:05 来自手机 | 显示全部楼层
kinfox 发表于 2026-10-3 11:54
好像说和KVMem不兼容,我开并发会导致下降。。神奇
还在继续研究持续优化的方向。。。 ...

别用kvmem,幻觉很严重的
回复

使用道具 举报

     
发表于 2026-10-3 12:16 | 显示全部楼层
qwased 发表于 2026-10-3 12:05
别用kvmem,幻觉很严重的

但它这个项目是这个的。。。我也在研究你昨天分享的那个视频里的项目,但那是对应50系的
我们40系的我要找自己能编译的ninfer昨晚到现在还没搞定,今天继续试试 看看能不能做个仔细的对比再筛选。
回复

使用道具 举报

     
 楼主| 发表于 2026-10-3 12:25 | 显示全部楼层
kinfox 发表于 2026-10-3 12:16
但它这个项目是这个的。。。我也在研究你昨天分享的那个视频里的项目,但那是对应50系的
我们40系的我要 ...

https://github.com/iamwavecut/ninfer-all/
有个合集
回复

使用道具 举报

发表于 2026-10-3 12:46 | 显示全部楼层
跑q4速度140token/s了,这速度,已经非常满足了。
回复

使用道具 举报

发表于 2026-10-3 13:15 | 显示全部楼层
璇瑢子R 发表于 2026-10-3 11:48
用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持 ...

strata还可以自己定制。

翻译任务之前大概只有40%的专家在显存里。
我记录了一下热专家,现在可以做到96%的专家在显存里。

tps从20提升到60了
回复

使用道具 举报

     
发表于 2026-10-3 14:44 | 显示全部楼层
本帖最后由 moekyo 于 2026-10-3 14:48 编辑

过来伸手一下,请问有 5070ti +32 G 的最优配置吗,搜了一下,要 64 G 才能完整体验,妈的,这内存,下不了手啊
回复

使用道具 举报

     
 楼主| 发表于 2026-10-3 14:52 来自手机 | 显示全部楼层
moekyo 发表于 2026-10-3 14:44
过来伸手一下,请问有 5070ti +32 G 的最优配置吗,搜了一下,要 64 G 才能完整体验,妈的,这内存,下不了 ...

用282楼的ninfer跑gsq iq3s就差不多了
回复

使用道具 举报

     
发表于 2026-10-3 15:12 | 显示全部楼层
qwased 发表于 2026-10-3 14:52
用282楼的ninfer跑gsq iq3s就差不多了

NEXT 的话,是只能加内存吗
回复

使用道具 举报

     
 楼主| 发表于 2026-10-3 15:32 来自手机 | 显示全部楼层
moekyo 发表于 2026-10-3 15:12
NEXT 的话,是只能加内存吗

是的,现在不太建议硬上了,qoder的3.8flash可以白嫖

评分

参与人数 1战斗力 +2 收起 理由
moekyo + 2 好评加鹅

查看全部评分

回复

使用道具 举报

     
发表于 2026-10-3 19:42 | 显示全部楼层
实际使用还没怎么试,不过这个速度确实爽了

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-10-3 22:30 来自手机 | 显示全部楼层
我是5070ti 16g加32g内存
这两天人在外面,让hermes部署了strata coder和ninfer 27b,跑了两个测试,大致结论是智商差不多,ninfer要快很多。

——来自 2410DPN6CC 上的 S1er 客户端
回复

使用道具 举报

     
 楼主| 发表于 2026-10-3 23:04 | 显示全部楼层
noneoneone 发表于 2026-10-3 22:30
我是5070ti 16g加32g内存
这两天人在外面,让hermes部署了strata coder和ninfer 27b,跑了两个测试,大致结 ...

coder剪太多了,实际使用的时候非常容易陷入死循环和乱码,不建议用
回复

使用道具 举报

     
发表于 2026-10-4 00:39 来自手机 | 显示全部楼层
所以请问48g内存和8g5060够吗?最近在用dp4.1f玩小说设定,一个月要刷个200多有点肉痛。目测将来还会玩下去

—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 00:40 | 显示全部楼层
长末 发表于 2026-10-4 00:39
所以请问48g内存和8g5060够吗?最近在用dp4.1f玩小说设定,一个月要刷个200多有点肉痛。目测将来还会玩下去 ...

strata跑IQ2可以,玩文游倒是不怕精度太低
回复

使用道具 举报

     
发表于 2026-10-4 00:43 来自手机 | 显示全部楼层
qwased 发表于 2026-10-4 00:40
strata跑IQ2可以,玩文游倒是不怕精度太低

就是那个27b是吧,国庆前下了还没装,有空回去试试

—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 00:56 | 显示全部楼层
长末 发表于 2026-10-4 00:43
就是那个27b是吧,国庆前下了还没装,有空回去试试

—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5. ...

是flash,27b你只能跑bonsai了
回复

使用道具 举报

     
发表于 2026-10-4 11:54 来自手机 | 显示全部楼层
现在的问题是输入多一些,显卡就崩了。上下文只能开到32k

——来自 2410DPN6CC 上的 S1er 客户端
回复

使用道具 举报

     
发表于 2026-10-4 12:01 来自手机 | 显示全部楼层
把显示器插核显上

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-4 12:28 来自手机 | 显示全部楼层
umamusume 发表于 10-04 12:01
把显示器插核显上

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0


木有核显,这个情况和显示器插在哪块显卡上有关吗

——来自 2410DPN6CC 上的 S1er 客户端
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 12:43 来自手机 | 显示全部楼层
noneoneone 发表于 2026-10-4 12:28
木有核显,这个情况和显示器插在哪块显卡上有关吗

——来自 2410DPN6CC 上的 S1er 客户端 ...

插了显示器会占用1g显存做gpu渲染加速
回复

使用道具 举报

     
发表于 2026-10-4 12:45 来自手机 | 显示全部楼层
何止1g,我5k屏要3g,带宽不到5.0x8还跑不满屏幕帧数呢

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-4 13:06 来自手机 | 显示全部楼层
所以还是减少显存占用,我想想怎么搞

——来自 2410DPN6CC 上的 S1er 客户端
回复

使用道具 举报

     
发表于 2026-10-4 13:11 来自手机 | 显示全部楼层
你内存太小了,内存的问题,把交换页开大

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-4 15:03 | 显示全部楼层
qwased 发表于 2026-10-3 11:50
qwen跑翻译感觉确实不行,b站那个qwen微调的翻译模型出来的文字比hy mt2烂多了 ...

我觉得还行,至少我能用了.

昨天用mimo api翻译小黄油, 才跑一半就花了6元,而且后面速度严重下降..
后面换baosai 一小时搞定
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 20:52 | 显示全部楼层
strata支持并发了,这下真的核弹瘫坐了
回复

使用道具 举报

     
发表于 2026-10-4 21:38 来自手机 | 显示全部楼层
突然感觉考这些小模型,显卡和内存豆得接着涨?
回复

使用道具 举报

     
发表于 2026-10-4 22:08 来自手机 | 显示全部楼层
把模型换成iq3_xxs了,但是在富裕2g多显存10g多内存的情况下还是会出现掉显卡的情况

——来自 2410DPN6CC 上的 S1er 客户端
回复

使用道具 举报

     
 楼主| 发表于 2026-10-4 22:27 | 显示全部楼层
noneoneone 发表于 2026-10-4 22:08
把模型换成iq3_xxs了,但是在富裕2g多显存10g多内存的情况下还是会出现掉显卡的情况

——来自 2410DPN6CC  ...

是指驱动重置吗
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-10-11 05:22 , Processed in 0.055825 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表