qwased 发表于 2026-10-2 13:50

lzchen 发表于 2026-10-2 13:31
那也原来本地的27B强得多哈。。。推AGENT能基本推动了不?

轻易可以,现在就是本地部署的黄金时代了,0731级别的智力可以放在本地随便用

qwased 发表于 2026-10-2 14:48

https://github.com/Ryan-gsq/ninfer-16g-5070ti-5080-5090-qwen3.8-27b-gsq-rco

27b的专武,实现了IQ3S 1600prefill 110decode

自由之紫roy 发表于 2026-10-3 00:59

长上下文(227K token prompt,256K 原生档,needle 测试)
请求      prompt      prefill 耗时/速度      decode      MTP 接受      命中率      盘读
串行 #A      227,843      61.42 s / 3709.4 t/s      80 tok @ 82.6 t/s      47/62 (75.8%)      96.5%      1302 blob
串行 #B      227,846      61.24 s / 3720.4 t/s      80 tok @ 96.2 t/s      53/76 (69.7%)      97.2%      2604 blob
串行 #C      227,855      61.49 s / 3705.7 t/s      80 tok @ 117.3 t/s      55/69 (79.7%)      98.9%      3906 blob
并发 #A      227,843      61.60 s / 3699.0 t/s      80 tok @ 108.4 t/s      50/65 (76.9%)      98.3%      5208 blob
并发 #B      227,846      61.77 s / 3688.8 t/s      65 tok @ 128.2 t/s      44/51 (86.3%)      98.7%      6510 blob
并发 #C      227,855      61.92 s / 3679.9 t/s      73 tok @ 124.1 t/s      48/61 (78.7%)      99.0%      7812 blob
关键观察:

prefill 速度在 227K 长度下并发零劣化(3709 → 3680 t/s,-0.8% 在噪声内)
decode 从短文 96 → 长文 108-128 t/s 不降反升(MTP 接受率 55%→79%,长文重复结构利于草稿命中)
专家命中率随使用自适应爬升:96.5%(首条 227K)→ 99.0%(第六条)——adaptive swap 把热专家持续换进显存,盘读是"预热代价"不是稳态
单路 227K 全流程(prefill+decode)62-63 s

震惊瘫坐,q4精度100多token 227kprompt,predill+decode只要一分钟。而且显存占用64G,内存116G。速度比之前的双pro5000 72Gq4部署方案要快一倍多。这方案比之前27b fp8方案都要好很多了。毕竟3.8 flashnext q4权重118G,而27b fp8只有29G,同样条件220kprompt下,速度比flashnext q4慢30%。

自由之紫roy 发表于 2026-10-3 01:04

让gpt6sol再优化一下专家加载策略,看看,有没有机会跑更快。

自由之紫roy 发表于 2026-10-3 01:36

0.1.36出了,仓库自动更新了优化方案了

kinfox 发表于 2026-10-3 11:09

本帖最后由 kinfox 于 2026-10-3 11:11 编辑

qwased 发表于 2026-10-2 14:48
https://github.com/Ryan-gsq/ninfer-16g-5070ti-5080-5090-qwen3.8-27b-gsq-rco

27b的专武,实现了IQ3S 1 ...
https://www.bilibili.com/video/BV15VaD6EEQQ
恐怖,我用了这个框架速度最高的时候飙到了200以上…………感觉比ds api还快。。。
而且内存显存占用也很低,,,,才70%多
上下文还拉满了256k。。。无敌啊
这个搭配着strata两个一起用,可以愉快的等待qwen4了

qwased 发表于 2026-10-3 11:11

kinfox 发表于 2026-10-3 11:09
https://www.bilibili.com/video/BV15VaD6EEQQ/?spm_id_from=333.1007.top_right_bar_window_history.conte ...

显存有余力的话可以开并发,ninfer的并发效率非常高

zhl1989666 发表于 2026-10-3 11:28

qwased 发表于 2026-10-3 11:11
显存有余力的话可以开并发,ninfer的并发效率非常高

不是说27b的gsqrco用mtp有问题吗?解决了?

qwased 发表于 2026-10-3 11:34

zhl1989666 发表于 2026-10-3 11:28
不是说27b的gsqrco用mtp有问题吗?解决了?

ninfer可以换dflash2啊
而且我测完发现mtp降智是llamacpp独有的bug

璇瑢子R 发表于 2026-10-3 11:48

用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持平稍微强一点
现在速度
prefill 500tps
推理20tps
这样

qwased 发表于 2026-10-3 11:50

璇瑢子R 发表于 2026-10-3 11:48
用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持 ...

qwen跑翻译感觉确实不行,b站那个qwen微调的翻译模型出来的文字比hy mt2烂多了

kinfox 发表于 2026-10-3 11:54

qwased 发表于 2026-10-3 11:11
显存有余力的话可以开并发,ninfer的并发效率非常高

好像说和KVMem不兼容,我开并发会导致下降。。神奇
还在继续研究持续优化的方向。。。

qwased 发表于 2026-10-3 12:05

kinfox 发表于 2026-10-3 11:54
好像说和KVMem不兼容,我开并发会导致下降。。神奇
还在继续研究持续优化的方向。。。 ...

别用kvmem,幻觉很严重的

kinfox 发表于 2026-10-3 12:16

qwased 发表于 2026-10-3 12:05
别用kvmem,幻觉很严重的

但它这个项目是这个的。。。我也在研究你昨天分享的那个视频里的项目,但那是对应50系的
我们40系的我要找自己能编译的ninfer昨晚到现在还没搞定,今天继续试试 看看能不能做个仔细的对比再筛选。

qwased 发表于 2026-10-3 12:25

kinfox 发表于 2026-10-3 12:16
但它这个项目是这个的。。。我也在研究你昨天分享的那个视频里的项目,但那是对应50系的
我们40系的我要 ...

https://github.com/iamwavecut/ninfer-all/
有个合集

自由之紫roy 发表于 2026-10-3 12:46

跑q4速度140token/s了,这速度,已经非常满足了。

璇瑢子R 发表于 2026-10-3 13:15

璇瑢子R 发表于 2026-10-3 11:48
用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持 ...

strata还可以自己定制。

翻译任务之前大概只有40%的专家在显存里。
我记录了一下热专家,现在可以做到96%的专家在显存里。

tps从20提升到60了

moekyo 发表于 2026-10-3 14:44

本帖最后由 moekyo 于 2026-10-3 14:48 编辑

过来伸手一下,请问有 5070ti +32 G 的最优配置吗,搜了一下,要 64 G 才能完整体验,妈的,这内存,下不了手啊

qwased 发表于 2026-10-3 14:52

moekyo 发表于 2026-10-3 14:44
过来伸手一下,请问有 5070ti +32 G 的最优配置吗,搜了一下,要 64 G 才能完整体验,妈的,这内存,下不了 ...

用282楼的ninfer跑gsq iq3s就差不多了

moekyo 发表于 2026-10-3 15:12

qwased 发表于 2026-10-3 14:52
用282楼的ninfer跑gsq iq3s就差不多了

NEXT 的话,是只能加内存吗

qwased 发表于 2026-10-3 15:32

moekyo 发表于 2026-10-3 15:12
NEXT 的话,是只能加内存吗

是的,现在不太建议硬上了,qoder的3.8flash可以白嫖

moekyo 发表于 2026-10-3 19:42

实际使用还没怎么试,不过这个速度确实爽了

noneoneone 发表于 2026-10-3 22:30

我是5070ti 16g加32g内存
这两天人在外面,让hermes部署了strata coder和ninfer 27b,跑了两个测试,大致结论是智商差不多,ninfer要快很多。

——来自 2410DPN6CC 上的 S1er 客户端

qwased 发表于 2026-10-3 23:04

noneoneone 发表于 2026-10-3 22:30
我是5070ti 16g加32g内存
这两天人在外面,让hermes部署了strata coder和ninfer 27b,跑了两个测试,大致结 ...

coder剪太多了,实际使用的时候非常容易陷入死循环和乱码,不建议用

长末 发表于 2026-10-4 00:39

所以请问48g内存和8g5060够吗?最近在用dp4.1f玩小说设定,一个月要刷个200多有点肉痛。目测将来还会玩下去

—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-10-4 00:40

长末 发表于 2026-10-4 00:39
所以请问48g内存和8g5060够吗?最近在用dp4.1f玩小说设定,一个月要刷个200多有点肉痛。目测将来还会玩下去 ...

strata跑IQ2可以,玩文游倒是不怕精度太低

长末 发表于 2026-10-4 00:43

qwased 发表于 2026-10-4 00:40
strata跑IQ2可以,玩文游倒是不怕精度太低

就是那个27b是吧,国庆前下了还没装,有空回去试试

—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-10-4 00:56

长末 发表于 2026-10-4 00:43
就是那个27b是吧,国庆前下了还没装,有空回去试试

—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5. ...

是flash,27b你只能跑bonsai了

noneoneone 发表于 2026-10-4 11:54

现在的问题是输入多一些,显卡就崩了。上下文只能开到32k

——来自 2410DPN6CC 上的 S1er 客户端

umamusume 发表于 2026-10-4 12:01

把显示器插核显上

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0

noneoneone 发表于 2026-10-4 12:28

umamusume 发表于 10-04 12:01
把显示器插核显上

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0



木有核显,这个情况和显示器插在哪块显卡上有关吗

——来自 2410DPN6CC 上的 S1er 客户端

qwased 发表于 2026-10-4 12:43

noneoneone 发表于 2026-10-4 12:28
木有核显,这个情况和显示器插在哪块显卡上有关吗

——来自 2410DPN6CC 上的 S1er 客户端 ...

插了显示器会占用1g显存做gpu渲染加速

umamusume 发表于 2026-10-4 12:45

何止1g,我5k屏要3g,带宽不到5.0x8还跑不满屏幕帧数呢

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0

noneoneone 发表于 2026-10-4 13:06

所以还是减少显存占用,我想想怎么搞

——来自 2410DPN6CC 上的 S1er 客户端

umamusume 发表于 2026-10-4 13:11

你内存太小了,内存的问题,把交换页开大

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0

pf67 发表于 2026-10-4 15:03

qwased 发表于 2026-10-3 11:50
qwen跑翻译感觉确实不行,b站那个qwen微调的翻译模型出来的文字比hy mt2烂多了 ...

我觉得还行,至少我能用了.

昨天用mimo api翻译小黄油, 才跑一半就花了6元,而且后面速度严重下降..
后面换baosai 一小时搞定

qwased 发表于 2026-10-4 20:52

strata支持并发了,这下真的核弹瘫坐了

龙骑将 发表于 2026-10-4 21:38

突然感觉考这些小模型,显卡和内存豆得接着涨?

noneoneone 发表于 2026-10-4 22:08

把模型换成iq3_xxs了,但是在富裕2g多显存10g多内存的情况下还是会出现掉显卡的情况

——来自 2410DPN6CC 上的 S1er 客户端

qwased 发表于 2026-10-4 22:27

noneoneone 发表于 2026-10-4 22:08
把模型换成iq3_xxs了,但是在富裕2g多显存10g多内存的情况下还是会出现掉显卡的情况

——来自 2410DPN6CC...

是指驱动重置吗
页: 1 2 3 4 5 6 7 [8] 9
查看完整版本: 16G显卡+qwen3.8 27B上下文200K,个人经验总结(更新llamacpp推荐)