lzchen 发表于 2026-10-2 13:31
那也原来本地的27B强得多哈。。。推AGENT能基本推动了不?
轻易可以,现在就是本地部署的黄金时代了,0731级别的智力可以放在本地随便用
https://github.com/Ryan-gsq/ninfer-16g-5070ti-5080-5090-qwen3.8-27b-gsq-rco
27b的专武,实现了IQ3S 1600prefill 110decode
长上下文(227K token prompt,256K 原生档,needle 测试)
请求 prompt prefill 耗时/速度 decode MTP 接受 命中率 盘读
串行 #A 227,843 61.42 s / 3709.4 t/s 80 tok @ 82.6 t/s 47/62 (75.8%) 96.5% 1302 blob
串行 #B 227,846 61.24 s / 3720.4 t/s 80 tok @ 96.2 t/s 53/76 (69.7%) 97.2% 2604 blob
串行 #C 227,855 61.49 s / 3705.7 t/s 80 tok @ 117.3 t/s 55/69 (79.7%) 98.9% 3906 blob
并发 #A 227,843 61.60 s / 3699.0 t/s 80 tok @ 108.4 t/s 50/65 (76.9%) 98.3% 5208 blob
并发 #B 227,846 61.77 s / 3688.8 t/s 65 tok @ 128.2 t/s 44/51 (86.3%) 98.7% 6510 blob
并发 #C 227,855 61.92 s / 3679.9 t/s 73 tok @ 124.1 t/s 48/61 (78.7%) 99.0% 7812 blob
关键观察:
prefill 速度在 227K 长度下并发零劣化(3709 → 3680 t/s,-0.8% 在噪声内)
decode 从短文 96 → 长文 108-128 t/s 不降反升(MTP 接受率 55%→79%,长文重复结构利于草稿命中)
专家命中率随使用自适应爬升:96.5%(首条 227K)→ 99.0%(第六条)——adaptive swap 把热专家持续换进显存,盘读是"预热代价"不是稳态
单路 227K 全流程(prefill+decode)62-63 s
震惊瘫坐,q4精度100多token 227kprompt,predill+decode只要一分钟。而且显存占用64G,内存116G。速度比之前的双pro5000 72Gq4部署方案要快一倍多。这方案比之前27b fp8方案都要好很多了。毕竟3.8 flashnext q4权重118G,而27b fp8只有29G,同样条件220kprompt下,速度比flashnext q4慢30%。
让gpt6sol再优化一下专家加载策略,看看,有没有机会跑更快。
0.1.36出了,仓库自动更新了优化方案了
本帖最后由 kinfox 于 2026-10-3 11:11 编辑
qwased 发表于 2026-10-2 14:48
https://github.com/Ryan-gsq/ninfer-16g-5070ti-5080-5090-qwen3.8-27b-gsq-rco
27b的专武,实现了IQ3S 1 ...
https://www.bilibili.com/video/BV15VaD6EEQQ
恐怖,我用了这个框架速度最高的时候飙到了200以上…………感觉比ds api还快。。。
而且内存显存占用也很低,,,,才70%多
上下文还拉满了256k。。。无敌啊
这个搭配着strata两个一起用,可以愉快的等待qwen4了
kinfox 发表于 2026-10-3 11:09
https://www.bilibili.com/video/BV15VaD6EEQQ/?spm_id_from=333.1007.top_right_bar_window_history.conte ...
显存有余力的话可以开并发,ninfer的并发效率非常高
qwased 发表于 2026-10-3 11:11
显存有余力的话可以开并发,ninfer的并发效率非常高
不是说27b的gsqrco用mtp有问题吗?解决了?
zhl1989666 发表于 2026-10-3 11:28
不是说27b的gsqrco用mtp有问题吗?解决了?
ninfer可以换dflash2啊
而且我测完发现mtp降智是llamacpp独有的bug
用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持平稍微强一点
现在速度
prefill 500tps
推理20tps
这样
璇瑢子R 发表于 2026-10-3 11:48
用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持 ...
qwen跑翻译感觉确实不行,b站那个qwen微调的翻译模型出来的文字比hy mt2烂多了
qwased 发表于 2026-10-3 11:11
显存有余力的话可以开并发,ninfer的并发效率非常高
好像说和KVMem不兼容,我开并发会导致下降。。神奇
还在继续研究持续优化的方向。。。
kinfox 发表于 2026-10-3 11:54
好像说和KVMem不兼容,我开并发会导致下降。。神奇
还在继续研究持续优化的方向。。。 ...
别用kvmem,幻觉很严重的
qwased 发表于 2026-10-3 12:05
别用kvmem,幻觉很严重的
但它这个项目是这个的。。。我也在研究你昨天分享的那个视频里的项目,但那是对应50系的
我们40系的我要找自己能编译的ninfer昨晚到现在还没搞定,今天继续试试 看看能不能做个仔细的对比再筛选。
kinfox 发表于 2026-10-3 12:16
但它这个项目是这个的。。。我也在研究你昨天分享的那个视频里的项目,但那是对应50系的
我们40系的我要 ...
https://github.com/iamwavecut/ninfer-all/
有个合集
跑q4速度140token/s了,这速度,已经非常满足了。
璇瑢子R 发表于 2026-10-3 11:48
用opus把strata改成支持Windows+Intel B70 32G
Qwen 3.8 Flash next IQ3S跑日中翻译。
也就比Gemma4 31B持 ...
strata还可以自己定制。
翻译任务之前大概只有40%的专家在显存里。
我记录了一下热专家,现在可以做到96%的专家在显存里。
tps从20提升到60了
本帖最后由 moekyo 于 2026-10-3 14:48 编辑
过来伸手一下,请问有 5070ti +32 G 的最优配置吗,搜了一下,要 64 G 才能完整体验,妈的,这内存,下不了手啊
moekyo 发表于 2026-10-3 14:44
过来伸手一下,请问有 5070ti +32 G 的最优配置吗,搜了一下,要 64 G 才能完整体验,妈的,这内存,下不了 ...
用282楼的ninfer跑gsq iq3s就差不多了
qwased 发表于 2026-10-3 14:52
用282楼的ninfer跑gsq iq3s就差不多了
NEXT 的话,是只能加内存吗
moekyo 发表于 2026-10-3 15:12
NEXT 的话,是只能加内存吗
是的,现在不太建议硬上了,qoder的3.8flash可以白嫖
实际使用还没怎么试,不过这个速度确实爽了
我是5070ti 16g加32g内存
这两天人在外面,让hermes部署了strata coder和ninfer 27b,跑了两个测试,大致结论是智商差不多,ninfer要快很多。
——来自 2410DPN6CC 上的 S1er 客户端
noneoneone 发表于 2026-10-3 22:30
我是5070ti 16g加32g内存
这两天人在外面,让hermes部署了strata coder和ninfer 27b,跑了两个测试,大致结 ...
coder剪太多了,实际使用的时候非常容易陷入死循环和乱码,不建议用
所以请问48g内存和8g5060够吗?最近在用dp4.1f玩小说设定,一个月要刷个200多有点肉痛。目测将来还会玩下去
—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5.99
长末 发表于 2026-10-4 00:39
所以请问48g内存和8g5060够吗?最近在用dp4.1f玩小说设定,一个月要刷个200多有点肉痛。目测将来还会玩下去 ...
strata跑IQ2可以,玩文游倒是不怕精度太低
qwased 发表于 2026-10-4 00:40
strata跑IQ2可以,玩文游倒是不怕精度太低
就是那个27b是吧,国庆前下了还没装,有空回去试试
—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5.99
长末 发表于 2026-10-4 00:43
就是那个27b是吧,国庆前下了还没装,有空回去试试
—— 来自 HUAWEI LMR-AL00, Android 16, 鹅球 v3.5. ...
是flash,27b你只能跑bonsai了
现在的问题是输入多一些,显卡就崩了。上下文只能开到32k
——来自 2410DPN6CC 上的 S1er 客户端
把显示器插核显上
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
umamusume 发表于 10-04 12:01
把显示器插核显上
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
木有核显,这个情况和显示器插在哪块显卡上有关吗
——来自 2410DPN6CC 上的 S1er 客户端
noneoneone 发表于 2026-10-4 12:28
木有核显,这个情况和显示器插在哪块显卡上有关吗
——来自 2410DPN6CC 上的 S1er 客户端 ...
插了显示器会占用1g显存做gpu渲染加速
何止1g,我5k屏要3g,带宽不到5.0x8还跑不满屏幕帧数呢
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
所以还是减少显存占用,我想想怎么搞
——来自 2410DPN6CC 上的 S1er 客户端
你内存太小了,内存的问题,把交换页开大
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
qwased 发表于 2026-10-3 11:50
qwen跑翻译感觉确实不行,b站那个qwen微调的翻译模型出来的文字比hy mt2烂多了 ...
我觉得还行,至少我能用了.
昨天用mimo api翻译小黄油, 才跑一半就花了6元,而且后面速度严重下降..
后面换baosai 一小时搞定
strata支持并发了,这下真的核弹瘫坐了
突然感觉考这些小模型,显卡和内存豆得接着涨?
把模型换成iq3_xxs了,但是在富裕2g多显存10g多内存的情况下还是会出现掉显卡的情况
——来自 2410DPN6CC 上的 S1er 客户端
noneoneone 发表于 2026-10-4 22:08
把模型换成iq3_xxs了,但是在富裕2g多显存10g多内存的情况下还是会出现掉显卡的情况
——来自 2410DPN6CC...
是指驱动重置吗