qwased 发表于 2026-10-4 20:52
strata支持并发了,这下真的核弹瘫坐了
我日啊,马上试试看
本帖最后由 noneoneone 于 2026-10-4 22:40 编辑
qwased 发表于 10-04 22:27
是指驱动重置吗
黑屏,驱动报找不到GPU,必须重启电脑才能恢复。
nvidia-smi: Unable to determine the device handle for GPU0: 0000:08:00.0:
GPU is lost. Reboot the system to recover this GPU
No devices were found
影响工作倒还是次要的,我担心老是这样会把GPU整出点什么毛病
——来自 2410DPN6CC 上的 S1er 客户端
noneoneone 发表于 2026-10-4 22:38
黑屏,驱动报找不到GPU,必须重启电脑才能恢复。
nvidia-smi: Unable to determine the device handle for ...
你让大肥鱼看看日志是哪里出问题了吧,strata对显卡的压力非常小的,按道理不应该这样
你看看系统日志里面是不是有whea,可能你的pcie跑不稳,流量一大就炸
qwased 发表于 2026-10-4 20:52
strata支持并发了,这下真的核弹瘫坐了
刚刚去搞了 ,感觉很爽
然后ninfer也优化到300多的速度,感觉已经完全可以躺平等qwen4了
开源社区就是好啊!!!!
qwased 发表于 10-04 22:51
你让大肥鱼看看日志是哪里出问题了吧,strata对显卡的压力非常小的,按道理不应该这样
你看看系统日志里面是不是有whea,可能你的pcie跑不稳,流量一大就炸
现在跑的不是strata,是ninfer。我在让DS帮我分析。现在网页版有哪个ai能力比较强的
——来自 2410DPN6CC 上的 S1er 客户端
noneoneone 发表于 2026-10-4 22:58
现在跑的不是strata,是ninfer。我在让DS帮我分析。现在网页版有哪个ai能力比较强的
——来自 2410DPN6 ...
那你需要下个最新的hwinfo,看看是不是跑的时候GPU热点温度过105了,50系热点105以上会黑屏保护
kinfox 发表于 2026-10-4 22:52
刚刚去搞了 ,感觉很爽
然后ninfer也优化到300多的速度,感觉已经完全可以躺平等qwen4了
开源社区就是好 ...
300多咋整的,并发吗
我开到2并发256k了。应该没有任何问题了。
自由之紫roy 发表于 2026-10-4 23:36
我开到2并发256k了。应该没有任何问题了。
MOE并发开的越多越赚,dgx spark那种破烂都敢开64并发的可以多开点做sub agent提速
自由之紫roy 发表于 2026-10-4 23:36
我开到2并发256k了。应该没有任何问题了。
卧槽,大佬电脑配置是啥?
本帖最后由 自由之紫roy 于 2026-10-5 00:21 编辑
qwased 发表于 2026-10-4 23:40
MOE并发开的越多越赚,dgx spark那种破烂都敢开64并发的可以多开点做sub agent提速 ...
我让agent帮我设了6并发了,如果只用单路,速度大概只下降10%,多路一起用,总吞吐估计翻倍。
-------------
我测试了一下,单卡并发,总吞吐没有获益。。。只是不要排队了。。。
lzchen 发表于 2026-10-4 23:41
卧槽,大佬电脑配置是啥?
pro5000 72G*2 256G DDR6000 我用的是q4,不过用单卡就可以了,以前要双卡才可以q4,现在空出的卡可以跑视频了。
不过社区后期还会更新补丁,会提高总的吞吐能力。现在四路并发跑任务中,美滋滋地去睡觉了
大肥鱼太弱智了,没有advisor的情况下都无法独立部署strata,一堆毛病。昨天被advisor按着头把md看完了才发现自己哪里哪里哪里和哪里错了
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
本帖最后由 c月光咖啡 于 2026-10-5 16:29 编辑
如果iq3或者q4要10路并发,上下文64-128k之间,decode速度在50以上的话,什么配置可以做到?
—— 来自 HONOR MAA-AN10, Android 16, 鹅球 v3.5.99-debug
c月光咖啡 发表于 2026-10-5 16:25
如果iq3或者q4要10路并发,上下文64-128k之间,decode速度在50以上的话,什么配置可以做到?
—— 来自 HO ...
等下个月再看,现在还是不够成熟
c月光咖啡 发表于 2026-10-5 16:25
如果iq3或者q4要10路并发,上下文64-128k之间,decode速度在50以上的话,什么配置可以做到?
—— 来自 HO ...
四卡5090,512G内存。
strata 等更更再说了我这低内存模式跑那个无审查模型还有问题 iqxxs 这个 出点啥问题 整个 IO 堵死 长按开关都关不了机 只能拔插座 太伤了
跑 iq2 我还不太甘心
—— 来自 Xiaomi 24122RKC7C, Android 16, 鹅球 v4.0-alpha
https://github.com/kvmem/kvmem-llama.cpp/releases/tag/v0.18.0-ninfer-rc1
kvmem 作者更新了个 ninfer+kvmem 可以试试 Re:Source
有人知道我12+32跑27b的IQ3XXS,上下文128k,tps大概7 token/s,这个数值正常吗?对了,我用的beellama.cpp,用ninfer会好点吗?
—— 来自 OnePlus PJX110, Android 15, 鹅球 v3.5.99-alpha
内存容量重要还是频率重要?
楼主还是内存混插中吗,我显存只有12GB的条件下,16GB*2 6400再插一根16GB 6000的条降点频率能有啥大的收益吗
—— 来自 vivo V2405A, Android 16, 鹅球 v3.5.99-alpha
Penelope 发表于 2026-10-6 09:31
内存容量重要还是频率重要?
楼主还是内存混插中吗,我显存只有12GB的条件下,16GB*2 6400再插一根16GB 600 ...
内存越大越不需要和硬盘交换速度越快
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
https://github.com/Xxianna/llama.cpp-glm-fast
有128+32以上的可以试试去跑GLM5.3FLASH了,正儿八经的生产力模型
tianzrf 发表于 2026-10-5 23:28
https://github.com/kvmem/kvmem-llama.cpp/releases/tag/v0.18.0-ninfer-rc1
kvmem 作者更新了个 ninfer+k ...
感谢提醒,这个在我电脑上运行的效果不赖,是真的能派上用场的本地部署了。
iq3_xxs 128k跑了几个小时真实项目没啥问题。
ds4.1f的评价是:它是一台可靠的“规格执行器”,不是可靠的“自治工程师”。 只要验证回路是真实执行的(而不是它自述的静态检查),它足以承担这个项目绝大部分编码工作。
glm 5.3flash那个,对于内存带宽要求太高,一般机器也用不了的
自由之紫roy 发表于 2026-10-6 19:16
glm 5.3flash那个,对于内存带宽要求太高,一般机器也用不了的
llamacpp的基础不行,这个框架的效率真是一坨
想要本地爽跑llm和视频模型,推断以后的本地模型能力也能进步到可用可撸的程度。是不是干脆砸钱搞个5090算了?就是现在这价格烫手,不知道什么情况下会血亏
bixinhaner 发表于 2026-10-7 01:17
想要本地爽跑llm和视频模型,推断以后的本地模型能力也能进步到可用可撸的程度。是不是干脆砸钱搞个5090算 ...
不如买rtxpro 5000 72G
qwased 发表于 2026-10-7 01:53
不如买rtxpro 5000 72G
好的,研究一下。就是砸钱肉疼,是不是要转变一下观念,现在买卡就是以前买房
bixinhaner 发表于 2026-10-7 23:34
好的,研究一下。就是砸钱肉疼,是不是要转变一下观念,现在买卡就是以前买房 ...
显存决定能不能跑,速度其实已经是比较次要的因素了
不过没什么特殊需求买来干啥,没法变现啊
我的strata已经可以跑到110k以上,还是iq3s,,我已经满足了…………
今天它甚至帮我解决了一个ds一直没搞定,搞了很多次,浪费了我很多钱的一个问题。
现在搭配着你推荐那个大佬写的最终版的27b的ninfer版本,已经可以覆盖我所有的使用场景了。
感觉真的是躺平等下一代了。
本来以前还想升级下显卡,现在感觉可以继续苟一下了。。。
(https://www.bilibili.com/video/BV16VHm6sEYB/)这个咋样
奈落的孤火花 发表于 2026-10-10 21:27
不错的,别当许愿机用就行,被压制了超长思考之后他完成许愿任务的能力变得非常差了
但是完成明确的任务他可以干的又快又好
问了一下GPT说还是推荐qwen flash,因为我的需求是至少512K上下文
奈落的孤火花 发表于 2026-10-10 22:21
问了一下GPT说还是推荐qwen flash,因为我的需求是至少512K上下文
你可以先去用qoder里面的免费qwen3.8flash,觉得满意再想办法弄本地部署的