plus 5小时回来了
舞以 发表于 2026-8-26 00:30
都更新了:三个模式分别是flash正式版、pro正式版和这个flash的多模态exp模型 ...
快速模式没改正式版,还是预览版。识图模式倒是正式版。未来应该是直接用识图模式替代快速模式了
kinfox 发表于 2026-8-25 23:43
今晚测了一下,用pi来接本地的模型qwen3.8,找到一个很不错的q4量化模型,跑起来特别顺。速度可以到60,70 ...
朋友什么配置啊,本地模型都这么强了吗,我还以为本地模型也就能聊天。
qwased 发表于 2026-8-26 00:02
你用的是哪个模型,apex吗
我现在感觉有pi vcc这种压缩上下文的插件之后确实上下文长度需求低多了,反正 ...
fraQtl HiFi Q4_K_M 这个是我挑选了数十个量化模型后,找到的最适合我配置的最强q4。。。
梯子线路问题,换线路
Gmlazy 发表于 2026-8-26 08:41
朋友什么配置啊,本地模型都这么强了吗,我还以为本地模型也就能聊天。 ...
我电脑就是个单显卡4090 24g的电脑…………跑q4_k_m 差不多60速度输出
qwen3.8是本地模型里面对家用显卡最友好的了,我这几天跑了好多游戏出来,
最快的时候,一个俄罗斯方块2分钟,质量奇高,还没有bug……
本帖最后由 neptunehs 于 2026-8-26 08:56 编辑
话说前面有人提到omp的webui 哪一家的?我搜到的github只有82 star
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
本地部署绝对不是只能玩聊天的东西啊…………很强的,拿来做小任务的平替没啥问题。
我直接一句话扔给它,几分钟就可以出一个完整可玩流畅的,它自己设计玩法的东西。
pi+qwen3.8的量化模型就是家庭用户现在的最好选择了……
kinfox 发表于 2026-8-26 08:52
本地部署绝对不是只能玩聊天的东西啊…………很强的,拿来做小任务的平替没啥问题。
我直接一句话扔给它, ...
显存和内存需求量大吗?
蜇灵 发表于 2026-8-26 09:00
显存和内存需求量大吗?
我显卡24g的4090,现在日常占用是21.7
千问的27B小模型真强啊
kinfox 发表于 2026-8-26 09:02
我显卡24g的4090,现在日常占用是21.7
又学到了。
我是4090D也来试试。
scikirbypoke 发表于 2026-8-25 18:27
pi-vcc特别好用,无llm调用的结构化快速压缩,还有让ai能搜整个上下文的回忆功能 ...
搜索了一下发现有两个,一个400多KB,一个16MB,前者fork后者,最后选了更新时间更近的后者。装好一看,好家伙把演示用的gif塞了进去,足足15MB大,主体还是只有400多KB,赶在ai塞屎山之前先给我拉一坨是吧。
—— 来自 Xiaomi 23054RA19C, Android 13, 鹅球 v4.0
我艹啊,codex的重置卡变成只能加5小时了,史诗级削弱
kinfox 发表于 2026-8-26 09:02
我显卡24g的4090,现在日常占用是21.7
24G显存跑Q4量化的qwen3.8 27B能开多大的上下文? 感觉稍微复杂点的东西没有200K以上Q8量化KV都是扛不住的
kitano 发表于 2026-8-26 09:21
搜索了一下发现有两个,一个400多KB,一个16MB,前者fork后者,最后选了更新时间更近的后者。装好一看, ...
400k那个好像功能更多,反正更新时间也差不多
这是在搞拿plus羊毛号做中转站的吧,无论之前路由弱智模型还是削重置卡都是这个逻辑,上次把好多用户误伤了果断滑跪,现在换了个思路
mp5 发表于 2026-8-26 09:23
24G显存跑Q4量化的qwen3.8 27B能开多大的上下文? 感觉稍微复杂点的东西没有200K以上Q8量化KV都是扛不住的 ...
只能靠拆解任务,压缩上下文,还有无限任务来解决这个问题,因为本来本来我的显存就是有限的。我现在好像只开了100K吧。
随便换了提示词,让ai给我个搞了个特别阴间主题的俄罗斯方块。。。。要笑死了。特效和音乐都是它自己生成的,巨阴间。
本地这模型因为量化原因,虽然审美普通,但理解你的话还是没啥问题的。
所以大家有条件的可以多玩玩,也就烧点电费了。
kinfox 发表于 2026-8-26 09:39
随便换了提示词,让ai给我个搞了个特别阴间主题的俄罗斯方块。。。。要笑死了。特效和音乐都是它自己生成 ...
这是一句话生成吗?有机会发代码出来看看吗?想看看它自由发挥时的代码质量如何。
新mac mini看上去也比较适合跑这个,而且新qwen flash好像也很适合本地跑,如果能和d老师比一比的话还是很心动的。
俄罗斯方块、贪吃蛇、扫雷,这类游戏对于LLM都是基础送分题吧
mintslime 发表于 2026-8-26 04:20
号脏了,换个新号走代理支付宝充钱试试,我的新号支付宝充目前还没事
是只要充钱走代理就行还是包括使用的场景也要用梯子?
号脏了都是怎么判断的
买码!注册! 发表于 2026-8-26 09:49
俄罗斯方块、贪吃蛇、扫雷,这类游戏对于LLM都是基础送分题吧
也不一定,我一直尝试了很多llm模型, 以前很多模型质量做出来特别简陋,而且慢。。包括以前的qwen3.5
现在这个模型就能在你需求上做的像模像样,已经是很大进步了。还有自己的审美,要知道这是质量损失很多的q4的小量化模型啊,3.8是强
让ai随手做的一句话直出的主题式,自由发挥的俄罗斯方块,想看代码或者想体验的可以试试。作为低q的量化模型来说,它算是很能干了。
LeoDT 发表于 2026-8-26 09:49
这是一句话生成吗?有机会发代码出来看看吗?想看看它自由发挥时的代码质量如何。
新mac mini看上去也比 ...
我发上来了。可以下载试试
特别想要灰测那个模型,现在很需要一个多模态,建模能力强的模型。灰测那个看起来就很不错。文峰事件连用 v4 fv 做实验都不敢
kitano 发表于 2026-8-26 09:21
搜索了一下发现有两个,一个400多KB,一个16MB,前者fork后者,最后选了更新时间更近的后者。装好一看, ...
刚好我昨天了解了一下这个东西,今天想给装上。能讲一下这两个的全名分别是什么吗?到时候避坑用。
如果已经有4090 24G电脑本地部署当然没问题,好歹尝尝鲜。
但是就现在显卡这个价格,为了部署AI配个4090电脑,感觉不值,还是api划算
neptunehs 发表于 2026-8-26 08:49
话说前面有人提到omp的webui 哪一家的?我搜到的github只有82 star
—— 来自 vivo V2561A, Android 16,...
就这个,他fork的piweb
cscbzcbz 发表于 2026-8-26 10:08
如果已经有4090 24G电脑本地部署当然没问题,好歹尝尝鲜。
但是就现在显卡这个价格,为了部署AI配个4090电 ...
是这样的,现在再买肯定不划算
😂我当年买4090纯粹只是为了跑跑大作游戏,谁知道现在拿来做工具,后面还遗憾为什么不中途换个5090
mp5 发表于 2026-8-26 09:23
24G显存跑Q4量化的qwen3.8 27B能开多大的上下文? 感觉稍微复杂点的东西没有200K以上Q8量化KV都是扛不住的 ...
我用5070ti感觉加上turboquant的有效上下文长度就64k,显存够开90k的但是到50k左右就只剩下20tk/s的输出速度了,不如开小点让它赶紧压缩算了
Znesmoc 发表于 2026-8-26 09:54
是只要充钱走代理就行还是包括使用的场景也要用梯子?
号脏了都是怎么判断的 ...
使用也要梯子,号脏了的话你充钱那个页面它会说你的地址不支持御三家的
kinfox 发表于 2026-8-26 08:45
我电脑就是个单显卡4090 24g的电脑…………跑q4_k_m 差不多60速度输出
qwen3.8是本地模型里面对家用显卡 ...
pi 的配置有吗
—— 来自 S1Fun
真红之闪电 发表于 2026-8-26 10:30
pi 的配置有吗
—— 来自 S1Fun
pi毫无配置。。我连skill都没装 就装了国内网友做的无限上下文压缩插件,就没有了。。模型本地部署是llm干的活,
来都来了 发表于 2026-8-26 10:03
刚好我昨天了解了一下这个东西,今天想给装上。能讲一下这两个的全名分别是什么吗?到时候避坑用。 ...
小的那个是@monotykamary/pi-vcc,大的那个是@sting8k/pi-vcc,小的是大的分支,文档相对更详细。虽然装了但还没用过,还在折腾如何持续停留在晋升状态和用更小的消耗搜索,目前用#8649的和pi-deepseek-search,但即使是文谷时段还是有点贵
—— 来自 Xiaomi 23054RA19C, Android 13, 鹅球 v4.0
模型名称 综合扣减倍率
GLM-5.3 2.29
GLM-5.2 0.90
GLM-5.1 1.33
GLM-5 1.08
DeepSeek-V4-Pro-0813 1.35
DeepSeek-V4-Pro 1.06
DeepSeek-V4-Flash 0.13
DeepSeek-V4-Flash-0731 0.61
Kimi-K3 4.12
Kimi-K2.7-Code 1.00
Kimi-K2.6 1.00
Kimi-K2.5 0.65
MiniMax-M3 0.43
MiniMax-M2.7 0.43
MiniMax-M2.5 0.30
Qwen3.8-max 2.00
国算的v4f正式版是不是涨价了 go的降智 基元的卡现在哪里有便宜又好用的v4f呢有v4fv就更好了
gpt5.6 sol真的是宇宙级别的不说人话+思路清奇,这几天做各种性能调试,各种造自己的黑话词汇,想看懂必须得让他主动解释所有的概念,强迫让人主动放弃思考。用久了真的想爆炒altman老冯
minimax免费爽蹬是爽了 智力真是不够 v4fv跑两次能解决的他一个上午还在转
不过反正免费 不强求
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
neptunehs 发表于 2026-8-26 10:53
minimax免费爽蹬是爽了 智力真是不够 v4fv跑两次能解决的他一个上午还在转
不过反正免费 不强求
是gmicloud那吗 吐字速度怎么样
唠叨 发表于 2026-8-26 10:46
模型名称 综合扣减倍率
GLM-5.3 2.29
GLM-5.2 0.90
试一下runinfra的
Re:Source