七氷 发表于 2026-8-26 08:16

plus 5小时回来了

厍无春 发表于 2026-8-26 08:30

舞以 发表于 2026-8-26 00:30
都更新了:三个模式分别是flash正式版、pro正式版和这个flash的多模态exp模型 ...

快速模式没改正式版,还是预览版。识图模式倒是正式版。未来应该是直接用识图模式替代快速模式了

Gmlazy 发表于 2026-8-26 08:41

kinfox 发表于 2026-8-25 23:43
今晚测了一下,用pi来接本地的模型qwen3.8,找到一个很不错的q4量化模型,跑起来特别顺。速度可以到60,70 ...

朋友什么配置啊,本地模型都这么强了吗,我还以为本地模型也就能聊天。

kinfox 发表于 2026-8-26 08:44

qwased 发表于 2026-8-26 00:02
你用的是哪个模型,apex吗
我现在感觉有pi vcc这种压缩上下文的插件之后确实上下文长度需求低多了,反正 ...

fraQtl HiFi Q4_K_M   这个是我挑选了数十个量化模型后,找到的最适合我配置的最强q4。。。

jinuzuktII 发表于 2026-8-26 08:44

梯子线路问题,换线路

kinfox 发表于 2026-8-26 08:45

Gmlazy 发表于 2026-8-26 08:41
朋友什么配置啊,本地模型都这么强了吗,我还以为本地模型也就能聊天。 ...

我电脑就是个单显卡4090 24g的电脑…………跑q4_k_m 差不多60速度输出
qwen3.8是本地模型里面对家用显卡最友好的了,我这几天跑了好多游戏出来,
最快的时候,一个俄罗斯方块2分钟,质量奇高,还没有bug……

neptunehs 发表于 2026-8-26 08:49

本帖最后由 neptunehs 于 2026-8-26 08:56 编辑


话说前面有人提到omp的webui 哪一家的?我搜到的github只有82 star

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

kinfox 发表于 2026-8-26 08:52

本地部署绝对不是只能玩聊天的东西啊…………很强的,拿来做小任务的平替没啥问题。
我直接一句话扔给它,几分钟就可以出一个完整可玩流畅的,它自己设计玩法的东西。
pi+qwen3.8的量化模型就是家庭用户现在的最好选择了……

蜇灵 发表于 2026-8-26 09:00

kinfox 发表于 2026-8-26 08:52
本地部署绝对不是只能玩聊天的东西啊…………很强的,拿来做小任务的平替没啥问题。
我直接一句话扔给它, ...

显存和内存需求量大吗?

kinfox 发表于 2026-8-26 09:02

蜇灵 发表于 2026-8-26 09:00
显存和内存需求量大吗?

我显卡24g的4090,现在日常占用是21.7

绝地潜兵 发表于 2026-8-26 09:04

千问的27B小模型真强啊

Gmlazy 发表于 2026-8-26 09:15

kinfox 发表于 2026-8-26 09:02
我显卡24g的4090,现在日常占用是21.7

又学到了。
我是4090D也来试试。

kitano 发表于 2026-8-26 09:21

scikirbypoke 发表于 2026-8-25 18:27
pi-vcc特别好用,无llm调用的结构化快速压缩,还有让ai能搜整个上下文的回忆功能 ...

搜索了一下发现有两个,一个400多KB,一个16MB,前者fork后者,最后选了更新时间更近的后者。装好一看,好家伙把演示用的gif塞了进去,足足15MB大,主体还是只有400多KB,赶在ai塞屎山之前先给我拉一坨是吧。

—— 来自 Xiaomi 23054RA19C, Android 13, 鹅球 v4.0

nianiania 发表于 2026-8-26 09:22

我艹啊,codex的重置卡变成只能加5小时了,史诗级削弱

mp5 发表于 2026-8-26 09:23

kinfox 发表于 2026-8-26 09:02
我显卡24g的4090,现在日常占用是21.7

24G显存跑Q4量化的qwen3.8 27B能开多大的上下文? 感觉稍微复杂点的东西没有200K以上Q8量化KV都是扛不住的

scikirbypoke 发表于 2026-8-26 09:24

kitano 发表于 2026-8-26 09:21
搜索了一下发现有两个,一个400多KB,一个16MB,前者fork后者,最后选了更新时间更近的后者。装好一看, ...

400k那个好像功能更多,反正更新时间也差不多

UmarIbnLaAhad 发表于 2026-8-26 09:31

这是在搞拿plus羊毛号做中转站的吧,无论之前路由弱智模型还是削重置卡都是这个逻辑,上次把好多用户误伤了果断滑跪,现在换了个思路

kinfox 发表于 2026-8-26 09:33

mp5 发表于 2026-8-26 09:23
24G显存跑Q4量化的qwen3.8 27B能开多大的上下文? 感觉稍微复杂点的东西没有200K以上Q8量化KV都是扛不住的 ...

只能靠拆解任务,压缩上下文,还有无限任务来解决这个问题,因为本来本来我的显存就是有限的。我现在好像只开了100K吧。

kinfox 发表于 2026-8-26 09:39


随便换了提示词,让ai给我个搞了个特别阴间主题的俄罗斯方块。。。。要笑死了。特效和音乐都是它自己生成的,巨阴间。
本地这模型因为量化原因,虽然审美普通,但理解你的话还是没啥问题的。
所以大家有条件的可以多玩玩,也就烧点电费了。

LeoDT 发表于 2026-8-26 09:49

kinfox 发表于 2026-8-26 09:39
随便换了提示词,让ai给我个搞了个特别阴间主题的俄罗斯方块。。。。要笑死了。特效和音乐都是它自己生成 ...

这是一句话生成吗?有机会发代码出来看看吗?想看看它自由发挥时的代码质量如何。

新mac mini看上去也比较适合跑这个,而且新qwen flash好像也很适合本地跑,如果能和d老师比一比的话还是很心动的。

买码!注册! 发表于 2026-8-26 09:49

俄罗斯方块、贪吃蛇、扫雷,这类游戏对于LLM都是基础送分题吧

Znesmoc 发表于 2026-8-26 09:54

mintslime 发表于 2026-8-26 04:20
号脏了,换个新号走代理支付宝充钱试试,我的新号支付宝充目前还没事

是只要充钱走代理就行还是包括使用的场景也要用梯子?
号脏了都是怎么判断的

kinfox 发表于 2026-8-26 09:57

买码!注册! 发表于 2026-8-26 09:49
俄罗斯方块、贪吃蛇、扫雷,这类游戏对于LLM都是基础送分题吧

也不一定,我一直尝试了很多llm模型, 以前很多模型质量做出来特别简陋,而且慢。。包括以前的qwen3.5
现在这个模型就能在你需求上做的像模像样,已经是很大进步了。还有自己的审美,要知道这是质量损失很多的q4的小量化模型啊,3.8是强

kinfox 发表于 2026-8-26 09:59

让ai随手做的一句话直出的主题式,自由发挥的俄罗斯方块,想看代码或者想体验的可以试试。作为低q的量化模型来说,它算是很能干了。

kinfox 发表于 2026-8-26 10:01

LeoDT 发表于 2026-8-26 09:49
这是一句话生成吗?有机会发代码出来看看吗?想看看它自由发挥时的代码质量如何。

新mac mini看上去也比 ...

我发上来了。可以下载试试

crow_wine 发表于 2026-8-26 10:02

特别想要灰测那个模型,现在很需要一个多模态,建模能力强的模型。灰测那个看起来就很不错。文峰事件连用 v4 fv 做实验都不敢

来都来了 发表于 2026-8-26 10:03

kitano 发表于 2026-8-26 09:21
搜索了一下发现有两个,一个400多KB,一个16MB,前者fork后者,最后选了更新时间更近的后者。装好一看, ...

刚好我昨天了解了一下这个东西,今天想给装上。能讲一下这两个的全名分别是什么吗?到时候避坑用。

cscbzcbz 发表于 2026-8-26 10:08

如果已经有4090 24G电脑本地部署当然没问题,好歹尝尝鲜。
但是就现在显卡这个价格,为了部署AI配个4090电脑,感觉不值,还是api划算

qwased 发表于 2026-8-26 10:10

neptunehs 发表于 2026-8-26 08:49
话说前面有人提到omp的webui 哪一家的?我搜到的github只有82 star

—— 来自 vivo V2561A, Android 16,...

就这个,他fork的piweb

kinfox 发表于 2026-8-26 10:10

cscbzcbz 发表于 2026-8-26 10:08
如果已经有4090 24G电脑本地部署当然没问题,好歹尝尝鲜。
但是就现在显卡这个价格,为了部署AI配个4090电 ...

是这样的,现在再买肯定不划算
😂我当年买4090纯粹只是为了跑跑大作游戏,谁知道现在拿来做工具,后面还遗憾为什么不中途换个5090

qwased 发表于 2026-8-26 10:16

mp5 发表于 2026-8-26 09:23
24G显存跑Q4量化的qwen3.8 27B能开多大的上下文? 感觉稍微复杂点的东西没有200K以上Q8量化KV都是扛不住的 ...

我用5070ti感觉加上turboquant的有效上下文长度就64k,显存够开90k的但是到50k左右就只剩下20tk/s的输出速度了,不如开小点让它赶紧压缩算了

mintslime 发表于 2026-8-26 10:19

Znesmoc 发表于 2026-8-26 09:54
是只要充钱走代理就行还是包括使用的场景也要用梯子?
号脏了都是怎么判断的 ...

使用也要梯子,号脏了的话你充钱那个页面它会说你的地址不支持御三家的

真红之闪电 发表于 2026-8-26 10:30

kinfox 发表于 2026-8-26 08:45
我电脑就是个单显卡4090 24g的电脑…………跑q4_k_m 差不多60速度输出
qwen3.8是本地模型里面对家用显卡 ...

pi 的配置有吗

—— 来自 S1Fun

kinfox 发表于 2026-8-26 10:36

真红之闪电 发表于 2026-8-26 10:30
pi 的配置有吗

—— 来自 S1Fun

pi毫无配置。。我连skill都没装 就装了国内网友做的无限上下文压缩插件,就没有了。。模型本地部署是llm干的活,

kitano 发表于 2026-8-26 10:38

来都来了 发表于 2026-8-26 10:03
刚好我昨天了解了一下这个东西,今天想给装上。能讲一下这两个的全名分别是什么吗?到时候避坑用。 ...

小的那个是@monotykamary/pi-vcc,大的那个是@sting8k/pi-vcc,小的是大的分支,文档相对更详细。虽然装了但还没用过,还在折腾如何持续停留在晋升状态和用更小的消耗搜索,目前用#8649的和pi-deepseek-search,但即使是文谷时段还是有点贵

—— 来自 Xiaomi 23054RA19C, Android 13, 鹅球 v4.0

唠叨 发表于 2026-8-26 10:46

模型名称        综合扣减倍率
GLM-5.3        2.29
GLM-5.2        0.90
GLM-5.1        1.33
GLM-5        1.08
DeepSeek-V4-Pro-0813        1.35
DeepSeek-V4-Pro        1.06
DeepSeek-V4-Flash        0.13
DeepSeek-V4-Flash-0731        0.61
Kimi-K3        4.12
Kimi-K2.7-Code        1.00
Kimi-K2.6        1.00
Kimi-K2.5        0.65
MiniMax-M3        0.43
MiniMax-M2.7        0.43
MiniMax-M2.5        0.30
Qwen3.8-max        2.00

国算的v4f正式版是不是涨价了   go的降智 基元的卡现在哪里有便宜又好用的v4f呢有v4fv就更好了

wesdrtfg 发表于 2026-8-26 10:49

gpt5.6 sol真的是宇宙级别的不说人话+思路清奇,这几天做各种性能调试,各种造自己的黑话词汇,想看懂必须得让他主动解释所有的概念,强迫让人主动放弃思考。用久了真的想爆炒altman老冯

neptunehs 发表于 2026-8-26 10:53

minimax免费爽蹬是爽了 智力真是不够 v4fv跑两次能解决的他一个上午还在转
不过反正免费 不强求

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

唠叨 发表于 2026-8-26 10:55

neptunehs 发表于 2026-8-26 10:53
minimax免费爽蹬是爽了 智力真是不够 v4fv跑两次能解决的他一个上午还在转
不过反正免费 不强求


是gmicloud那吗 吐字速度怎么样

王兰花秀丽 发表于 2026-8-26 10:57

唠叨 发表于 2026-8-26 10:46
模型名称        综合扣减倍率
GLM-5.3        2.29
GLM-5.2        0.90

试一下runinfra的

    Re:Source
页: 271 272 273 274 275 276 277 278 279 280 [281] 282 283 284 285 286 287 288 289 290
查看完整版本: Ox Alpha被认领,GLM-5.3-Flash上线|大模型讨论专楼