三壮同志 发表于 2026-8-27 22:01

实测用apex确实能长上下文,要是也支持mtp就好了,40左右t/s感觉还是稍微有点慢

静哮苍穹 发表于 2026-8-27 22:16

马一下,之前都说要32g才好用就没折腾,感觉可以试试了

—— 来自 vivo V2454A, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-8-28 00:10

三壮同志 发表于 2026-8-27 22:01
实测用apex确实能长上下文,要是也支持mtp就好了,40左右t/s感觉还是稍微有点慢 ...

nano可以开,上下文长度150K左右+MTP,吐字速度能到80tk/s
但是nano/iq3xxs这个级别的量化写调用工具的命令会时不时出错重写的,感觉智力堪忧,不太想用了

qwased 发表于 2026-8-28 00:36

本帖最后由 qwased 于 2026-8-31 08:49 编辑

无效了,删掉

突发性哮喘病患 发表于 2026-8-28 00:52

跑酒馆怎么样?

tk553521 发表于 2026-8-28 01:09

写涩文水平如何啊27b

—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha

处男鉴黄师 发表于 2026-8-28 01:16

用什么agent比较合适?试了接opencode蹬小游戏,感觉大部分计算都消耗在opencode的context处理上面了

qwased 发表于 2026-8-28 01:23

处男鉴黄师 发表于 2026-8-28 01:16
用什么agent比较合适?试了接opencode蹬小游戏,感觉大部分计算都消耗在opencode的context处理上面了 ...

PI或者DSH,主楼那个搭配

qwased 发表于 2026-8-28 01:24

tk553521 发表于 2026-8-28 01:09
写涩文水平如何啊27b

—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha

好像那种纯肉齁文用破限版还行,反正我感觉写的AI味大得不像人话

Hibino 发表于 2026-8-28 08:24

这个星期刚装好新电脑,然后昨天把旧电脑插了两张9060xt 16g凑够32gb显存,在ubuntu server下装了ollama和webui,然后试了一下用qwen3.8 27b写小说,蹦字的速度能接受,但是结果驴头不对马嘴,长篇幅写作每隔几段就会出现重复内容。要写长篇幅文字27b还是远不够啊。

c月光咖啡 发表于 2026-8-28 11:14

写代码水平如何?能大致摸到V4F预览版的效果吗?

子虚乌有 发表于 2026-8-28 11:27

都跑通了,然后不知道干啥了

qwased 发表于 2026-8-28 11:31

c月光咖啡 发表于 2026-8-28 11:14
写代码水平如何?能大致摸到V4F预览版的效果吗?

我觉得挺接近的了,不过设计能力会差很多,最好只让它根据文档实现

c月光咖啡 发表于 2026-8-28 11:34

qwased 发表于 2026-8-28 11:31
我觉得挺接近的了,不过设计能力会差很多,最好只让它根据文档实现

规划要规划到什么程度?我之前用V4P规划,竟然直接抛开prompt写实现了,规划得太粗小模型又乱跑

qwased 发表于 2026-8-28 11:42

c月光咖啡 发表于 2026-8-28 11:34
规划要规划到什么程度?我之前用V4P规划,竟然直接抛开prompt写实现了,规划得太粗小模型又乱跑 ...

只能自己试了,反正是本地模型指望不了太多

zktz 发表于 2026-8-29 10:52

48G 显存的 A6000 适合哪个? 现在是 ollama + gemma4 31b。256k 上下文 会爆显存,所以现在控制在 200k。主要问题是速度很慢,经常思考 5 分钟。识别图片也会爆显存。就一个并发。

qwased 发表于 2026-8-29 15:06

zktz 发表于 2026-8-29 10:52
48G 显存的 A6000 适合哪个? 现在是 ollama + gemma4 31b。256k 上下文 会爆显存,所以现在控制在 200k。 ...

q6或者q8吧,视觉也可以放回去显存了,tb4+4开262然后mtp应该刚好放下

zktz 发表于 2026-8-29 15:31

qwased 发表于 2026-8-29 15:06
q6或者q8吧,视觉也可以放回去显存了,tb4+4开262然后mtp应该刚好放下

是这个意思么?./main -m qwen3.8‑27b‑vision‑q6_k.gguf \
--spec-type draft‑mtp \
-c 262144 \
--cache-type-k q8_0 --cache-type-v q8_0 \
‑‑n‑gpu‑layers 99

qwased 发表于 2026-8-29 15:49

zktz 发表于 2026-8-29 15:31
是这个意思么?

--spec-draft-n-max 2 或者3

ljwlwd 发表于 2026-8-29 18:04

n卡和a卡应该区别不大吧?也能像楼主这样操作吗

—— 来自 HONOR BKQ-AN00, Android 16, 鹅球 v4.0

qwased 发表于 2026-8-29 18:38

ljwlwd 发表于 2026-8-29 18:04
n卡和a卡应该区别不大吧?也能像楼主这样操作吗

—— 来自 HONOR BKQ-AN00, Android 16, 鹅球 v4.0 ...

llamacpp有提供rocm版,你找个在线模型帮你部署好就行

cx_akns 发表于 2026-8-30 02:07

32g的5000ada还是老老实实的用q4量化版

qwased 发表于 2026-8-30 02:12

cx_akns 发表于 2026-8-30 02:07
32g的5000ada还是老老实实的用q4量化版

尽量用q5以上的,智力确实是有差距的

大暴死 发表于 2026-8-30 02:40

DSH里部署好玩了一下,5070 Ti用的3.8 27B Apex Mini模型,遵从LZ的建议上下文开了60k,mmproj交给cpu。顺便让DSH做了个小插件,能够切换思考关和思考开模式。思考开模式做了个带bgm和音效的俄罗斯方块(经典的货郎bgm他一直生成不出,最后外援Gemini写好丢给qwen),调试修改了几轮后可以正常玩。现在准备做一个类以撒的roguelike小游戏,deepseek v4fv先搭好骨架,然后qwen3.8 27B分别用思考开和思考关做进行对比测试

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-8-30 23:13


分别给apex mini/nano和DSV4F 0731用同一套编程题跑了分,给大家作为能力参考

题库:https://github.com/suncityldp/zx-bench





白头盔 发表于 2026-8-30 23:55

不错啊,这效果    Re:Source

qwased 发表于 2026-8-30 23:59

白头盔 发表于 2026-8-30 23:55
不错啊,这效果    Re:Source

感觉真的很像更蠢的DSV4F,要是显存大点能用满血量化把智力拉起来就是DSV4F的能力了

qwased 发表于 2026-8-31 08:50


调整了一下IQ3xxs的参数,跑分炸裂,速度稳定90tk/s跑完全程,上下文130K,还能说什么,给你了
D指导都说iq3xxs可用了





neptunehs 发表于 2026-8-31 08:59

干嘛iq3比apexmini高的?

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

qwased 发表于 2026-8-31 09:01

neptunehs 发表于 2026-8-31 08:59
干嘛iq3比apexmini高的?

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

看kl散度这两个差不多的,之前应该是启动参数有问题,我看加载上了就没管报错
改完参数没报错了它就性能爆炸了

neptunehs 发表于 2026-8-31 09:38

qwased 发表于 2026-8-31 09:01
看kl散度这两个差不多的,之前应该是启动参数有问题,我看加载上了就没管报错
改完参数没报错了它就性能 ...

哪个参数那么严重
我回头也看下
hy3不免费后我只能靠qwen3.8来翻译了

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

qwased 发表于 2026-8-31 09:55

本帖最后由 qwased 于 2026-8-31 09:56 编辑

neptunehs 发表于 2026-8-31 09:38
哪个参数那么严重
我回头也看下
hy3不免费后我只能靠qwen3.8来翻译了

set TURBO_AUTO_ASYMMETRIC=0

这个,不加的话kv量化会爆炸

不过我感觉这个模型翻译还是很烂啊,提取术语表自己手改还行,翻译正文用hy mt2 7b吧

小ghoul 发表于 2026-8-31 09:56

v100双32g可以开机搞一搞了

qwased 发表于 2026-8-31 10:00

小ghoul 发表于 2026-8-31 09:56
v100双32g可以开机搞一搞了

v100好像有移植版的ninfer,单卡跑就行

neptunehs 发表于 2026-8-31 10:12

qwased 发表于 2026-8-31 09:55
set TURBO_AUTO_ASYMMETRIC=0

这个,不加的话kv量化会爆炸

不是翻译正文 是我找到错误的地方让ai批量用工具改

hy2 mt翻译各种忽略术语表各种不翻译生造词(哪怕术语表有)
不敢用

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

qwased 发表于 2026-8-31 10:14

neptunehs 发表于 2026-8-31 10:12
不是翻译正文 是我找到错误的地方让ai批量用工具改

hy2 mt翻译各种忽略术语表各种不翻译生造词(哪怕术 ...

我感觉7b q8倒是还好,或者你试试30a4b那个版本
反正人工校核是跑不掉的,我现在翻译主力是薅的ds3.2,稍微核对下就非常舒服了

非教徒 发表于 2026-8-31 10:26

qwased 发表于 2026-8-31 08:50
调整了一下IQ3xxs的参数,跑分炸裂,速度稳定90tk/s跑完全程,上下文130K,还能说什么,给你了
D指导都说i ...

用的什么参数,IQ3xxs这么炸裂

qwased 发表于 2026-8-31 10:28

非教徒 发表于 2026-8-31 10:26
用的什么参数,IQ3xxs这么炸裂

更新到主楼了

farAway 发表于 2026-8-31 10:49

大暴死 发表于 2026-8-27 18:09
挺好,有空捣鼓一下,我是10850k+5070 Ti+64G DDR4。之前本地跑了qwen3.6 27B Q4 XS with MTP,上下文只敢 ...

请问一下这样部署需要占多大存储空间?32G内存电脑能跑吗,我是583+5070TI

farAway 发表于 2026-8-31 10:52

我感觉QWEN现在越来越蠢了,25年用的时候简直惊艳,现在感觉话都听不明白。另外搭车问一下,如果要本地部署AI,是自己专门搭个平台跑还是可以搞一台机器平时既可以玩游戏又能挂AI?
页: 1 [2] 3 4 5 6 7 8 9
查看完整版本: 16G显卡+qwen3.8 27B上下文200K,个人经验总结(更新llamacpp推荐)