实测用apex确实能长上下文,要是也支持mtp就好了,40左右t/s感觉还是稍微有点慢
马一下,之前都说要32g才好用就没折腾,感觉可以试试了
—— 来自 vivo V2454A, Android 16, 鹅球 v3.5.99
三壮同志 发表于 2026-8-27 22:01
实测用apex确实能长上下文,要是也支持mtp就好了,40左右t/s感觉还是稍微有点慢 ...
nano可以开,上下文长度150K左右+MTP,吐字速度能到80tk/s
但是nano/iq3xxs这个级别的量化写调用工具的命令会时不时出错重写的,感觉智力堪忧,不太想用了
本帖最后由 qwased 于 2026-8-31 08:49 编辑
无效了,删掉
跑酒馆怎么样?
写涩文水平如何啊27b
—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha
用什么agent比较合适?试了接opencode蹬小游戏,感觉大部分计算都消耗在opencode的context处理上面了
处男鉴黄师 发表于 2026-8-28 01:16
用什么agent比较合适?试了接opencode蹬小游戏,感觉大部分计算都消耗在opencode的context处理上面了 ...
PI或者DSH,主楼那个搭配
tk553521 发表于 2026-8-28 01:09
写涩文水平如何啊27b
—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha
好像那种纯肉齁文用破限版还行,反正我感觉写的AI味大得不像人话
这个星期刚装好新电脑,然后昨天把旧电脑插了两张9060xt 16g凑够32gb显存,在ubuntu server下装了ollama和webui,然后试了一下用qwen3.8 27b写小说,蹦字的速度能接受,但是结果驴头不对马嘴,长篇幅写作每隔几段就会出现重复内容。要写长篇幅文字27b还是远不够啊。
写代码水平如何?能大致摸到V4F预览版的效果吗?
都跑通了,然后不知道干啥了
c月光咖啡 发表于 2026-8-28 11:14
写代码水平如何?能大致摸到V4F预览版的效果吗?
我觉得挺接近的了,不过设计能力会差很多,最好只让它根据文档实现
qwased 发表于 2026-8-28 11:31
我觉得挺接近的了,不过设计能力会差很多,最好只让它根据文档实现
规划要规划到什么程度?我之前用V4P规划,竟然直接抛开prompt写实现了,规划得太粗小模型又乱跑
c月光咖啡 发表于 2026-8-28 11:34
规划要规划到什么程度?我之前用V4P规划,竟然直接抛开prompt写实现了,规划得太粗小模型又乱跑 ...
只能自己试了,反正是本地模型指望不了太多
48G 显存的 A6000 适合哪个? 现在是 ollama + gemma4 31b。256k 上下文 会爆显存,所以现在控制在 200k。主要问题是速度很慢,经常思考 5 分钟。识别图片也会爆显存。就一个并发。
zktz 发表于 2026-8-29 10:52
48G 显存的 A6000 适合哪个? 现在是 ollama + gemma4 31b。256k 上下文 会爆显存,所以现在控制在 200k。 ...
q6或者q8吧,视觉也可以放回去显存了,tb4+4开262然后mtp应该刚好放下
qwased 发表于 2026-8-29 15:06
q6或者q8吧,视觉也可以放回去显存了,tb4+4开262然后mtp应该刚好放下
是这个意思么?./main -m qwen3.8‑27b‑vision‑q6_k.gguf \
--spec-type draft‑mtp \
-c 262144 \
--cache-type-k q8_0 --cache-type-v q8_0 \
‑‑n‑gpu‑layers 99
zktz 发表于 2026-8-29 15:31
是这个意思么?
--spec-draft-n-max 2 或者3
n卡和a卡应该区别不大吧?也能像楼主这样操作吗
—— 来自 HONOR BKQ-AN00, Android 16, 鹅球 v4.0
ljwlwd 发表于 2026-8-29 18:04
n卡和a卡应该区别不大吧?也能像楼主这样操作吗
—— 来自 HONOR BKQ-AN00, Android 16, 鹅球 v4.0 ...
llamacpp有提供rocm版,你找个在线模型帮你部署好就行
32g的5000ada还是老老实实的用q4量化版
cx_akns 发表于 2026-8-30 02:07
32g的5000ada还是老老实实的用q4量化版
尽量用q5以上的,智力确实是有差距的
DSH里部署好玩了一下,5070 Ti用的3.8 27B Apex Mini模型,遵从LZ的建议上下文开了60k,mmproj交给cpu。顺便让DSH做了个小插件,能够切换思考关和思考开模式。思考开模式做了个带bgm和音效的俄罗斯方块(经典的货郎bgm他一直生成不出,最后外援Gemini写好丢给qwen),调试修改了几轮后可以正常玩。现在准备做一个类以撒的roguelike小游戏,deepseek v4fv先搭好骨架,然后qwen3.8 27B分别用思考开和思考关做进行对比测试
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
分别给apex mini/nano和DSV4F 0731用同一套编程题跑了分,给大家作为能力参考
题库:https://github.com/suncityldp/zx-bench
不错啊,这效果 Re:Source
白头盔 发表于 2026-8-30 23:55
不错啊,这效果 Re:Source
感觉真的很像更蠢的DSV4F,要是显存大点能用满血量化把智力拉起来就是DSV4F的能力了
调整了一下IQ3xxs的参数,跑分炸裂,速度稳定90tk/s跑完全程,上下文130K,还能说什么,给你了
D指导都说iq3xxs可用了
干嘛iq3比apexmini高的?
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
neptunehs 发表于 2026-8-31 08:59
干嘛iq3比apexmini高的?
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
看kl散度这两个差不多的,之前应该是启动参数有问题,我看加载上了就没管报错
改完参数没报错了它就性能爆炸了
qwased 发表于 2026-8-31 09:01
看kl散度这两个差不多的,之前应该是启动参数有问题,我看加载上了就没管报错
改完参数没报错了它就性能 ...
哪个参数那么严重
我回头也看下
hy3不免费后我只能靠qwen3.8来翻译了
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
本帖最后由 qwased 于 2026-8-31 09:56 编辑
neptunehs 发表于 2026-8-31 09:38
哪个参数那么严重
我回头也看下
hy3不免费后我只能靠qwen3.8来翻译了
set TURBO_AUTO_ASYMMETRIC=0
这个,不加的话kv量化会爆炸
不过我感觉这个模型翻译还是很烂啊,提取术语表自己手改还行,翻译正文用hy mt2 7b吧
v100双32g可以开机搞一搞了
小ghoul 发表于 2026-8-31 09:56
v100双32g可以开机搞一搞了
v100好像有移植版的ninfer,单卡跑就行
qwased 发表于 2026-8-31 09:55
set TURBO_AUTO_ASYMMETRIC=0
这个,不加的话kv量化会爆炸
不是翻译正文 是我找到错误的地方让ai批量用工具改
hy2 mt翻译各种忽略术语表各种不翻译生造词(哪怕术语表有)
不敢用
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
neptunehs 发表于 2026-8-31 10:12
不是翻译正文 是我找到错误的地方让ai批量用工具改
hy2 mt翻译各种忽略术语表各种不翻译生造词(哪怕术 ...
我感觉7b q8倒是还好,或者你试试30a4b那个版本
反正人工校核是跑不掉的,我现在翻译主力是薅的ds3.2,稍微核对下就非常舒服了
qwased 发表于 2026-8-31 08:50
调整了一下IQ3xxs的参数,跑分炸裂,速度稳定90tk/s跑完全程,上下文130K,还能说什么,给你了
D指导都说i ...
用的什么参数,IQ3xxs这么炸裂
非教徒 发表于 2026-8-31 10:26
用的什么参数,IQ3xxs这么炸裂
更新到主楼了
大暴死 发表于 2026-8-27 18:09
挺好,有空捣鼓一下,我是10850k+5070 Ti+64G DDR4。之前本地跑了qwen3.6 27B Q4 XS with MTP,上下文只敢 ...
请问一下这样部署需要占多大存储空间?32G内存电脑能跑吗,我是583+5070TI
我感觉QWEN现在越来越蠢了,25年用的时候简直惊艳,现在感觉话都听不明白。另外搭车问一下,如果要本地部署AI,是自己专门搭个平台跑还是可以搞一台机器平时既可以玩游戏又能挂AI?