farAway 发表于 2026-8-31 10:52
我感觉QWEN现在越来越蠢了,25年用的时候简直惊艳,现在感觉话都听不明白。另外搭车问一下,如果要本地部署 ...
我觉得就按游戏机来搭好点,高强度用我是肯定用在线模型的在线模型和本地模型之间存在一堵高墙
farAway 发表于 2026-8-31 10:52
我感觉QWEN现在越来越蠢了,25年用的时候简直惊艳,现在感觉话都听不明白。另外搭车问一下,如果要本地部署 ...
简单任务可以自己机子弄。
但别一边玩大型游戏一边 ai 跑任务。容易爆显存
—— 来自 samsung SM-S9210, Android 16, 鹅球 v3.5.99
可惜了,我有1t内存,但是显卡不达标,只有8g
farAway 发表于 2026-8-31 10:52
我感觉QWEN现在越来越蠢了,25年用的时候简直惊艳,现在感觉话都听不明白。另外搭车问一下,如果要本地部署 ...
不同时占显存就行
dear81 发表于 2026-8-31 11:29
可惜了,我有1t内存,但是显卡不达标,只有8g
v100 2080ti之类的就行,可以跑很多flash模型了
这种小模型dense模型,q4量化和q8量化编码场景性能差距很大,至少q6起步
farAway 发表于 2026-8-31 10:49
请问一下这样部署需要占多大存储空间?32G内存电脑能跑吗,我是583+5070TI
LZ的qwen3.8 27B Apex I Mini模型就13.9G,多模态的mmproj文件1G左右让cpu跑,上下文64k以内的话正常情况全在显存里不会溢出到内存(tk/s不低于25就说明没问题)。不像minimax H3这种视频模型,哪怕32g显存的5090都没办法全在显存里跑。
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
qwased 发表于 2026-8-31 10:28
更新到主楼了
感谢,那我要试试IQ3XXS了,apex mini开思考,64k上下**点小任务还是慢了,关思考成品一坨
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
大暴死 发表于 2026-8-31 13:13
感谢,那我要试试IQ3XXS了,apex mini开思考,64k上下**点小任务还是慢了,关思考成品一坨
—— 来自 Xi ...
开了mtp能稳定90tk/s真有点用dsflash的味道了,就是依然要抽卡,如果一开始就想歪了就没救,得重开对话
让kimi按照楼主方案部署好了,昨晚让k3测试了一晚上(699快到期了没用完猛蹬),今天晚上试试咸淡
https://github.com/spiritbuun/buun-llama-cpp这个llamacpp可以处理图像的时候把视觉模型加载进来,处理完了再踢出去,理论上可以完美解决cpu处理视觉慢的问题,我试一下
32G能求问下上下文能拉到多少么
200k真感觉也就写个小程序了,做啥都不够用啊
jojog 发表于 2026-8-31 14:45
32G能求问下上下文能拉到多少么
200k真感觉也就写个小程序了,做啥都不够用啊 ...
tb4+4量化开到1m都行啊,但是能开不代表能用智力和解码速度都会巨幅衰减
优先用上下文管理插件和记忆文档来解决吧
jojog 发表于 2026-8-31 14:45
32G能求问下上下文能拉到多少么
200k真感觉也就写个小程序了,做啥都不够用啊 ...
用大参数模型写计划,agent用小参数模型起若干个subagent执行任务,,一般subagent用不到太大的上下文
—— 来自 HONOR MAA-AN10, Android 16, 鹅球 v3.5.99-debug
12g显存是否选Qwen3.8-27B-UD-Q2_K_XL.gguf?
内存有50g,再挤点应该能上50g,不知道够不够。
qwased 发表于 2026-8-31 13:46
开了mtp能稳定90tk/s真有点用dsflash的味道了,就是依然要抽卡,如果一开始就想歪了就没救,得重开对话 ...
多问一嘴,unsloth的IQ3 S和XXS在三分和实际应用场景是不是基本没区别,只差了1.1G
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
按照lz的配置自己又稍微修改了一下:
用 24G 显卡(4090 D),最终效果:Qwen3.8-27B 去审查(abliterated)+ 256K 上下文 + MTP 推测解码 + 思维链正常输出 + 实测最高 105 t/s
1. 硬件与环境:RTX 4090 D 24GB / i9-14900KF / 64GB RAM / Win11。把上下文可以顶到256K。
2. 模型与量化选择
huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF 的 UD-IQ3_XXS(10.26GB)——去审查版,保留工具调用能力
MTP 头:官方 unsloth/Qwen3.8-27B-GGUF 的 MTP/mtp-Qwen3.8-27B-Q4_0.gguf(1.28GB),与 abliterated 版实测兼容(同基模)
3. 分支与模板:同楼主——atomic-llama-cpp-turboquant(b10269-1.5.1,CUDA 12.4)+ 思维链补丁 froggeric(v22.4)
魔法师lain 发表于 2026-8-31 15:28
12g显存是否选Qwen3.8-27B-UD-Q2_K_XL.gguf?
内存有50g,再挤点应该能上50g,不知道够不够。 ...
内存足够大的话可以考虑上qwen3.8 next了,64G+12G可以保持15tk/s跑200K上下文+Q4量化你跑27b要么智力极低要么速度也是十几tk/s
https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF 这个模型宣称他们用IQ3XXS的大小实现了Q5级别的量化质量,尝尝咸淡 @魔法师lain 你也可以试试12G跑他的IQ2什么水平
可不可以由高级模型来规划出方案,然后用这个来执行?
diohanmilton 发表于 2026-8-31 22:15
可不可以由高级模型来规划出方案,然后用这个来执行?
你不嫌慢就行,我试过让网页的DSv4pro写计划给它实现,效果还不错
Qwen3.8-27B-GSQ-RCO-IQ3_XXS这个模型好像有点东西但是表现很奇怪,作者宣称编程能力对标满血bf16的,但是跑分经常会截断,做那些常见的测试demo也总是跑出来个华丽的壳子,核心功能不正常,不像ud iq3xxs会跑个简陋但是能用的东西
测试分倒是很高
大暴死 发表于 2026-8-31 13:11
LZ的qwen3.8 27B Apex I Mini模型就13.9G,多模态的mmproj文件1G左右让cpu跑,上下文64k以内的话正常情况 ...
实地部署能做啥,可以帮忙编程写PPT么,要一键生成的那种
farAway 发表于 2026-9-1 10:49
实地部署能做啥,可以帮忙编程写PPT么,要一键生成的那种
本地大模型开联网(duckduckgo)+comfyui调用z-image turbo生图做本地ppt的想法我实践过,最后效果不太行,还是改用DSH+dsv4f部署之前其他帖子里提到的Kimi ppt skill做ppt了,效果不能说很好至少可用
你自己写点小文,写点小工具甚至python arcade/h5小游戏玩玩还是可以的,反正我也没太多生产力需求就是玩玩
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
大暴死 发表于 2026-9-1 11:10
本地大模型开联网(duckduckgo)+comfyui调用z-image turbo生图做本地ppt的想法我实践过,最后效果不太行, ...
KIMI现在一脸死像,给钱都不收,它的PPT听说是真的好。
我用Qwen做了PPT,跟智障似的,完全不能理解意图。
我现在就想要个KIMI WORK一样的产品,一键生成报告,一键写CODE
qwased 发表于 2026-8-27 17:39
这是目前个人使用比较舒适的一个组合,仅供参考
最终效果:Qwen3.8 27B 保留视觉 + 长上下文(iq ...
请教LZ个问题,如果要开MTP,unsloth库里的mtp-Qwen3.8-27B-Q4(1.37GB)文件是必备的么,IQ3-S和IQ3-XXS没集成?
是的话那启动项参数里也要加 -md "./model/mtp-qwen3.8-27B-Q4_0.gguf" 这一项吧,但我让Gemini评估了一下,说IQ3-XXS+MTP+120k上下文无法全程锁在显存内
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
其实直接上llama跟用lmstudio比有啥优势 我还在用后者 昨晚碰到了一个神奇的bug毁掉了我一个opencode线程后就考虑要不要直接上llama
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
大暴死 发表于 2026-9-1 11:20
请教LZ个问题,如果要开MTP,unsloth库里的mtp-Qwen3.8-27B-Q4(1.37GB)文件是必备的么,IQ3-S和IQ3-XXS ...
除了iq2去掉mtp以外其他全部集成q4的mtp啊,独立的那个好像是q8的
我看评测说虽然mtp数学无损,但是量化到q4及以下的mtp上下文一长就会积累严重误差最终导致降智的
neptunehs 发表于 2026-9-1 11:22
其实直接上llama跟用lmstudio比有啥优势 我还在用后者 昨晚碰到了一个神奇的bug毁掉了我一个opencode线程后 ...
lmstudio不能把视觉塞给cpu跑
Ollama宣布涨价啊。
等等党别等了,我们失败了……
本帖最后由 qwased 于 2026-9-1 16:00 编辑
qwased 发表于 2026-9-1 05:35
Qwen3.8-27B-GSQ-RCO-IQ3_XXS这个模型好像有点东西但是表现很奇怪,作者宣称编程能力对标满血bf16的,但 ...
感觉发现问题了,这个模型好像中文奇差,用英文会好很多英文指令和IQ4XS比差不多了
qwased 发表于 2026-9-1 15:19
除了iq2去掉mtp以外其他全部集成q4的mtp啊,独立的那个好像是q8的
我看评测说虽然mtp数学无损,但是量化 ...
那奇怪了,昨天我想测测iQ3-S,启动参数里也加了
--spec-type draft-mtp
--spec-draft-n-max 2
但不论是我DSH里的测试,还是跑zx-bench都只有30-40 tk/s,llama-server控制台也没有spec_accpet_rate等mtp命中信息
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
大暴死 发表于 2026-9-1 16:40
那奇怪了,昨天我想测测iQ3-S,启动参数里也加了
--spec-type draft-mtp
--spec-draft-n-max 2
你确定你下的是ud iq3_s吗,我试了下没问题啊,mtp接受率70%左右
qwased 发表于 2026-9-1 15:40
感觉发现问题了,这个模型好像中文奇差,用英文会好很多英文指令和IQ4XS比差不多了 ...
拿来跑翻译不太行吗
—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99
魔法师lain 发表于 2026-9-1 22:28
拿来跑翻译不太行吗
—— 来自 HUAWEI ALT-AL10, Android 12, 鹅球 v3.5.99
我感觉qwen3.6 3.8的写作特别是中文特别恶心……还得是DS3.2
qwased 发表于 2026-9-1 16:57
你确定你下的是ud iq3_s吗,我试了下没问题啊,mtp接受率70%左右
我把上下文从100k改为84k就正常了,60-70tk/s这样...DSH里让dsv4fv出题,然后IQ3-XXS和S都think-on分别做题传给dsv4fv评判,同时把llama-server后台的tk/s和mtp接受率等信息也给到做综合评判。
题目上两边都对,只是S模型比XXS更严谨;速度上XXS 75-85tk/s,S是65-72tk/s,有差异但不算大。DSV4fv建议是用S模型跑智秀编程评测,理论表现会更好。我明天下班后跑跑看吧
—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
大暴死 发表于 2026-9-1 23:51
我把上下文从100k改为84k就正常了,60-70tk/s这样...DSH里让dsv4fv出题,然后IQ3-XXS和S都think-on分别做 ...
我让DS撸了个deepswe的启动器,慢慢跑完吧
现在比较好奇那个GSQ-RCO版,他宣称的是完整保留满血版的编程能力,但是我跑demo感觉不像
https://hf-mirror.com/ISTA-DASLa ... -RCO-GGUF/tree/main
喷了,这个IQ3_S没有不懂中文的毛病了,跑了几个常见DEMO非常炸裂,体感真的有Q5甚至Q6的量化水平
强烈推荐16G显存的坛友把模型换成这个IQ3_S-MTP
jojog 发表于 2026-8-31 14:45
32G能求问下上下文能拉到多少么
200k真感觉也就写个小程序了,做啥都不够用啊 ...
200k怎么可能还只能写小程序,现在主流coding agent默认也就开到200多k的上下文
—— 来自 LENOVO TB320FC, Android 15, 鹅球 v3.5.99-alpha
紧那罗 发表于 2026-9-2 06:17
200k怎么可能还只能写小程序,现在主流coding agent默认也就开到200多k的上下文
—— 来自 LENOVO TB320 ...
本地跑的时候上下文到80K左右decode速度就无法忍受了,而且百来K的时候触发上下文压缩都要等超久的prefill还是别干太重的活了,除非是睡觉之前挂着睡醒看结果那种