neptunehs 发表于 2026-9-19 08:11
Ternary Bonsai 2 27B有了 有人试试看吗
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
试了, 就我的主要使用场景(视觉理解)来说, 爽爆
用ninfer+三元量化,吞吐量 110 token/s , 占用显存10G
先比之前用ninfer拉的qwen3.8 , 77 的token/s , 占用显存20G ,而且实测了下视觉理解的质量没有太大下降
pf67 发表于 2026-9-28 15:42
试了, 就我的主要使用场景(视觉理解)来说, 爽爆
用ninfer+三元量化,吞吐量 110 token/s , 占用显存10G
bonsai只要不写代码都挺好的,工具调用也没什么大问题,乱杀9b 35a3b
就是写代码会流口水
qwased 发表于 2026-9-28 15:44
bonsai只要不写代码都挺好的,工具调用也没什么大问题,乱杀9b 35a3b
就是写代码会流口水 ...
连minimax m3.1这种写代码都会流口水
说真的写代码还是乖乖用那几家flash吧
但干其他的话那还是可以本地部署的
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
qwased 发表于 2026-9-28 12:05
核弹瘫坐,有64G内存的可以把27b扔进垃圾桶了
确实有点核弹瘫坐,达到50token/s,但我用IQ3_S,第一次鹈鹕脚是不动的,第2次动了但是是腿是伸长缩短在踏板上的,左腿透视是不对的。还是比不上我的16token Q4,快是真的快,用的128K,Q8KV
zhl1989666 发表于 2026-9-28 19:31
确实有点核弹瘫坐,达到50token/s,但我用IQ3_S,第一次鹈鹕脚是不动的,第2次动了但是是腿是伸长缩短在踏 ...
你用xhigh思考强度了吗,GSQ量化只保xhigh智力
qwased 发表于 2026-9-28 19:34
你用xhigh思考强度了吗,GSQ量化只保xhigh智力
我用它自带的界面,就是你截图的那个,那个有得选的吗?没看到
zhl1989666 发表于 2026-9-28 19:39
我用它自带的界面,就是你截图的那个,那个有得选的吗?没看到
你接个pi吧,聊天窗口写的他没法修正
本帖最后由 zhl1989666 于 2026-9-28 19:52 编辑
qwased 发表于 2026-9-28 19:46
你接个pi吧,聊天窗口写的他没法修正
我看到了,它聊天那里有个设置,齿轮图案的,默认就是HIGH,说明里也写了只有OFF\LOW\MEDIUM\HIGH,HIGH应该就是XHIGH了吧,这框架都默认用GSQ RCO了,不会傻乎乎的弄个不存在的HIGH进去吧
qwased 发表于 2026-9-28 12:05
核弹瘫坐,有64G内存的可以把27b扔进垃圾桶了
好耶。速度去下载来玩。我有64g内存和24g显存,应该可以跑个q3看看??
kinfox 发表于 2026-9-28 20:04
好耶。速度去下载来玩。我有64g内存和24g显存,应该可以跑个q3看看??
...
可以,直接IQ3S就行,最新版提高了32G显卡的效率(原来只优化了作者的5070)
qwased 发表于 2026-9-28 20:06
可以,直接IQ3S就行,最新版提高了32G显卡的效率(原来只优化了作者的5070) ...
但我看swift gsq版的也要76g啊。。
ds让我别碰先试试iq2的🙄
感觉被嫌弃了 唉
kinfox 发表于 2026-9-28 20:18
但我看swift gsq版的也要76g啊。。
ds让我别碰先试试iq2的🙄
感觉被嫌弃了 唉
有个30G的ngram表是放SSD的,那个是外置知识库
不过我用DSH接的话,虽然可以启动,但是第一条信息发出去直接报错内存耗尽,明明在框架自带的聊天界面就可以用。看来只能拿XXS接,再试试
zhl1989666 发表于 2026-9-28 20:24
不过我用DSH接的话,虽然可以启动,但是第一条信息发出去直接报错内存耗尽,明明在框架自带的聊天界面就可 ...
找个在线模型帮你调好吧
qwased 发表于 2026-9-28 20:19
有个30G的ngram表是放SSD的,那个是外置知识库
原来如此。。。一直没研究过。。。正好今天试试。
刚刚试玩。。。可以跑到70多k的速度。。好神奇啊!!!
kinfox 发表于 2026-9-28 22:22
原来如此。。。一直没研究过。。。正好今天试试。
刚刚试玩。。。可以跑到70多k的速度。。好神奇啊!!! ...
应该还能提升一下,朋友用的5090叫gpt根据以往的任务轨迹去调优专家加载策略,从70tps提升到110了
用IQ3S+xhigh基本就是满血api的体验了
qwased 发表于 2026-9-28 22:33
应该还能提升一下,朋友用的5090叫gpt根据以往的任务轨迹去调优专家加载策略,从70tps提升到110了
用IQ3S ...
我在努力让ai给我优化 看看能不能跑iq3s,,,现在这个iq2还是很抽象。。。
做出来的东西甚至还不如我有几个神奇量化版的3.8 27b的量化模型。。。很微妙
哇哈哈哈,我让hy4来优化,也优化到120了。这样就很爽了。
不过iq3我就别用了。。。等qwen4 27b出来吧。
还是最期待qwen4的
回错贴了
已部署qwen 3.8 flash next iq3_s,24g gpu+64g内存,但是简单测了下和本地部署的qwen 3.8 27b iq3_s好像成绩差不多,目前还在优化中:
题库测试(GSM8K 60 + MMLU 120 + ARC-C 60 = 240 题,题号与顺序完全一致)
xhigh 思考、temperature 0、max_tokens 2048、单请求串行(避免排队污染计时)。
| 配置 | GSM8K | MMLU | ARC-C | 合计 | 生成 tok/s |
|---|---:|---:|---:|---:|---:|
| Qwen3.8-27B IQ3_S(llama.cpp) | 55/60 | 113/120 | 60/60 | **228/240 = 95.0%** | 65.1 |
| **Flash-Next IQ3_S(Strata 0.1.20 + 标定)** | **56/60** | **112/120** | **60/60** | **228/240 = 95.0%** | **64.1** |
三壮同志 发表于 2026-9-29 10:24
已部署qwen 3.8 flash next iq3_s,24g gpu+64g内存,但是简单测了下和本地部署的qwen 3.8 27b iq3_s好像成 ...
MTP加了吗,可以叫agent调一下expert profile,能显著提升速度
strata支持多卡了
AI时代搓这种框架真的太快了
qwased 发表于 2026-9-29 10:48
MTP加了吗,可以叫agent调一下expert profile,能显著提升速度
感觉不是很理想:
两块都挖到底了。结论有点反直觉:**能调的都已在最优点**,剩下的空间被三处**上游实现限制**挡住了。下面是数据。
## 一、MTP:所有可调项都已在峰值
每个配置一次引擎重载,同一组中文+代码提示,2 轮取中位数:
| 旋钮 | 取值 → decode tok/s | 结论 |
|---|---|---|
| `--spec`(校验窗口) | 2→77.1 · 3→81.4 · **4→83.6** · 6→79.9 | **当前的 4 就是峰值** |
| `--spec-min-p` | 0.80→80.2 · 0.85→80.5 · **0.90→80.2** · 0.95→80.2 · **1.00→66.8** | 0.80~0.95 是平台期,0.90 正落在里面,没有提升空间 |
| `--mtp-max-t 3` | 80.7 | 更差 |
| `--spec 6 + --mtp-max-t 4` | 82.0 | 不如 spec 4 |
| `--suffix-draft 0` | 80.9 | prompt lookup 值约 **3%**,确认别关 |
草稿接受率:spec2=81.5%、spec3=77.3%、**spec4=75.5%**、spec6=72.0%。窗口越短接受率越高,但总吞吐仍以 4 最优——说明瓶颈已经不在"草稿准不准",而在"每次校验窗口的固定开销"。
**唯一没走通的方向:提高草稿头本身的分辨率。** 项目文档把 `mtp_pack.py --experts q4_0` 明确标成 "acceptance comparison arm",所以我构建了 1.597 GB 的 q4_0 草稿头(现在是 0.889 GB 的 q2_0)。结果:
```
mtp_rt.py: assert gu.shape == (NE, 2*FF, 720) → 实际 (512,1280,1440)
```
`mtp_rt.py` 把运行时 blob 布局**写死成 Q2_0**(`BLOB = 3*(H*FF*18//64)`),而引擎源码里**根本没有读取 `strata.mtp.expert_format`**。q4_0/q8_0 只能打包、无法加载。这是引擎侧要改的,不是配置问题。
## 二、专家画像:真正起作用的是「自适应」,而它已经在工作
| 配置 | decode tok/s | 缓存命中率 |
|---|---:|---:|
| auto 缓存(当前) | **83.6** | 82.6% |
| `--expert-cache 3000` | 64.4 | 64.5% |
| **关掉自适应**(`--adapt-every 100000`) | **58.2** | **53.3%** |
| `--adapt-every 1` | 80.4 | 83.2% |
**这是本轮最重要的发现:自适应机制值 +30%。** 关掉它,命中率从 82.6% 掉到 53.3%。也就是说**出厂画像单独只有 53% 的命中率,是自适应在线上把它拉到 82%** —— 「按你的真实流量定制画像」这件事,引擎已经自动在做,而且每 4 轮做一次。所以想"定制画像"的直觉是对的,但不必手动做。
顺带否掉两个假设:
- **画像跨层偏斜?不成立。** 我直接解析了 `expert-profile.bin`:前 5,870 项覆盖全部 48 层,每层 93~155 槽(均值 122,σ=14),前 200 项就覆盖了 44 层。出厂画像是均衡的,做均匀画像不会有收益。
- **那 2.5 GB 空闲显存能抢?不能。** `--expert-cache 7000` 确实拿到 7,844 槽(+34%),但引擎自己报警 `0 MiB of VRAM free ... requests may stall` —— 那是留给图像编码器的。**auto 的保守是对的。**
## 三、更正:识图对文本速度的代价是 ~12%,不是我之前说的 ≈0
之前那次比较用了**两套不同的调优参数**,是无效对比。这次同一探针对照:
| | 专家缓存 | 4K decode(热态 3 次均值) |
|---|---:|---:|
| 开识图 | 5,870 槽 | **86.6** tok/s |
| 关识图 | 7,647 槽 | **98.8** tok/s |
图像编码器启动时占掉约 3.35 GiB(本来可以当专家缓存)。**这是个真实取舍**:
- `--vision gpu`(当前):每图 0.1–0.5 s,文本 **-12%**
- `--vision cpu`:文本全速,但每图 **10–30 s**
你的日常里图片是偶发的还是高频的?如果一周才几张,切 CPU 模式等于白捡 12%;如果经常发图,现在这样是对的。
## 四、三个值得提给上游的问题
1. **`--dump-routing` 对原生 IQ 包输出空文件** —— 只有单 token 路径 `drive_pool()`(`generate.cpp:462`)会写记录,原生包"runs verify windows only"(`:1845`)走 `drive_pool_multi()`(`:492`),它只 `++t->calls`。→ `tools/make_profile.py` 对 IQ3_S 这类模型**完全不可用**。
2. **`--expert-cache-per-layer` 与 `--expert-profile` 不兼容** —— 加上就启动失败:`ExpertCache::verify_slot: slot 0 differs from the arena at byte 0`。好消息是硬失败而不是算错。
3. **MTP 草稿头精度无法调整** —— 见上文,`mtp_rt.py` 写死 Q2_0,引擎不读格式元数据。
## 现状
模型已恢复到原配置(`spec 4 / spec-min-p 0.90 / pcie 0.05 / workers 16 / auto cache / 识图开`),健康检查通过,Pi 端到端正常。原始数据在 (/mnt/e/model/tune/sweep2.json)、(/mnt/e/model/tune/sweep3.json)、(/mnt/e/model/tune/sweep4.json),完整分析在 (/mnt/e/model/tune/REPORT.md) 第四轮。
坦白说,这轮**没有找到可落地的配置级提升**——但把"为什么没有"和"卡在哪"问清楚了,而且第 1、3 两个问题都是能提 issue、修完就有收益的(尤其草稿头精度,接受率从 75% 往上走空间不小)。
刚刚更新的版本把prefill提高到1800了,5090有3000,
把内存超频了,终于勉强摸到上百的速度……
—— 来自 HUAWEI SGT-AL10, Android 12, 鹅球 v4.0
测了一天,,,qwen3.8 flash nextiq3s这个表现很奇怪。。。难道是因为这个swift量化模型的问题吗。。我跑出来的结果很抽象,无论是鹈鹕测试还是建模测试
效果和我3wift-Qwen3.8-27B-IQ4_XS这个效果打的有来有回。。。甚至还不如它。
比如这个一句话做滑雪3d游戏,两个模型都一轮直出,时间都差不多做完,都可以正常运行游玩。。。
但flash连滑雪板都没有处理好,后者反而还像模像样。。。就很迷
明明参数和配置我都已经按照官方推荐和ai再优化达到最佳了。。速度前者也可以拉到100以上,但就是质量很奇怪
kinfox 发表于 2026-9-30 03:01
测了一天,,,qwen3.8 flash nextiq3s这个表现很奇怪。。。难道是因为这个swift量化模型的问题吗。。我 ...
swift就是会变得很弱智啊……不知道为什么很多人吹这个
我觉得27b的merkyor比swift强多了
你换回GSQ的IQ3S开XHIGH再做一次试试
这是我连到pi上一句话生成的,微妙的还行?https://p.sda1.dev/35/dfa3f396f73b629322acc0c23e999b1a/image.jpg
—— 来自 HUAWEI SGT-AL10, Android 12, 鹅球 v4.0
qwased 发表于 2026-9-30 03:05
swift就是会变得很弱智啊……不知道为什么很多人吹这个
我觉得27b的merkyor比swift强多了
你换回GSQ的IQ3 ...
虽然用了gsq的好了一点,但雷霆大思考真的好烦干活性价比太低了
我倒是找到一个特别神奇的版本。。。swift-Qwen3.8-27B-IQ4_XS
比我用过的任何一个版本产出的质量都稳定,甚至连审美建模上的水平都是最高了
速度也快。
好神奇。。。把gsq那一堆都打败了。
我去试试你说的merkyor 对比下
ukisai/Swift-1.5-Qwen3.8-27B-GGUF都说这个不错吧
但我看今天有这个了
ajgazin/Swift-1.5-Qwen3.8-27B-Uncensored-Dynamic-MTP-GGUF
不过这个Uncensored: 23/100 refusals against Swift 1.5's 98/100, KL divergence 0.0884 看着不知道行不行
有100t的next flash♿️,要啥27b🚲
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
umamusume 发表于 2026-9-30 15:24
有100t的next flash♿️,要啥27b🚲
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
100t next flash是什么配置?
umamusume 发表于 2026-9-30 15:24
有100t的next flash♿️,要啥27b🚲
—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
我的next flash跑起来不如27b让我太惆怅了😭
strata 这个项目有人用吗 目前看更新飞快 一天能出好几个版本
—— 来自 Xiaomi 24122RKC7C, Android 16, 鹅球 v4.0-alpha
5070ti ninfer gsq iq3xxs
上下文131k prefill1600 decode 100tps
复现出来了,开源社区天天都有新玩具感觉好爽
12G的显卡能跑啥呀,手里只有4070S,后悔当初没上大显存的卡
月亮上的珊瑚 发表于 2026-10-2 08:15
12G的显卡能跑啥呀,手里只有4070S,后悔当初没上大显存的卡
有大内存strata,没有就只能玩bonsai2了
qwased 发表于 2026-10-2 11:13
有大内存strata,没有就只能玩bonsai2了
大佬测过strata评分没?能有原版几成功力?
lzchen 发表于 2026-10-2 11:18
大佬测过strata评分没?能有原版几成功力?
感觉基本就是qoder给的flash毛病和qoder里面也差不多,莫名其妙的幻觉
qwased 发表于 2026-10-2 11:23
感觉基本就是qoder给的flash毛病和qoder里面也差不多,莫名其妙的幻觉
那也原来本地的27B强得多哈。。。推AGENT能基本推动了不?