电车
精华
|
战斗力 鹅
|
回帖 0
注册时间 2024-11-12
|
长上下文(227K token prompt,256K 原生档,needle 测试)
请求 prompt prefill 耗时/速度 decode MTP 接受 命中率 盘读
串行 #A 227,843 61.42 s / 3709.4 t/s 80 tok @ 82.6 t/s 47/62 (75.8%) 96.5% 1302 blob
串行 #B 227,846 61.24 s / 3720.4 t/s 80 tok @ 96.2 t/s 53/76 (69.7%) 97.2% 2604 blob
串行 #C 227,855 61.49 s / 3705.7 t/s 80 tok @ 117.3 t/s 55/69 (79.7%) 98.9% 3906 blob
并发 #A 227,843 61.60 s / 3699.0 t/s 80 tok @ 108.4 t/s 50/65 (76.9%) 98.3% 5208 blob
并发 #B 227,846 61.77 s / 3688.8 t/s 65 tok @ 128.2 t/s 44/51 (86.3%) 98.7% 6510 blob
并发 #C 227,855 61.92 s / 3679.9 t/s 73 tok @ 124.1 t/s 48/61 (78.7%) 99.0% 7812 blob
关键观察:
prefill 速度在 227K 长度下并发零劣化(3709 → 3680 t/s,-0.8% 在噪声内)
decode 从短文 96 → 长文 108-128 t/s 不降反升(MTP 接受率 55%→79%,长文重复结构利于草稿命中)
专家命中率随使用自适应爬升:96.5%(首条 227K)→ 99.0%(第六条)——adaptive swap 把热专家持续换进显存,盘读是"预热代价"不是稳态
单路 227K 全流程(prefill+decode)62-63 s
震惊瘫坐,q4精度100多token 227kprompt,predill+decode只要一分钟。而且显存占用64G,内存116G。速度比之前的双pro5000 72Gq4部署方案要快一倍多。这方案比之前27b fp8方案都要好很多了。毕竟3.8 flashnext q4权重118G,而27b fp8只有29G,同样条件220kprompt下,速度比flashnext q4慢30%。 |
|