tonyunreal 发表于 2026-8-26 21:44
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
1比特量化版72.5GB
1比特这能干啥
晚上接着搓结果会话里完全把昨天晚上干的活全部忘了
这会倒是想起来自己是多模态模型了
看来还得去试试看坛友的方案用pi看看
塞不进单spark,很坏
牛来呢,还发吗?
pi vcc+64K上下文的qwen3.8 27b测试完了,长任务触发了2次上下文压缩也没有出现跑偏,装了思考修复之后也是该思考就思考该写就写,不像之前那样拼命在思维链里面打草稿了
16G显卡+apex mini量化完全可用,除了坐在电脑旁边被热风吹的很不爽以外没啥毛病
牛来听说智谱plan已经能蹬了
但是价钱没出来
—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99
https://z.ai/blog/glm-5.3-flash
牛来的官方博文
—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99
本帖最后由 qwased 于 2026-8-26 22:10 编辑
320B这个表现感觉就一般了啊,不知道ds4fv是多大的
with all of this traffic served on Chinese AI chips.草,华子给了多少卡啊,这么能顶
牛来的api价格有了么?
本帖最后由 tonyunreal 于 2026-8-26 22:12 编辑
价钱大概拉了,激活参数18B
opencode go只给flash一半的额度,官方文章也只说cost per task比flash略低
opencode的ox已经结束了。
好不容易今天ox快起来了 一天不到就没了 哎
—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
https://bigmodel.cn/pricing
智谱的api文档更新了
输入0.8块输出2.8块,前两周再半价
好像神了?
tonyunreal 发表于 2026-8-26 22:14
https://bigmodel.cn/pricing
智谱的api文档更新了
缓存0.23, 这是一坨💩
https://docs.bigmodel.cn/cn/coding-plan/overview
plan里按输入2.3块输出8块抵扣,何意味
本帖最后由 Azcarlo 于 2026-8-26 22:35 编辑
glm 5.3 flash这规模也没比dsv4 flash小啊,推理真能便宜吗?
倒是qwen 3.8 flash deltanet+sparse attention 而且是120b相当利好推理
哦草好像不对,怎么qwen还要额外接一个51B的engram,那接近200b了
— from Xiaomi 23127PN0CC, Android 16, S1 Next Goose v3.5.99
tonyunreal 发表于 2026-8-26 22:14
https://bigmodel.cn/pricing
智谱的api文档更新了
官方不给多模态是何意味?
tonyunreal 发表于 2026-8-26 22:14
https://bigmodel.cn/pricing
智谱的api文档更新了
你们都不看缓存的吗
这命中缓存的价格,感觉agent场景便宜不了啊
性能这么强?等今晚两个模型的对比了
Azcarlo 发表于 2026-8-26 22:16
glm 5.3 flash这规模也没比dsv4 flash小啊,推理真能便宜吗?
倒是qwen 3.8 flash deltanet+sparse attenti ...
看博客说是国产卡的数据中心发力了,拿了一万张以上的国产卡跑的,成本比肩n卡
原来智谱缓存那么贵,我就说套餐里开始讨论的时候感觉还挺耐用的, 怎么到执行阶段一下就没了
qwased 发表于 2026-8-26 22:09
320B这个表现感觉就一般了啊,不知道ds4fv是多大的
草,华子给了多少卡啊,这么能顶
好像智谱是对910系列做QAT的
—— 来自 HUAWEI SGT-AL50, Android 16, 鹅球 v3.4.97-alpha
本帖最后由 舞以 于 2026-8-26 22:27 编辑
以你比较典型的 0.5% output/input 来说:
$$ DS_{闲时}=0.0645+4.5\times0.005 =\mathbf{0.087} $$ $$ GLM_{促销}=0.11785+1.4\times0.005 =\mathbf{0.12485} $$
所以促销期间,GLM 仍然比 DS 闲时贵:
$$ 0.12485/0.087\approx1.44 $$
也就是 贵约 44%。
但 GLM 又明显比 DS 高峰便宜:
$$ 0.12485/0.174\approx0.718 $$
大概便宜 28%。
于是促销期间,在你这种 workload 下就是:
DS 闲时 < GLM 5.3 Flash < DS 高峰。
更重要的是促销结束之后。GLM 恢复原价,0.5% 输出率:
$$ GLM=0.2357+2.8\times0.005 =0.2497 $$
此时:
DS 闲时:0.087
DS 高峰:0.174
GLM:0.2497
也就是说,GLM 原价甚至比 DeepSeek 高峰价还贵约 43.5%,是 DS 闲时的约 2.87 倍。
考虑到输入缓存率在长程任务一般99%以上,就看漏油的输出/输入比是多少了,我的是不到1%。
牛来的输出便宜,缓存输入贵。
gpt算的,感觉眼下可以梁文峰时期用一下?梁文谷还是用fve。
和grok一样的情况,报的时候只报输入输出价格…
所以qwen的实测呢,牛来就算了
太开心了,马上能用到新开源模型了
哦,牛来的api还是纯文本?
如果不是glm草台了,那真的不如继续孝敬梁叔叔了
应该是草台了,它刚发的演示视频全是在展示视觉应用场景
虽然各家的flash很让人兴奋,但是还是想要下一个K3级别的模型啊Re:Source
还在藏?opencode上不是多模态的吗?还是说多模态改得再加钱
所以glm的页面也是ai在维护
这个glm 5.3 flash,6bit可以跑在72G显存下,其他专家可以放在ddr5内存里。还是很人性的。
cscbzcbz 发表于 2026-8-26 22:35
还在藏?opencode上不是多模态的吗?还是说多模态改得再加钱
那个多模态就非常迷 喂小图可以大图就断链
缓存不改,依然是要找梁叔叔
【单价】
项目GLM5.3flashDS4FV高峰期DS4FV低谷期
输入(命中缓存)0.23元/百万0.1元/百万0.05元/百万
输入(未命中)0.8元/百万3元/百万1.5元/百万
输出2.8元/百万9元/百万4.5元/百万
【费用明细】(基于2026-08-26当天用量:命中192,112,000 / 未命中1,172,179 / 输出711,031)
费用项目GLM5.3flashDS4FV高峰期DS4FV低谷期
输入(命中缓存)44.19元19.21元9.61元
输入(未命中)0.94元3.52元1.76元
输出1.99元6.40元3.20元
总费用47.11元29.13元14.56元
舞以 发表于 2026-8-26 22:33
哦,牛来的api还是纯文本?
如果不是glm草台了,那真的不如继续孝敬梁叔叔了 ...
不是有vision吗
过去一周,我们已在一个大规模的中国AI芯片集群上运行GLM-5.3-Flash,支持高带宽互连和针对底层硬件优化的服务栈。
在集群规模下,我们的生产级编码-预填充-解码(EPD)拆分架构将多模编码、提示预填充和逐符号解码分离为独立调度且可扩展的工作池,实现数万台国产加速器的高效可靠服务。
与同一硬件的初始基线相比,我们在端到端服务性能提升了3×,实现了与主流NVIDIA GPU相当的硬件效率和单代币成本。这表明中国芯片能够高效且经济地大规模支持前沿模型推断。
开蹬了,我发现在扣新用户权益的2百万token
说起来现在看来年初的dgs spark是不是已经算是性价比产品了;
小型化,能单台装dsv4f有点后悔年初没有让朋友从美帝带回来
下一个k3级可能是hy4?
不能只看缓存价格,还得看缓存时间,记得之前有人测的 glm 并不长,deepseek
可以到好几个小时甚至按天算。而且不知道为啥他一个 flash 的输出速度才 50 多。
当然也要看看实际能力差距拉的有多大,至少现在 5.3flash 的前端应该比 v4f 好不少
—— 来自 vivo V2405A, Android 15, 鹅球 v4.0-alpha
藤子又不需要炒作,不会上超大模型的,hy4能实现flash-0731的能力就可以了。
hy现在看起来还是挺稳步迭代的
论坛助手,iPhone