找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] DeepSeek V4-Flash-Vision-Exp 上线!多模态来啦|大模型讨论专楼

 火.. [复制链接]
     
发表于 2026-8-26 21:50 | 显示全部楼层
tonyunreal 发表于 2026-8-26 21:44
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

1比特量化版72.5GB

1比特这能干啥
回复

使用道具 举报

     
发表于 2026-8-26 21:53 | 显示全部楼层
晚上接着搓结果会话里完全把昨天晚上干的活全部忘了
这会倒是想起来自己是多模态模型了
看来还得去试试看坛友的方案用pi看看
回复

使用道具 举报

     
发表于 2026-8-26 22:01 | 显示全部楼层
塞不进单spark,很坏
回复

使用道具 举报

     
发表于 2026-8-26 22:04 | 显示全部楼层
牛来呢,还发吗?
回复

使用道具 举报

     
发表于 2026-8-26 22:06 | 显示全部楼层
pi vcc+64K上下文的qwen3.8 27b测试完了,长任务触发了2次上下文压缩也没有出现跑偏,装了思考修复之后也是该思考就思考该写就写,不像之前那样拼命在思维链里面打草稿了
16G显卡+apex mini量化完全可用,除了坐在电脑旁边被热风吹的很不爽以外没啥毛病
回复

使用道具 举报

     
发表于 2026-8-26 22:06 来自手机 | 显示全部楼层
牛来听说智谱plan已经能蹬了
但是价钱没出来

—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-26 22:08 来自手机 | 显示全部楼层
https://z.ai/blog/glm-5.3-flash

牛来的官方博文

—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-26 22:09 | 显示全部楼层
本帖最后由 qwased 于 2026-8-26 22:10 编辑

320B这个表现感觉就一般了啊,不知道ds4fv是多大的

with all of this traffic served on Chinese AI chips.
草,华子给了多少卡啊,这么能顶
回复

使用道具 举报

     
发表于 2026-8-26 22:11 | 显示全部楼层
牛来的api价格有了么?
回复

使用道具 举报

     
发表于 2026-8-26 22:11 | 显示全部楼层
本帖最后由 tonyunreal 于 2026-8-26 22:12 编辑

价钱大概拉了,激活参数18B
opencode go只给flash一半的额度,官方文章也只说cost per task比flash略低
回复

使用道具 举报

     
发表于 2026-8-26 22:12 来自手机 | 显示全部楼层
opencode的ox已经结束了。
好不容易今天ox快起来了 一天不到就没了 哎

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-26 22:14 | 显示全部楼层
https://bigmodel.cn/pricing

智谱的api文档更新了
输入0.8块输出2.8块,前两周再半价

好像神了?
回复

使用道具 举报

     
发表于 2026-8-26 22:16 | 显示全部楼层
tonyunreal 发表于 2026-8-26 22:14
https://bigmodel.cn/pricing

智谱的api文档更新了

缓存0.23, 这是一坨💩
回复

使用道具 举报

     
发表于 2026-8-26 22:16 | 显示全部楼层
https://docs.bigmodel.cn/cn/coding-plan/overview
plan里按输入2.3块输出8块抵扣,何意味
回复

使用道具 举报

     
发表于 2026-8-26 22:16 来自手机 | 显示全部楼层
本帖最后由 Azcarlo 于 2026-8-26 22:35 编辑

glm 5.3 flash这规模也没比dsv4 flash小啊,推理真能便宜吗?
倒是qwen 3.8 flash deltanet+sparse attention 而且是120b相当利好推理
哦草好像不对,怎么qwen还要额外接一个51B的engram,那接近200b了

— from Xiaomi 23127PN0CC, Android 16, S1 Next Goose v3.5.99
回复

使用道具 举报

     
发表于 2026-8-26 22:18 | 显示全部楼层
tonyunreal 发表于 2026-8-26 22:14
https://bigmodel.cn/pricing

智谱的api文档更新了

官方不给多模态是何意味?
回复

使用道具 举报

     
发表于 2026-8-26 22:18 | 显示全部楼层
tonyunreal 发表于 2026-8-26 22:14
https://bigmodel.cn/pricing

智谱的api文档更新了

你们都不看缓存的吗
回复

使用道具 举报

     
发表于 2026-8-26 22:18 | 显示全部楼层
这命中缓存的价格,感觉agent场景便宜不了啊
回复

使用道具 举报

     
发表于 2026-8-26 22:18 | 显示全部楼层
性能这么强?等今晚两个模型的对比了

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-26 22:19 | 显示全部楼层
Azcarlo 发表于 2026-8-26 22:16
glm 5.3 flash这规模也没比dsv4 flash小啊,推理真能便宜吗?
倒是qwen 3.8 flash deltanet+sparse attenti ...

看博客说是国产卡的数据中心发力了,拿了一万张以上的国产卡跑的,成本比肩n卡
回复

使用道具 举报

     
发表于 2026-8-26 22:20 | 显示全部楼层
原来智谱缓存那么贵,我就说套餐里开始讨论的时候感觉还挺耐用的, 怎么到执行阶段一下就没了
回复

使用道具 举报

     
发表于 2026-8-26 22:21 来自手机 | 显示全部楼层
qwased 发表于 2026-8-26 22:09
320B这个表现感觉就一般了啊,不知道ds4fv是多大的

草,华子给了多少卡啊,这么能顶

好像智谱是对910系列做QAT的

—— 来自 HUAWEI SGT-AL50, Android 16, 鹅球 v3.4.97-alpha
回复

使用道具 举报

     
发表于 2026-8-26 22:25 | 显示全部楼层
本帖最后由 舞以 于 2026-8-26 22:27 编辑
以你比较典型的 0.5% output/input 来说:

$$ DS_{闲时}=0.0645+4.5\times0.005 =\mathbf{0.087} $$ $$ GLM_{促销}=0.11785+1.4\times0.005 =\mathbf{0.12485} $$

所以促销期间,GLM 仍然比 DS 闲时贵:

$$ 0.12485/0.087\approx1.44 $$

也就是 贵约 44%。

但 GLM 又明显比 DS 高峰便宜:

$$ 0.12485/0.174\approx0.718 $$

大概便宜 28%。

于是促销期间,在你这种 workload 下就是:

DS 闲时 < GLM 5.3 Flash < DS 高峰。

更重要的是促销结束之后。GLM 恢复原价,0.5% 输出率:

$$ GLM=0.2357+2.8\times0.005 =0.2497 $$

此时:

DS 闲时:0.087
DS 高峰:0.174
GLM:0.2497

也就是说,GLM 原价甚至比 DeepSeek 高峰价还贵约 43.5%,是 DS 闲时的约 2.87 倍。

考虑到输入缓存率在长程任务一般99%以上,就看漏油的输出/输入比是多少了,我的是不到1%。
牛来的输出便宜,缓存输入贵。
gpt算的,感觉眼下可以梁文峰时期用一下?梁文谷还是用fve。
回复

使用道具 举报

     
发表于 2026-8-26 22:28 来自手机 | 显示全部楼层
和grok一样的情况,报的时候只报输入输出价格…
回复

使用道具 举报

     
发表于 2026-8-26 22:28 | 显示全部楼层
所以qwen的实测呢,牛来就算了
回复

使用道具 举报

发表于 2026-8-26 22:30 | 显示全部楼层
太开心了,马上能用到新开源模型了
回复

使用道具 举报

     
发表于 2026-8-26 22:33 | 显示全部楼层
哦,牛来的api还是纯文本?
如果不是glm草台了,那真的不如继续孝敬梁叔叔了
回复

使用道具 举报

     
发表于 2026-8-26 22:34 | 显示全部楼层
应该是草台了,它刚发的演示视频全是在展示视觉应用场景  

虽然各家的flash很让人兴奋,但是还是想要下一个K3级别的模型啊  Re:Source
回复

使用道具 举报

     
发表于 2026-8-26 22:35 | 显示全部楼层
还在藏?opencode上不是多模态的吗?还是说多模态改得再加钱
回复

使用道具 举报

     
发表于 2026-8-26 22:35 | 显示全部楼层
所以glm的页面也是ai在维护   
回复

使用道具 举报

发表于 2026-8-26 22:41 | 显示全部楼层
这个glm 5.3 flash,6bit可以跑在72G显存下,其他专家可以放在ddr5内存里。还是很人性的。
回复

使用道具 举报

     
发表于 2026-8-26 22:41 | 显示全部楼层
cscbzcbz 发表于 2026-8-26 22:35
还在藏?opencode上不是多模态的吗?还是说多模态改得再加钱

那个多模态就非常迷 喂小图可以大图就断链
回复

使用道具 举报

     
发表于 2026-8-26 22:42 | 显示全部楼层
缓存不改,依然是要找梁叔叔


【单价】
项目GLM5.3flashDS4FV高峰期DS4FV低谷期
输入(命中缓存)0.23元/百万0.1元/百万0.05元/百万
输入(未命中)0.8元/百万3元/百万1.5元/百万
输出2.8元/百万9元/百万4.5元/百万


【费用明细】(基于2026-08-26当天用量:命中192,112,000 / 未命中1,172,179 / 输出711,031)
费用项目GLM5.3flashDS4FV高峰期DS4FV低谷期
输入(命中缓存)44.19元19.21元9.61元
输入(未命中)0.94元3.52元1.76元
输出1.99元6.40元3.20元
总费用47.11元29.13元14.56元
回复

使用道具 举报

     
发表于 2026-8-26 22:43 | 显示全部楼层
舞以 发表于 2026-8-26 22:33
哦,牛来的api还是纯文本?
如果不是glm草台了,那真的不如继续孝敬梁叔叔了 ...

不是有vision吗
回复

使用道具 举报

     
发表于 2026-8-26 22:43 来自手机 | 显示全部楼层
过去一周,我们已在一个大规模的中国AI芯片集群上运行GLM-5.3-Flash,支持高带宽互连和针对底层硬件优化的服务栈。
在集群规模下,我们的生产级编码-预填充-解码(EPD)拆分架构将多模编码、提示预填充和逐符号解码分离为独立调度且可扩展的工作池,实现数万台国产加速器的高效可靠服务。

与同一硬件的初始基线相比,我们在端到端服务性能提升了3×,实现了与主流NVIDIA GPU相当的硬件效率和单代币成本。这表明中国芯片能够高效且经济地大规模支持前沿模型推断。
回复

使用道具 举报

     
发表于 2026-8-26 22:46 | 显示全部楼层
开蹬了,我发现在扣新用户权益的2百万token
回复

使用道具 举报

     
发表于 2026-8-26 22:46 | 显示全部楼层
说起来现在看来年初的dgs spark是不是已经算是性价比产品了;
小型化,能单台装dsv4f有点后悔年初没有让朋友从美帝带回来
回复

使用道具 举报

     
发表于 2026-8-26 22:46 来自手机 | 显示全部楼层
下一个k3级可能是hy4?
回复

使用道具 举报

     
发表于 2026-8-26 22:48 来自手机 | 显示全部楼层
不能只看缓存价格,还得看缓存时间,记得之前有人测的 glm 并不长,deepseek
可以到好几个小时甚至按天算。而且不知道为啥他一个 flash 的输出速度才 50 多。
当然也要看看实际能力差距拉的有多大,至少现在 5.3flash 的前端应该比 v4f 好不少

—— 来自 vivo V2405A, Android 15, 鹅球 v4.0-alpha
回复

使用道具 举报

     
发表于 2026-8-26 22:50 | 显示全部楼层
藤子又不需要炒作,不会上超大模型的,hy4能实现flash-0731的能力就可以了。
hy现在看起来还是挺稳步迭代的

论坛助手,iPhone
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-27 09:37 , Processed in 0.135245 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表