找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] DeepSeek V4-Flash-Vision-Exp 上线!多模态来啦|大模型讨论专楼

 火.. [复制链接]
     
发表于 2026-8-26 22:51 | 显示全部楼层
misuzu0723 发表于 2026-8-26 22:48
不能只看缓存价格,还得看缓存时间,记得之前有人测的 glm 并不长,deepseek
可以到好几个小时甚至按天算。 ...

Z/这个价目表里有一列缓存时间-限时免费
就很灵性
回复

使用道具 举报

     
发表于 2026-8-26 22:52 | 显示全部楼层
本帖最后由 goranger 于 2026-8-26 22:53 编辑

智谱这个flash要把minimax斩杀到底了吧,有点想把minimax年付退掉了,本来看中他还有点多模态能力,而且老用户有个150%周限制,但其实在缓存命中低的场景下非常不耐用
回复

使用道具 举报

     
发表于 2026-8-26 22:53 | 显示全部楼层
cscbzcbz 发表于 2026-8-26 22:51
Z/这个价目表里有一列缓存时间-限时免费
就很灵性

又不是命中缓存免费, 是你的缓存存在他的硬盘上这部分给你免费
回复

使用道具 举报

     
发表于 2026-8-26 22:53 来自手机 | 显示全部楼层
缓存时间分档不还是a社干的,标准版5分钟一个小时版还要再贵。那智谱是真学啊
回复

使用道具 举报

     
发表于 2026-8-26 22:58 | 显示全部楼层
→熙← 发表于 2026-8-26 22:53
又不是命中缓存免费, 是你的缓存存在他的硬盘上这部分给你免费


所以我说很灵性
一眼看过去还以为缓存命中免费了,结果人说的是缓存的存储也要收费的哦,只是暂时给你免了
回复

使用道具 举报

     
发表于 2026-8-26 23:00 | 显示全部楼层
求助4070tis(16g显存)本地能跑什么模型目前智商比较高?对输出速度要求不高(能和kimi现在的垃圾速度打平就算成功),对上下文长度有点要求(有很多pdf要读,很多都是ocr文件,要经过前一个模型处理后再读的)
回复

使用道具 举报

     
发表于 2026-8-26 23:02 来自手机 | 显示全部楼层
拿我智谱清言的年卡来蹬一下5.3flash。。看看到底成色如何
回复

使用道具 举报

     
发表于 2026-8-26 23:03 | 显示全部楼层
难怪能免费随便用一周,按我的理解这是新建的算力拿来试用的吗    Re:Source
回复

使用道具 举报

     
发表于 2026-8-26 23:09 来自手机 | 显示全部楼层
正好zcode的周额度刚更新,这周全蹬glm flash看看效果。

—— 来自 samsung SM-S9380, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-26 23:09 来自手机 | 显示全部楼层
goranger 发表于 2026-8-26 22:52
智谱这个flash要把minimax斩杀到底了吧,有点想把minimax年付退掉了,本来看中他还有点多模态能力,而且老 ...

不好说,好像M3pro要来了
回复

使用道具 举报

     
发表于 2026-8-26 23:10 来自手机 | 显示全部楼层
本帖最后由 qwased 于 2026-8-26 23:11 编辑
chaoliu 发表于 2026-8-26 23:00
求助4070tis(16g显存)本地能跑什么模型目前智商比较高?对输出速度要求不高(能和kimi现在的垃圾速度打平 ...

qwen3.8 apex nano +turboquant可以开192k上下文,但是上下文长了以后吐字速度会很慢(我测试下来50k就掉到25tk/s了,5070ti)
而且如果你的文档需要视觉处理的话,图片解码要。丢到cpu去,连续读图会有点慢,一张720p级别的图cpu要解码20~30秒
想弄的话待会我整理个文档看看
回复

使用道具 举报

     
发表于 2026-8-26 23:11 | 显示全部楼层
goranger 发表于 2026-8-26 22:52
智谱这个flash要把minimax斩杀到底了吧,有点想把minimax年付退掉了,本来看中他还有点多模态能力,而且老 ...

minimax m3在openrouter上免费两周:https://openrouter.ai/minimax/minimax-m3:free
免费完估计也要发新模型了
回复

使用道具 举报

     
发表于 2026-8-26 23:12 | 显示全部楼层
本帖最后由 舞以 于 2026-8-26 23:15 编辑

让gpt pro读了下智谱的博客,他说牛来是一个新的基模,虽然给了5.3的版本号,但是基模实际上应该是智谱的下一代:45层,34层线性注意力(好像是kimi的kda?),11层dsa稀疏注意力,排布方式抄了kimi的,三层线性一层然后一层dsa;引入了ds搞的那套mhc,然后引入了原生多模态。
有点风味v4的感觉了

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-26 23:12 来自手机 | 显示全部楼层
chaoliu 发表于 2026-8-26 23:00
求助4070tis(16g显存)本地能跑什么模型目前智商比较高?对输出速度要求不高(能和kimi现在的垃圾速度打平 ...

理论上你能部署智商最高的大模型是千问3.8 27b,但是你又对上下文有要求,所以我建议你可以看看千问3.6a3b模型,我感觉这个应该是你要求上下文的情况下能部署的最聪明的模型了

—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-26 23:21 | 显示全部楼层
f77887 发表于 2026-8-26 23:12
理论上你能部署智商最高的大模型是千问3.8 27b,但是你又对上下文有要求,所以我建议你可以看看千问3.6a3 ...

5070ti + 64G内存,nvfp4的35a3b 开64k上下文也卡爆了
回复

使用道具 举报

     
发表于 2026-8-26 23:23 | 显示全部楼层
感觉Qwen 3.8 flash应该过两天会有黑科技让Spark能跑的。然后我Kimi 3.1哪去了?
回复

使用道具 举报

     
发表于 2026-8-26 23:24 来自手机 | 显示全部楼层
智谱牛逼,10w卡集群,还是异构算力


— from Xiaomi 23127PN0CC, Android 16, S1 Next Goose v3.5.99
回复

使用道具 举报

     
发表于 2026-8-26 23:25 | 显示全部楼层
算卡数没有意义,10W寒武纪你要吗?
回复

使用道具 举报

     
发表于 2026-8-26 23:25 | 显示全部楼层
分点给梁叔叔吧
回复

使用道具 举报

     
发表于 2026-8-26 23:26 | 显示全部楼层
不好说到底啥情况,梁叔叔在0816之前的巅峰期的服务提供量占了多少算力都不好说
十万卡这个概念太模糊了

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-26 23:30 来自手机 | 显示全部楼层
我看了看智谱的博客已经千问新模型的介绍,智谱这个小模型感觉是正常的一次迭代升级,就像DS-flash一样。千问这个目前看跑分确实厉害,它这次采用了Ngram也算是证明了这个技术确实能给模型带来提升,看看后续DS版本能不能尝试引入

—— 来自 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-26 23:30 | 显示全部楼层
Azcarlo 发表于 2026-8-26 23:24
智谱牛逼,10w卡集群,还是异构算力

歪个楼,这个晚点是新出的媒体吗,最近一年能看见很多他们独家的报道,信息量都不少    Re:Source
回复

使用道具 举报

     
发表于 2026-8-26 23:32 来自手机 | 显示全部楼层
不过智谱真的是开源享受者啊,我看DS的mhc也被他们用到这个新的flash模型里了,不知道他们下一个大版本模型会采用哪些技术

—— 来自 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-26 23:32 | 显示全部楼层
真不要相信Qwen的跑分,3.8-max跑分和K3一样但是实测明显偏高了,3.8-27B小模型很厉害但也没号称的那么强……
回复

使用道具 举报

     
发表于 2026-8-26 23:34 | 显示全部楼层
startraveller 发表于 2026-8-26 23:21
5070ti + 64G内存,nvfp4的35a3b 开64k上下文也卡爆了

根据我的体验,moe模型不能全放进显存里面其实也挺屎的
回复

使用道具 举报

发表于 2026-8-26 23:34 来自手机 | 显示全部楼层
Azcarlo 发表于 2026-8-26 23:24
智谱牛逼,10w卡集群,还是异构算力


主要还是昇腾吧
回复

使用道具 举报

     
发表于 2026-8-26 23:36 | 显示全部楼层
本帖最后由 舞以 于 2026-8-26 23:38 编辑

唐叔叔**方方拿来主义
智谱这家公司的核心竞争优势也不在技术领袖这个身份

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-26 23:36 | 显示全部楼层
andychen 发表于 2026-8-26 23:11
minimax m3在openrouter上免费两周:https://openrouter.ai/minimax/minimax-m3:free
免费完估计也要发新 ...

正常人都是拿新模型让大家免费体验,他到处搞活动免费两周,已经看到两三家了,拿自己家旗舰模型免费这么久,不就说明拉到一定程度了,实在没人用自己家算力用不完了。哎,我也希望它能知耻后勇,不然我这个年付套餐实在是食之无味弃之可惜
回复

使用道具 举报

     
发表于 2026-8-26 23:38 来自手机 | 显示全部楼层
minimax现在做视频和音乐呢,此间乐不思蜀

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-26 23:39 | 显示全部楼层
scikirbypoke 发表于 2026-8-26 23:09
不好说,好像M3pro要来了

再持有一个月看看情况。现在的话,大概70-80块的子代理是市场价了。minimax m3拉成这样了谁给的自信卖100,量再大干不成事也没用啦
回复

使用道具 举报

     
发表于 2026-8-26 23:44 | 显示全部楼层
本帖最后由 tonyunreal 于 2026-8-27 00:38 编辑

牛来第一个demo跑完了,花了一个小时
我感觉给梁子也就15分钟的事

输入184K 缓存10.1M 输出127K,缓存命中98%,44 tok/s
扣了一个2M token的新手包外加¥2.08

成果在这:
https://deepdemos.top/demo/glm-5-3-flash-e4824f31

第二个demo也跑完了,用时46分钟

输入156K 缓存5.7M 输出137K,缓存命中97%,54 tok/s (快了一点?人都跑了?)
扣了¥1.82
回复

使用道具 举报

     
发表于 2026-8-26 23:45 | 显示全部楼层
glm v2 lite 老套餐 非高峰期5h能跑100M..
回复

使用道具 举报

     
发表于 2026-8-26 23:46 | 显示全部楼层
mortal1976 发表于 2026-8-26 22:43
过去一周,我们已在一个大规模的中国AI芯片集群上运行GLM-5.3-Flash,支持高带宽互连和针对底层硬件优化的 ...

不是。。。这种小规模的模型,高带宽互联有个卵用....
还不如单卡部署,直接节省全部张量并行网络通信开销
回复

使用道具 举报

     
发表于 2026-8-26 23:47 | 显示全部楼层
就说这模型雷霆大思考了,而且我觉得智谱也有点刷分嫌疑,前几天试了一下GLM5.3,感觉表现对不上分数,并不如K3……
回复

使用道具 举报

     
发表于 2026-8-26 23:49 | 显示全部楼层
说了用国产算力提供服务的,还点了是通过自研高带宽网络互联,直接点名了呗,中科曙光的scalefabic 那就是郑州的那个国家超算核心节点呗,海光的gpu
回复

使用道具 举报

     
发表于 2026-8-27 00:05 | 显示全部楼层
好了,阿里这个3.8Flash也有雷霆大思考的倾向……
回复

使用道具 举报

     
发表于 2026-8-27 00:11 | 显示全部楼层
nxmonitor 发表于 2026-8-27 00:05
好了,阿里这个3.8Flash也有雷霆大思考的倾向……

你在哪用的,自己部署的话估计还是得用思维链修复那个补丁,qwen好像不认识llamacpp的输出格式导致他自己没法区分思考和正文输出
回复

使用道具 举报

     
发表于 2026-8-27 00:12 来自手机 | 显示全部楼层
startraveller 发表于 2026-8-26 23:21
5070ti + 64G内存,nvfp4的35a3b 开64k上下文也卡爆了

不能啊,我用5080+48g内存,用a3b还是很丝滑的

—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-27 00:14 | 显示全部楼层
为了让更多新朋友能 0 成本上手体验 GLM-5.3-Flash,我们准备了一批 GLM Coding Plan 7 天体验卡(从未订阅过套餐的用户可领取): 接下来一周,每天限量发放 10,000 张。同时,我们也已重置所有套餐用户账号内的体验卡数量,欢迎分享安利给你的更多朋友。 领取链接: https://bigmodel.cn/activity/trial-card/PU9MTWG0PM   继续白嫖ox模型一周
回复

使用道具 举报

     
发表于 2026-8-27 00:20 | 显示全部楼层
goranger 发表于 2026-8-27 00:14
为了让更多新朋友能 0 成本上手体验 GLM-5.3-Flash,我们准备了一批 GLM Coding Plan 7 天体验卡(从未订阅 ...

领到了  周额度总共2000 感觉做不了什么  
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-27 08:42 , Processed in 0.179941 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表