misuzu0723 发表于 2026-8-26 22:48
不能只看缓存价格,还得看缓存时间,记得之前有人测的 glm 并不长,deepseek
可以到好几个小时甚至按天算。 ...
Z/这个价目表里有一列缓存时间-限时免费
就很灵性
本帖最后由 goranger 于 2026-8-26 22:53 编辑
智谱这个flash要把minimax斩杀到底了吧,有点想把minimax年付退掉了,本来看中他还有点多模态能力,而且老用户有个150%周限制,但其实在缓存命中低的场景下非常不耐用
cscbzcbz 发表于 2026-8-26 22:51
Z/这个价目表里有一列缓存时间-限时免费
就很灵性
又不是命中缓存免费, 是你的缓存存在他的硬盘上这部分给你免费
缓存时间分档不还是a社干的,标准版5分钟一个小时版还要再贵。那智谱是真学啊
→熙← 发表于 2026-8-26 22:53
又不是命中缓存免费, 是你的缓存存在他的硬盘上这部分给你免费
对所以我说很灵性
一眼看过去还以为缓存命中免费了,结果人说的是缓存的存储也要收费的哦,只是暂时给你免了
求助4070tis(16g显存)本地能跑什么模型目前智商比较高?对输出速度要求不高(能和kimi现在的垃圾速度打平就算成功),对上下文长度有点要求(有很多pdf要读,很多都是ocr文件,要经过前一个模型处理后再读的)
拿我智谱清言的年卡来蹬一下5.3flash。。看看到底成色如何
难怪能免费随便用一周,按我的理解这是新建的算力拿来试用的吗 Re:Source
正好zcode的周额度刚更新,这周全蹬glm flash看看效果。
—— 来自 samsung SM-S9380, Android 16, 鹅球 v4.0
goranger 发表于 2026-8-26 22:52
智谱这个flash要把minimax斩杀到底了吧,有点想把minimax年付退掉了,本来看中他还有点多模态能力,而且老 ...
不好说,好像M3pro要来了
本帖最后由 qwased 于 2026-8-26 23:11 编辑
chaoliu 发表于 2026-8-26 23:00
求助4070tis(16g显存)本地能跑什么模型目前智商比较高?对输出速度要求不高(能和kimi现在的垃圾速度打平 ...
qwen3.8 apex nano +turboquant可以开192k上下文,但是上下文长了以后吐字速度会很慢(我测试下来50k就掉到25tk/s了,5070ti)
而且如果你的文档需要视觉处理的话,图片解码要。丢到cpu去,连续读图会有点慢,一张720p级别的图cpu要解码20~30秒
想弄的话待会我整理个文档看看
goranger 发表于 2026-8-26 22:52
智谱这个flash要把minimax斩杀到底了吧,有点想把minimax年付退掉了,本来看中他还有点多模态能力,而且老 ...
minimax m3在openrouter上免费两周:https://openrouter.ai/minimax/minimax-m3:free
免费完估计也要发新模型了
本帖最后由 舞以 于 2026-8-26 23:15 编辑
让gpt pro读了下智谱的博客,他说牛来是一个新的基模,虽然给了5.3的版本号,但是基模实际上应该是智谱的下一代:45层,34层线性注意力(好像是kimi的kda?),11层dsa稀疏注意力,排布方式抄了kimi的,三层线性一层然后一层dsa;引入了ds搞的那套mhc,然后引入了原生多模态。
有点风味v4的感觉了
论坛助手,iPhone
chaoliu 发表于 2026-8-26 23:00
求助4070tis(16g显存)本地能跑什么模型目前智商比较高?对输出速度要求不高(能和kimi现在的垃圾速度打平 ...
理论上你能部署智商最高的大模型是千问3.8 27b,但是你又对上下文有要求,所以我建议你可以看看千问3.6a3b模型,我感觉这个应该是你要求上下文的情况下能部署的最聪明的模型了
—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0
f77887 发表于 2026-8-26 23:12
理论上你能部署智商最高的大模型是千问3.8 27b,但是你又对上下文有要求,所以我建议你可以看看千问3.6a3 ...
5070ti + 64G内存,nvfp4的35a3b 开64k上下文也卡爆了
感觉Qwen 3.8 flash应该过两天会有黑科技让Spark能跑的。然后我Kimi 3.1哪去了?
智谱牛逼,10w卡集群,还是异构算力
https://p.sda1.dev/34/9bb236868ade2d5e22e6f9c8d3cf89f2/image.jpg
— from Xiaomi 23127PN0CC, Android 16, S1 Next Goose v3.5.99
算卡数没有意义,10W寒武纪你要吗?
分点给梁叔叔吧
不好说到底啥情况,梁叔叔在0816之前的巅峰期的服务提供量占了多少算力都不好说
十万卡这个概念太模糊了
论坛助手,iPhone
我看了看智谱的博客已经千问新模型的介绍,智谱这个小模型感觉是正常的一次迭代升级,就像DS-flash一样。千问这个目前看跑分确实厉害,它这次采用了Ngram也算是证明了这个技术确实能给模型带来提升,看看后续DS版本能不能尝试引入
—— 来自 鹅球 v3.5.99
Azcarlo 发表于 2026-8-26 23:24
智谱牛逼,10w卡集群,还是异构算力
歪个楼,这个晚点是新出的媒体吗,最近一年能看见很多他们独家的报道,信息量都不少 Re:Source
不过智谱真的是开源享受者啊,我看DS的mhc也被他们用到这个新的flash模型里了,不知道他们下一个大版本模型会采用哪些技术
—— 来自 鹅球 v3.5.99
真不要相信Qwen的跑分,3.8-max跑分和K3一样但是实测明显偏高了,3.8-27B小模型很厉害但也没号称的那么强……
startraveller 发表于 2026-8-26 23:21
5070ti + 64G内存,nvfp4的35a3b 开64k上下文也卡爆了
根据我的体验,moe模型不能全放进显存里面其实也挺屎的
Azcarlo 发表于 2026-8-26 23:24
智谱牛逼,10w卡集群,还是异构算力
主要还是昇腾吧
本帖最后由 舞以 于 2026-8-26 23:38 编辑
唐叔叔**方方拿来主义
智谱这家公司的核心竞争优势也不在技术领袖这个身份
论坛助手,iPhone
andychen 发表于 2026-8-26 23:11
minimax m3在openrouter上免费两周:https://openrouter.ai/minimax/minimax-m3:free
免费完估计也要发新 ...
正常人都是拿新模型让大家免费体验,他到处搞活动免费两周,已经看到两三家了,拿自己家旗舰模型免费这么久,不就说明拉到一定程度了,实在没人用自己家算力用不完了。哎,我也希望它能知耻后勇,不然我这个年付套餐实在是食之无味弃之可惜
minimax现在做视频和音乐呢,此间乐不思蜀
—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99
scikirbypoke 发表于 2026-8-26 23:09
不好说,好像M3pro要来了
再持有一个月看看情况。现在的话,大概70-80块的子代理是市场价了。minimax m3拉成这样了谁给的自信卖100,量再大干不成事也没用啦
本帖最后由 tonyunreal 于 2026-8-27 10:47 编辑
牛来第一个demo跑完了,花了一个小时
我感觉给梁子也就15分钟的事
输入184K 缓存10.1M 输出127K,缓存命中98%,44 tok/s
扣了一个2M token的新手包外加¥2.08
成果在这:
https://deepdemos.top/demo/glm-5-3-flash-e4824f31
第二个demo也跑完了,用时46分钟
输入156K 缓存5.7M 输出137K,缓存命中97%,54 tok/s (快了一点?人都跑了?)
扣了¥1.82
https://deepdemos.top/demo/glm-5-3-flash-7fd1b26c
glm v2 lite 老套餐 非高峰期5h能跑100M..
mortal1976 发表于 2026-8-26 22:43
过去一周,我们已在一个大规模的中国AI芯片集群上运行GLM-5.3-Flash,支持高带宽互连和针对底层硬件优化的 ...
不是。。。这种小规模的模型,高带宽互联有个卵用....
还不如单卡部署,直接节省全部张量并行网络通信开销
就说这模型雷霆大思考了,而且我觉得智谱也有点刷分嫌疑,前几天试了一下GLM5.3,感觉表现对不上分数,并不如K3……
说了用国产算力提供服务的,还点了是通过自研高带宽网络互联,直接点名了呗,中科曙光的scalefabic 那就是郑州的那个国家超算核心节点呗,海光的gpu
好了,阿里这个3.8Flash也有雷霆大思考的倾向……
nxmonitor 发表于 2026-8-27 00:05
好了,阿里这个3.8Flash也有雷霆大思考的倾向……
你在哪用的,自己部署的话估计还是得用思维链修复那个补丁,qwen好像不认识llamacpp的输出格式导致他自己没法区分思考和正文输出
startraveller 发表于 2026-8-26 23:21
5070ti + 64G内存,nvfp4的35a3b 开64k上下文也卡爆了
不能啊,我用5080+48g内存,用a3b还是很丝滑的
—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0
为了让更多新朋友能 0 成本上手体验 GLM-5.3-Flash,我们准备了一批 GLM Coding Plan 7 天体验卡(从未订阅过套餐的用户可领取): 接下来一周,每天限量发放 10,000 张。同时,我们也已重置所有套餐用户账号内的体验卡数量,欢迎分享安利给你的更多朋友。 领取链接: https://bigmodel.cn/activity/trial-card/PU9MTWG0PM 继续白嫖ox模型一周
goranger 发表于 2026-8-27 00:14
为了让更多新朋友能 0 成本上手体验 GLM-5.3-Flash,我们准备了一批 GLM Coding Plan 7 天体验卡(从未订阅 ...
领到了周额度总共2000 感觉做不了什么