Rowen233 发表于 2026-7-31 14:18

全面爆杀GLM5.2
智谱:现在是年轻人接管比赛的时候了,现在是我的时代了
DS:GLM,我会把你打回现实

lactone 发表于 2026-7-31 14:18

wandeeees 发表于 2026-7-31 14:17
目前仅 deepseek-v4-flash 支持接入 Codex,deepseek-v4-pro 预计 2026 年 8 月初支持接入 Codex。

V4 PRO ...

v4f不是灰测那个吧

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

wandeeees 发表于 2026-7-31 14:19

lactone 发表于 2026-7-31 14:18
v4f不是灰测那个吧

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

我知道应该不是,但是如果同样的后训练的话,COT是不是应该也很相似才对吧

nxmonitor 发表于 2026-7-31 14:19

V4P不会是重新训练了吧,不然也不用专门说一句flash没动架构

cscbzcbz 发表于 2026-7-31 14:20

nxmonitor 发表于 2026-7-31 14:19
V4P不会是重新训练了吧,不然也不用专门说一句flash没动架构

我感觉很有可能

→熙← 发表于 2026-7-31 14:21

v4pro不会有奇迹的,灰测那几天肯定是路由到了fable5

UncleDracula 发表于 2026-7-31 14:21

预览版pro被正式版flash碾压?有点6,让我使劲儿蹬蹬看

蛋黄酱Release 发表于 2026-7-31 14:22

check了一下项目,内容没细看,感觉还有模有样的等下用glm5.2再测一下对比

—— 来自 vivo V2405A, Android 16, 鹅球 v4.0

lubo 发表于 2026-7-31 14:22

nxmonitor 发表于 2026-7-31 14:23

→熙← 发表于 2026-7-31 14:21
v4pro不会有奇迹的,灰测那几天肯定是路由到了fable5
特征差得有点多了,路由到未来终于憋出来的Gemini还差不多

overflowal 发表于 2026-7-31 14:25

→熙← 发表于 2026-7-31 14:21
v4pro不会有奇迹的,灰测那几天肯定是路由到了fable5

证据呢?灰测到fable,你怎么获取fable的Cot?还是你相信传说中的"""破解cot"""?

77BBC 发表于 2026-7-31 14:25

不赖,再给ds充个十块的

蛋黄酱Release 发表于 2026-7-31 14:26

lubo 发表于 2026-7-31 14:22


好好好,这下更期待v4p了

—— 来自 vivo V2405A, Android 16, 鹅球 v4.0

zhanglei1943 发表于 2026-7-31 14:26

deepswe 54 ≈ gpt 5.5 high ≈ opus 4.8 xhigh
ALE 25 略低于 opus 4.8 max (27) 略低于 K3 max (28)


terminal bench 2.1仅次于fable 5 xhigh和gpt5.5 xhigh

Lorraine_Kinney 发表于 2026-7-31 14:26

glm真是小丑啊

mitzvah 发表于 2026-7-31 14:27

好啊!v4flash,咬咬牙可以本地部署4位量化,

cscbzcbz 发表于 2026-7-31 14:27

我超忍不住了,手里活不管了,我现在就要蹬蹬

蜇灵 发表于 2026-7-31 14:27

所以有没有人测一下实际情况

→熙← 发表于 2026-7-31 14:27

lubo 发表于 2026-7-31 14:22


真碾掉glm5.2了?

nxmonitor 发表于 2026-7-31 14:29

早说了DS才是后训练仙人,R1就是这么搞出来的。

findpkq 发表于 2026-7-31 14:29

本帖最后由 findpkq 于 2026-7-31 14:34 编辑

glm你退下吧

那这flash能当pro preview蹬吗

隔壁视频的seedance2.5也在月底鸽出来了,费用欠拷打

=======================
竟然特地为codex优化,不知道自己的harness会不会用Responses API格式

Milarvoz 发表于 2026-7-31 14:29

梁圣是早上起床看到glm涨价新闻立马拍板上线v4f的嘛

—— 来自 samsung SM-S9380, Android 16, 鹅球 v4.0

vincevincetang 发表于 2026-7-31 14:29

flash是我平时用量最大的,这下爽了    Re:Source

半江瑟瑟半江红 发表于 2026-7-31 14:30

跑了一点小项目,感觉比GLM5.2聪明。

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

Rowen233 发表于 2026-7-31 14:30

zhanglei1943 发表于 2026-7-31 14:26
deepswe 54 ≈ gpt 5.5 high ≈ opus 4.8 xhigh
ALE 25 略低于 opus 4.8 max (27) 略低于 K3 max (28)



但不知道为什么有几个评分比Luna低很多

七氷 发表于 2026-7-31 14:31

这下glm小丑了

nxmonitor 发表于 2026-7-31 14:31

这个benchmark有点厉害,DS按照目前的信誉度还是不会去刷分的,别V4P真搞个对标Fable的东西来了,虽然灰测版最后几天已经有苗头了。

半江瑟瑟半江红 发表于 2026-7-31 14:32

智谱傻逼了
加油啊,曾经是杨圣导师的大哥哥!

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

花椒 发表于 2026-7-31 14:32

LeoDT 发表于 2026-7-31 10:02
D老师正式版不发可以,但是现在的版本能不能正常点,刚才遇到在工具调用途中开始思考的情况了,一个挺简单 ...

昨晚上我就发现代码乱写,连编码风格都变了    Re:Source

蛋黄酱Release 发表于 2026-7-31 14:33


这下luna白降价了

—— 来自 vivo V2405A, Android 16, 鹅球 v4.0

冤枉呐 发表于 2026-7-31 14:33

chaoliu 发表于 2026-7-31 14:15
不是,我还有很多是扫描件的 PDF,就是那种没有文字信息,都是以图片形式表存的,要通过 OCR 后转成文字 ...

这个你直接调一个便宜的视觉模型,先转成文字输出,然后再保存呗

→熙← 发表于 2026-7-31 14:34

要是ds的价格弄了一个fable等级的出来, 所有其他文字模型都要变小丑

GJRstone 发表于 2026-7-31 14:34

overflowal 发表于 2026-7-31 11:01
说中文说英语这个真别当成啥判据。。。    Re:Source

应该是api级别的harness工程,我下午试了几次简单对话,思考里一直是以”我们 need answer in Chinese. Need analyze. User asks:“开头的,说实话这思考有点难崩

overflowal 发表于 2026-7-31 14:34

蛋黄酱Release 发表于 2026-7-31 14:33
这下luna白降价了

—— 来自 vivo V2405A, Android 16, 鹅球 v4.0

杀杀杀杀杀    Re:Source

nxmonitor 发表于 2026-7-31 14:35

Rowen233 发表于 2026-7-31 14:30
但不知道为什么有几个评分比Luna低很多

是不是max档位测的?Luna的max是多子代理硬跑的吗?

Anarkia 发表于 2026-7-31 14:35

甲还是跟没有一样
赞美梁圣

綺々羅々ヴィヴ 发表于 2026-7-31 14:38

大的真来了!

2017.05.04 发表于 2026-7-31 14:38

到处都是原子弹爆炸瘫坐在椅子上

nianiania 发表于 2026-7-31 14:38

笑死,狠狠打智谱的脸,喜欢涨价

—— 来自 vivo V2405A, Android 16, 鹅球 v3.5.99

80后卢瑟 发表于 2026-7-31 14:39

nxmonitor 发表于 2026-7-31 14:35
是不是max档位测的?Luna的max是多子代理硬跑的吗?

max 就是 max,不是那个 ultra
页: 97 98 99 100 101 102 103 104 105 106 [107] 108 109 110 111 112 113 114 115 116
查看完整版本: DeepSeek V4-Flash-Vision-Exp 上线!多模态来啦|大模型讨论专楼