nianiania 发表于 2026-8-19 17:58

梁圣救救我吧,codex 现在又蠢又慢

—— 来自 vivo V2405A, Android 16, 鹅球 v3.5.99

Promeus 发表于 2026-8-19 17:59


目前来看最夸张的是这个,把黑洞喷流和多普勒都画出来了

zhanglei1943 发表于 2026-8-19 17:59

差不多可以推理出。I'm模型存在,参数量和激活参数量都巨大。所以服务器压力也大到没法在现阶段公开,只有涨价后资源略有余量才能稍微灰测一下这样。

2017.05.04 发表于 2026-8-19 18:01

还敢耽误AGI训练吗

舞以 发表于 2026-8-19 18:02

还敢耽误AGI训练吗

Promeus 发表于 2026-8-19 18:02

zhanglei1943 发表于 2026-8-19 17:59
差不多可以推理出。I'm模型存在,参数量和激活参数量都巨大。所以服务器压力也大到没法在现阶段公开,只有 ...

我怀疑这玩意是不是有神秘力量支持了,否则4月还在嚷嚷缺卡做不出来大参数激活,现在就能有这么个极其夸张的模型?但是就算神秘力量现在也有上限,所以无法提供出来甚至不能让太多人占算力

jk9hot 发表于 2026-8-19 18:03

Promeus 发表于 2026-8-19 17:59
目前来看最夸张的是这个,把黑洞喷流和多普勒都画出来了

这个有点夸张了

→熙← 发表于 2026-8-19 18:03

我怎么就错过了呢, 先准备几个困难问题,等下次会测直接上

chuchoselph 发表于 2026-8-19 18:03

Promeus 发表于 2026-8-19 17:59
目前来看最夸张的是这个,把黑洞喷流和多普勒都画出来了

发个地址吧,看上去太离谱了

vincevincetang 发表于 2026-8-19 18:03

我们的模型太危险了,我们在它的思考中发现了某种可怕的东西正在苏醒,呼吁全球暂停AI研究

真田源次郎信繁 发表于 2026-8-19 18:04

梁子的v4 pro这个水平,反正我是不信还能有时间练更大更好的,否则何必把这个拿出来呢
路由论虽然听起来挺离谱,但v4pro这个水平也很离谱啊

misuzu0723 发表于 2026-8-19 18:06

如果真的是藏的新模型的话,脏 token 很难解释,deepseek 自己的脏 token 失效可以解释,Claude 的脏 token 生效就很奇怪了

—— 来自 vivo V2405A, Android 15, 鹅球 v4.0-alpha

chuchoselph 发表于 2026-8-19 18:06

真田源次郎信繁 发表于 2026-8-19 18:04
梁子的v4 pro这个水平,反正我是不信还能有时间练更大更好的,否则何必把这个拿出来呢
路由论虽然听起来挺 ...

路由论站不住脚的原因是这个水平难道你真路由到了mythos2不成?

xiaohanne 发表于 2026-8-19 18:07

真田源次郎信繁 发表于 2026-8-19 18:04
梁子的v4 pro这个水平,反正我是不信还能有时间练更大更好的,否则何必把这个拿出来呢
路由论虽然听起来挺 ...

按照之前的说法,每个大模厂商都有一个参数远大于最后实际提供服务的教师模型。

lactone 发表于 2026-8-19 18:09

qwen3.8 27b的aa跑分52

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99

蛋黄酱Release 发表于 2026-8-19 18:09

我用不上的就都是假的,什么一句话生成都是提前做好了东西然后假装端出来的要不就是路由到了外星人的1Z参数大模型

zhanglei1943 发表于 2026-8-19 18:11

真田源次郎信繁 发表于 2026-8-19 18:04
梁子的v4 pro这个水平,反正我是不信还能有时间练更大更好的,否则何必把这个拿出来呢
路由论虽然听起来挺 ...

按涨价前的价格和模型的正常水平(专武+正确调用)来算的话,如果说flash是95分,pro就是90分。如果没有之前灰测拔高期待的话也是不错的模型换代。目前看来1.6t上限差不多就这样了。

舞以 发表于 2026-8-19 18:12

我已经不期待什么灰测模型了,这个50toks速度明显比现在的pro还贵一个档次。
我只希望梁叔叔快点把pro修好,别折磨社区了

舞以 发表于 2026-8-19 18:14

刚刚在峰价跑了下测试,真的肉痛啊,随随便便十几块没了

tillnight 发表于 2026-8-19 18:14

misuzu0723 发表于 2026-8-19 18:06
如果真的是藏的新模型的话,脏 token 很难解释,deepseek 自己的脏 token 失效可以解释,Claude 的脏 token ...

你先拿出你脏token的证据吧,最先在up下发的那个人已经自删了。

UncleDracula 发表于 2026-8-19 18:16

这效果绝壁是带多模态的。说路由的也扯淡,现在就没有一家模型能做到这种水平

misuzu0723 发表于 2026-8-19 18:22


转的别人的,我自己没灰度到

—— 来自 vivo V2405A, Android 15, 鹅球 v4.0-alpha

小野賢章 发表于 2026-8-19 18:25

这个神了

lly778 发表于 2026-8-19 18:28

而且今天灰测到的模型肉眼看来比7月份又强了很多,只能说路由到A/的内部模型了

小野賢章 发表于 2026-8-19 18:31

梁子可以安排自己的infra团队去给第三方平台优化、部署,作为交换这些平台要把数据给deepseek,这样deepseek就不用提供在线服务了,算力全都用来研发新模型

novem 发表于 2026-8-19 18:35

后训练问题估计还是算力局限性,大厂的财力又太雄厚,这得要从更高层面来协调

Lacsiess 发表于 2026-8-19 18:38

qwased 发表于 2026-8-19 12:36
qwen 3.8 27b=思考更长能力差不多的v4flash
我去看了一圈感觉买两个2080ti 22g回来搭27b确实非常划算 ...

4080s 32G可以跑动吧

widder 发表于 2026-8-19 18:44

本帖最后由 widder 于 2026-8-19 18:46 编辑

真田源次郎信繁 发表于 2026-8-19 18:04
梁子的v4 pro这个水平,反正我是不信还能有时间练更大更好的,否则何必把这个拿出来呢
路由论虽然听起来挺 ...
我用claude接deepseek写UE的c++,实际用下来,pro写代码的水平是远超flash的,同样的活,pro几行解决的事,flash写了一大堆还是搞不定,指挥他改,越改越长,但问题还是没解决。

flash速度极快,指令发出去没几秒就开始动手了,然后看他写的东西,就是欠考虑,而pro先要思考好久,然后才写,但结果都挺漂亮的。

厍无春 发表于 2026-8-19 18:47

UncleDracula 发表于 2026-8-19 18:16
这效果绝壁是带多模态的。说路由的也扯淡,现在就没有一家模型能做到这种水平 ...

没有,我做了个彭罗斯楼梯,思维链明确写了没有视觉想要调用dsh里我安的视觉插件,但是不知道为啥调用失败了,可能是dsh插件更新炸了

qwased 发表于 2026-8-19 18:47

Lacsiess 发表于 2026-8-19 18:38
4080s 32G可以跑动吧

自己玩的话还是洋垃圾比较有性价比

小野賢章 发表于 2026-8-19 18:50

厍无春 发表于 2026-8-19 18:47
没有,我做了个彭罗斯楼梯,思维链明确写了没有视觉想要调用dsh里我安的视觉插件,但是不知道为啥调用失 ...

SVG彭罗斯楼梯目前我还没有成功画出来过

Promeus 发表于 2026-8-19 18:52

chuchoselph 发表于 2026-8-19 18:03
发个地址吧,看上去太离谱了

【鲸龙王归来!核弹X黑洞瘫坐 ds灰测 逃逸黑洞-哔哩哔哩】 https://b23.tv/umCN5A8

qwased 发表于 2026-8-19 18:52

widder 发表于 2026-8-19 18:44
我用claude接deepseek写UE的c++,实际用下来,pro写代码的水平是远超flash的,同样的活,pro几行解决的事, ...

flash还很容易分心,我做DSH插件出现过以下情况:工作区有其他插件的文件,导致它写了一半就开始读另一个插件的代码然后开始修这份记忆里面的bug;开一个对话进行插件功能测试,然后在那个对话里面把自己要干的活外包出去等新会话干活,自己开始sleep

chuchoselph 发表于 2026-8-19 18:59

Promeus 发表于 2026-8-19 18:52
【鲸龙王归来!核弹X黑洞瘫坐 ds灰测 逃逸黑洞-哔哩哔哩】 https://b23.tv/umCN5A8 ...

这和图片里的不是同一个吧?

论坛助手,iPhone

Lorraine_Kinney 发表于 2026-8-19 19:04

我用不上都是假的,还涨价,建议击毙梁文峰

舞以 发表于 2026-8-19 19:07

放个教师模型出来收集一下轨迹,顺便秀秀肌肉

论坛助手,iPhone

舞以 发表于 2026-8-19 19:12

我越想越悲观,这个神秘模型说不定单纯是ds的研究设施而已,就不是产品模型或者产品原型。
比如一个moe更稠密,注意力更稠密,kvcache更重,推理成本明显更高,甚至高到不适合投入商业运营的教师模型?或者标杆模型?
现在的“灰测”也不是真正意义上的测试,说不定只是一次研究工作而已。
ds真正的产品的目标是尽量保留教师的能力,也要尽量维持效率和经济性。
我觉得这个神秘模型说不定永远都不会上,还是合理期待梁子先修好pro的adhd问题,再期待下一代吧。

论坛助手,iPhone

一般市民 发表于 2026-8-19 19:14

话说B站鲸鱼娘二创好像数量和质量都是新高吧,这方面真的AI圈头一号。

lowezack 发表于 2026-8-19 19:18

泥潭怎么又和灰测干上了?大模型灰测有啥意义?

tonyunreal 发表于 2026-8-19 19:21

http://deepdemos.top/demo/3d-322a0411

主播灰测做的机械表
页: 235 236 237 238 239 240 241 242 243 244 [245] 246 247 248 249 250 251 252 253 254
查看完整版本: Ox Alpha被认领,GLM-5.3-Flash上线|大模型讨论专楼