当时有好几个其他模型也停摆了,一看就是掺了水的……
今天发了嘛,等不及了
cscbzcbz 发表于 2026-7-13 10:32
今天发了嘛,等不及了
发邮件才会发,今天不发估计就周五了
果然是要等到人工智能大会再正式发布吗
这几天测了半天都没灰到,现在的预览版已经口水流到难以接受了
不会真等到17号发布吧
—— 来自 鹅球 v3.5.99
真到17号发布说明对正式版质量很有信心吧
一般周四发。。
什么时候pro可以联网啊,几个搞国产硬件的能不能247上班搓显卡内存条啊,好急啊。
我有个问题不太明白,我拿gpt和d指导都是放agent里写小说,同一个工作结构,一百万字不到,为什么在这样长度的内容里捞针gpt表现就远超过D指导呢?D指导经常捞出幻觉来
—— 来自 HUAWEI SGU-AL10, Android 12, 鹅球 v3.5.99
看样子是17号了
17号正好有个会开幕,顺便会上还有950
我用来干活的agent最近v4flash感觉变蠢了。
1块钱写出来的代码要反复调试10块钱才能解决问题。
甚至切pro感觉都要划算得多。
flash被蹬得流口水了,没办法
—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha
大概率是17号了,人工智能大会,又是chat和reasoner这俩模型名废弃前一周。
半江瑟瑟半江红 发表于 2026-7-13 16:21
我有个问题不太明白,我拿gpt和d指导都是放agent里写小说,同一个工作结构,一百万字不到,为什么在这样长 ...
确定 codex 没有重新读文件吗,5.6 优化的也是工作场景的捞针,纯靠大上下文的捞针肯定不如 ds 才对
不会背上政治包袱加上很厉害的安全对齐吧?
御坂MKII 发表于 2026-7-13 18:49
确定 codex 没有重新读文件吗,5.6 优化的也是工作场景的捞针,纯靠大上下文的捞针肯定不如 ds 才对 ...
codex和opencode,工作框架是一样的,skill也是一样的,同样捞针按理说codex重读原文去捞,opencode也会去重读原文才对。但结果来说就是D指导在opencode里捞出来的幻觉非常严重
御坂MKII 发表于 2026-7-13 18:49
确定 codex 没有重新读文件吗,5.6 优化的也是工作场景的捞针,纯靠大上下文的捞针肯定不如 ds 才对 ...
codex和opencode,工作框架是一样的,skill也是一样的,同样捞针按理说codex重读原文去捞,opencode也会去重读原文才对。但结果来说就是D指导在opencode里捞出来的幻觉非常严重
一般市民 发表于 2026-7-13 18:54
不会背上政治包袱加上很厉害的安全对齐吧?
安全对齐其实是大概率事件
那种事情不要啊
17号人工智能大会有老大亲自出席开幕式,估计现在这个神秘灰测模型就是v4正式版了,这个强度拿出来简直完美
半江瑟瑟半江红 发表于 2026-7-13 19:13
codex和opencode,工作框架是一样的,skill也是一样的,同样捞针按理说codex重读原文去捞,opencode也会 ...
感觉像是 ds 自己降智。codex 如果只靠自己的上下文的话文本纯捞针绝对不行,ds4 刚出的时候简单测过捞针,效果确实还可以。
不知道前几天那个路透社独家说限制国外访问会不会是真的,不过这个和token出海的想法是完全不一致的吧?
https://www.bilibili.com/video/BV1ofNy6TEkD/?share_source=copy_web&vd_source=ecdb3f81e5dd2b1c9f6b4eca0fe0851e
今天有人测试了神秘模型的文本能力,写了一篇孤独摇滚的同人文,可以看一下结果,大概12分左右
如果拿出来就是这个,那这后训练真有点厉害,coding能力突飞猛进,文本能力也突破了,opus和glm都把自己练得像机器人了
你们不要觉得deepseek要给什么大会献礼啥的,还没到这份上。
他们一般周四发 Re:Source
前沿模型搞安全对齐是正常的 不搞是ds之前的定位所致
现在ds明显也要自己做产品搞商业化的,真做了只能理解了
另外我觉得不至于搞献礼之类的
论坛助手,iPhone
虽然 ds4 的底模确实潜力巨大。但是后训练也是门技术活,至少对于代码这边来说既要求数据质量也要求足够的 sandbox infra
他们能不能立刻端上来个超过 glm5.2 的还比较有悬念
御坂MKII 发表于 2026-7-13 22:01
虽然 ds4 的底模确实潜力巨大。但是后训练也是门技术活,至少对于代码这边来说既要求数据质量也要求足够的...
可以B搜搜看视频,有些疑似正式版的结果,roll得最差也有这水平
舞以 发表于 2026-7-13 21:16
前沿模型搞安全对齐是正常的 不搞是ds之前的定位所致
现在ds明显也要自己做产品搞商业化的,真做了只能理解 ...
别弄得一问中国人的遗传病就不回答就行。
御坂MKII 发表于 2026-7-13 19:50
感觉像是 ds 自己降智。codex 如果只靠自己的上下文的话文本纯捞针绝对不行,ds4 刚出的时候简单测过捞 ...
切glm5.2试了一下,确实是d指导自己流口水
—— 来自 HUAWEI SGU-AL10, Android 12, 鹅球 v3.5.99
如果说本来6月中就能发,愣拖到现在发就为了蹭大会那显然是愚蠢的献礼但是如果你本来就计划这几天发,正好17号同时叠加开大会+出席并讲话+公司三周年庆,我感觉专门放这天无可厚非
这两天b站展示灰度的人越来越多了
基本能确认这就是ds的模型,问题在于正式版是不是能达到灰度的这个模型的水平
—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
这两天b站展示灰度的人越来越多了
基本能确认这就是ds的模型,问题在于正式版是不是能达到灰度的这个模型的水平
—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
这两天b站展示灰度的人越来越多了
基本能确认这就是ds的模型,问题在于正式版是不是能达到灰度的这个模型的水平
—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
倒不是献礼,主要是理论上配合这个大会有整活的可能性吧。昇腾950超节点官宣实机首次亮相,玩的大点大可以来个World Premiere ,玩的小点也可以再来一次,余承东,我的超节点呢
舞以 发表于 2026-7-13 21:16
前沿模型搞安全对齐是正常的 不搞是ds之前的定位所致
现在ds明显也要自己做产品搞商业化的,真做了只能理解 ...
ds到这个地位了 有也不奇怪
有人测了下deepswe说是只来得及做了19题,86%得分率,不知道横向对比如何