找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] DeepSeek V4-Flash-Vision-Exp 上线!多模态来啦|大模型讨论专楼

 火.. [复制链接]
     
发表于 2026-8-16 17:05 | 显示全部楼层
本来想用风神的v4f插件,结果一看居然需要引入一个自己维护的注入脚本,瞬间不想用了。dsh就已经够开放了,怎么还要再加一个注入器。
回复

使用道具 举报

     
发表于 2026-8-16 17:11 | 显示全部楼层
tillnight 发表于 2026-8-16 17:02
V4基模又不可能丢了,还得用起码大半年呢。后面的小版本还要更多模态,正常来说肯定要回滚回没有过拟合的 ...

如果回滚能解决问题找就回滚了,我不信ds官方不知道模型有瑕疵,不然不会在文档里强调极简模式。楼上也说了,灰测有可能就是不稳定的,就是现在这个鸟样子,所以才会一拖再拖,所以才会赶鸭子上架逼dsh内测发出来挽尊

v4pro本来就延期了,如果这个问题好解决再延期一两周又何妨?如果是后训练的问题可能可以处理,如果是预训练就埋下的祸根呢?梁子会决策把模型发出来,我认为本来就是想给这个版本盖棺了




回复

使用道具 举报

     
发表于 2026-8-16 17:11 来自手机 | 显示全部楼层
anchored standard 感觉删的有点多多了,模型已经想不起自己在哪儿 手边有什么工具了。每次都要 let's 造半天轮子

—— 来自 Xiaomi 2410DPN6CC, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-8-16 17:14 来自手机 | 显示全部楼层
cscbzcbz 发表于 2026-8-16 17:11
如果回滚能解决问题找就回滚了,我不信ds官方不知道模型有瑕疵,不然不会在文档里强调极简模式。楼上也说 ...

当时灰测到的api都挺稳定的,新开对话也能持续复现并不是抽奖,而且能力下限就有现在的上限。还是差别很大的。
回复

使用道具 举报

     
发表于 2026-8-16 17:25 | 显示全部楼层
tillnight 发表于 2026-8-16 17:14
当时灰测到的api都挺稳定的,新开对话也能持续复现并不是抽奖,而且能力下限就有现在的上限。还是差别很 ...

我当时也灰度到了,确实只要CoT是i’m思维链,出来的结果确实都很强。但是能不能刷出来也是有概率的,而且只有用opencode能刷出来,其实现在想想和现在的 dsh 极简模式的情况不是很像吗
回复

使用道具 举报

     
发表于 2026-8-16 17:28 | 显示全部楼层
小野賢章 发表于 2026-8-16 16:54
灰度版说不定就是这样的,当时抽签抽到了let me 的灰度版可能以为就是预览版,因为性能差 ...

好有道理,感觉逻辑一下通畅了……
回复

使用道具 举报

     
发表于 2026-8-16 17:38 | 显示全部楼层
bartholo4 发表于 2026-8-16 17:11
anchored standard 感觉删的有点多多了,模型已经想不起自己在哪儿 手边有什么工具了。每次都要 let's 造半 ...

我这改个bug,标准模式+原执行会话直接让PRO分析根因+子代理flash执行,结果改了两轮没改好。换成anchored standard+新开会话+子代理flash执行,没有给任何上下文,完全是自己读取项目代码分析,一边过了。后续的一些优化也是指哪打哪,一次过。有点神了。
回复

使用道具 举报

发表于 2026-8-16 17:43 | 显示全部楼层
感觉梁子可能直接训练下一个模型了,V4.1或者V5了,资源有限,估计只能选择训练下一代了
回复

使用道具 举报

     
发表于 2026-8-16 17:47 来自手机 | 显示全部楼层
两天没看帖 opencode go有没有说明天跟涨与否啊

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-16 18:01 | 显示全部楼层
neptunehs 发表于 2026-8-16 17:47
两天没看帖 opencode go有没有说明天跟涨与否啊

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0 ...

go不是5刀一口价吗,还是说有限制的额度啊?
回复

使用道具 举报

     
发表于 2026-8-16 18:06 | 显示全部楼层
罗莉控 发表于 2026-8-16 18:01
go不是5刀一口价吗,还是说有限制的额度啊?

有的,之前v4f是60刀的限额,只不过正常情况下没人用得到限额
回复

使用道具 举报

     
发表于 2026-8-16 18:09 | 显示全部楼层
给DS加上操作浏览器的工具之后,让他给自己写插件,有时候他会在打开浏览器测试UI的时候发起新对话然后派任务下去,太草了
回复

使用道具 举报

     
发表于 2026-8-16 18:16 来自手机 | 显示全部楼层
罗莉控 发表于 2026-8-16 18:01
go不是5刀一口价吗,还是说有限制的额度啊?

并不是无限额度啊 额度是他们自己的一套算法 我想问跟涨没有
而且是10刀

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-16 18:21 来自手机 | 显示全部楼层
本帖最后由 tonyunreal 于 2026-8-16 18:50 编辑

anchor作者的群里有人说标准模式修好了

编辑:群众说无法复现

—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-16 18:32 | 显示全部楼层
tonyunreal 发表于 2026-8-16 18:21
anchor作者的群里有人说标准模式修好了
大的来了?0816?

ds不是周末不加班吗,这三天dsh提交都没动静,dsh这么多bug不修先去上模型了?
回复

使用道具 举报

     
发表于 2026-8-16 19:50 | 显示全部楼层
前两天开了opencode go,主要用DSV4pro,现在就已经用掉月额度18%了,感觉完全不够用,不知道开两个账号轮流用会不会被dax封号
回复

使用道具 举报

     
发表于 2026-8-16 19:51 | 显示全部楼层
我真服了kimi code了 日常梯度爆炸开始循环病娇模式

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-16 20:02 | 显示全部楼层
hugosol 发表于 2026-8-16 19:50
前两天开了opencode go,主要用DSV4pro,现在就已经用掉月额度18%了,感觉完全不够用,不知道开两个账号轮 ...

日常开发,蹬flash就够了,一般也蹬不完, 这个时候,可以蹬一些pro
回复

使用道具 举报

     
发表于 2026-8-16 20:11 | 显示全部楼层
小明正在直播测新出的插件,flash做出来的还不错
回复

使用道具 举报

     
发表于 2026-8-16 20:12 | 显示全部楼层
实测这个移植的pi版本anchored-standard有效,切换v4pro max强度,然后先发一个“测试,回复ok”,之后再干活,实测没有出现过 let me(想到了从letme到严君泽

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-16 20:15 | 显示全部楼层
有没有不用官方搜索的插件,装了个web-search-pro一直装不上
回复

使用道具 举报

     
发表于 2026-8-16 20:17 | 显示全部楼层
→熙← 发表于 2026-8-16 20:02
日常开发,蹬flash就够了,一般也蹬不完, 这个时候,可以蹬一些pro

需求分析还是要用pro的,前段时间用了一下flash正式版感觉还是太着急干活了,有时候会有没聊清楚的情况,不过拆分好任务直接塞给subagent用flash跑倒是没什么问题
回复

使用道具 举报

     
发表于 2026-8-16 20:19 | 显示全部楼层
我试着用楼里推荐的几个插件,然后把插件结合起来测试,结果发现什么都不加分数最高:

模式                                  隐藏测试平均分        全部通过率        API成本        每会话平均耗时
官方Standard                               92.7%                 50.0%                4.39                10.2分钟
Anchored Standard               89.6%                58.3%                6.62                16.1分钟
Routing Suite                       90.6%                41.7%                4.03                10.4分钟
我的结合后的Standard        87.5%                33.3%                3.00                 7.2分钟
回复

使用道具 举报

     
发表于 2026-8-16 20:20 | 显示全部楼层
hugosol 发表于 2026-8-16 20:17
需求分析还是要用pro的,前段时间用了一下flash正式版感觉还是太着急干活了,有时候会有没聊清楚的情况, ...

flash不是有风神那个雷霆大思考的插件, 思考的时候强迫更多思考的, 挺好用的
回复

使用道具 举报

     
发表于 2026-8-16 20:25 来自手机 | 显示全部楼层
感觉dsh跑的不太稳定,经常跑着跑着服务就挂了,连暂停都停不下来,还是tui稳定
回复

使用道具 举报

     
发表于 2026-8-16 20:26 | 显示全部楼层
nianiania 发表于 2026-8-16 20:11
小明正在直播测新出的插件,flash做出来的还不错

这个才是真民科吧,插件都不是,就是纯提示词工程。而且唯一跑完的一个测试也就是说对flash还行,算不上很好。
回复

使用道具 举报

     
发表于 2026-8-16 20:26 | 显示全部楼层
→熙← 发表于 2026-8-16 20:20
flash不是有风神那个雷霆大思考的插件, 思考的时候强迫更多思考的, 挺好用的 ...

草,其实之前pro预览版感觉已经够用了,现在pro正式版经常雷霆大思考我还觉得挺不爽的
flash那个加强插件有空再看看,关键是还有挺多代码之外的任务要用到pro的,flash感觉就只是代码特化,有时候不太能理解我真正的目的
回复

使用道具 举报

     
发表于 2026-8-16 21:00 | 显示全部楼层
https://www.bilibili.com/video/B ... b371065e4090371b63f

这个可以盖棺神鬼二相性了。
回复

使用道具 举报

发表于 2026-8-16 21:26 来自手机 | 显示全部楼层
玩了三天了 准备开始付费上班,太多重复性的工作可以用deepeek,解决 减少百分之七十以上工作量。

—— 来自 鹅球 v3.3.96
回复

使用道具 举报

     
发表于 2026-8-16 21:46 来自手机 | 显示全部楼层
小野賢章 发表于 2026-8-16 20:12
实测这个移植的pi版本anchored-standard有效,切换v4pro max强度,然后先发一个“测试,回复ok”,之后再干 ...

懂了,训练的时候letme跟“混”这个特征相关紧密,pro学进去了

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v4.0-alpha
回复

使用道具 举报

     
发表于 2026-8-16 21:48 来自手机 | 显示全部楼层
明天涨价,但是模型升级-小梁子
因为模型问题,明天暂时不涨价-梁圣
模型没人修,价格还要涨-梁畜

—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-16 21:53 来自手机 | 显示全部楼层
感觉这版V4PRO只能叫v4 pro beta(一起来找bug)

—— 来自 HUAWEI HOP-AL10, Android 12, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-8-16 21:58 | 显示全部楼层
说起来中文思维链要怎么判断锚定到点子上没有
回复

使用道具 举报

     
发表于 2026-8-16 21:58 | 显示全部楼层
本帖最后由 ycjiang1337 于 2026-8-16 21:59 编辑
cscbzcbz 发表于 2026-8-16 17:11
如果回滚能解决问题找就回滚了,我不信ds官方不知道模型有瑕疵,不然不会在文档里强调极简模式。楼上也说 ...

预训练决定模型上限和潜力,后训练决定模型能不能稳定发挥出来。既然能摇出超神表现,那就说明预训练不可能有问题,现在要么是后训练还做得远远不够,要么是当时的checkpoint丢了,根本不可能存在所谓的盖棺定论。
回复

使用道具 举报

     
发表于 2026-8-16 22:07 | 显示全部楼层
回复

使用道具 举报

     
发表于 2026-8-16 22:10 | 显示全部楼层
老实说其实我觉得pro预览版已经够用,灰测那些一句话生成游戏的能力对我来说不是必要的能力,因为这些都是可以靠使用者或者harness的工程能力弥补的,或者说实际工作中根本不会这样用,实际能力还是要看benchmark
现在如果有效上下文长度能像flash一样大幅扩展,目前的pro我也是收货的,就是涨价太难受了,不能像以前一样无脑浪费token,梁子还是要跌落神坛的
回复

使用道具 举报

     
发表于 2026-8-16 22:12 | 显示全部楼层
所以现在最佳解决方案是?今天一直用极简没有用任何插件

—— 来自 S1Fun
回复

使用道具 举报

     
发表于 2026-8-16 22:15 | 显示全部楼层
hugosol 发表于 2026-8-16 22:10
老实说其实我觉得pro预览版已经够用,灰测那些一句话生成游戏的能力对我来说不是必要的能力,因为这些都是 ...

其实最好的是Flash正式版,预览版家族的指令遵循能力很差
回复

使用道具 举报

     
发表于 2026-8-16 22:21 | 显示全部楼层
Ah! Even with dynamic split disabled, our BuildPathSegs seq refactor causes 172 random failures. Previous b365 random 0. So output refactor is broken, contributing. Dynamic split additional 243.

我发现轮次多了之后,wsl的极简模式下也是会有一点情绪的。现在这个会话跑了2.5亿token了
回复

使用道具 举报

     
发表于 2026-8-16 22:39 | 显示全部楼层
ycjiang1337 发表于 2026-8-16 21:58
预训练决定模型上限和潜力,后训练决定模型能不能稳定发挥出来。既然能摇出超神表现,那就说明预训练不可 ...

那就等梁子再掏出来新的大赢鲸吧,看得出来这次多少有点被自己定的节点搞得有点被动,ds还是适合按自己节奏来
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-25 02:41 , Processed in 0.138432 second(s), 6 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表