找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] DeepSeek V4-Flash-Vision-Exp 上线!多模态来啦|大模型讨论专楼

 火.. [复制链接]
     
发表于 2026-8-15 15:35 来自手机 | 显示全部楼层
最有活的ai

—— 来自 HUAWEI HOP-AL10, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-15 15:39 来自手机 | 显示全部楼层
真几把鬼扯,建议上双盲测试,看看这些奇巧淫技是真有用还是心理作用
回复

使用道具 举报

     
发表于 2026-8-15 15:40 | 显示全部楼层
怎么3点左右开始v4pro又开始let me了
回复

使用道具 举报

发表于 2026-8-15 15:40 | 显示全部楼层
ternayark 发表于 2026-8-15 14:44
let me和we need到底不同在哪里

我看K3 max也是let me起手啊

我先前问过大肥鱼,它解释说"let me"是站在原地说“让我想想”,"we need"是已经看见方向,"let's do"是开始行动,"we can"是边做边确认“我们可以做到”,接着就是执行而不再犹豫。

let me 本身不是坏事,但如果出现得太频繁就说明模型在反复纠结
回复

使用道具 举报

     
发表于 2026-8-15 15:47 | 显示全部楼层
看雷达站,DSH Pro MAX IQ硬是蹬上去了,邪门的很。
回复

使用道具 举报

     
发表于 2026-8-15 15:54 | 显示全部楼层
雷达站的IQ上去,能说明这玄学是有事实依据吗
回复

使用道具 举报

     
发表于 2026-8-15 15:55 | 显示全部楼层
一般市民 发表于 2026-8-15 15:47
看雷达站,DSH Pro MAX IQ硬是蹬上去了,邪门的很。

雷达站的题目强制要求有docker,所以本身已经保证了linux环境
现在大家知道套路了,拿到题目的提示词后加一句:使用极简模式。直接开启最强状态,上分不奇怪。
现在96分,比用codex高了整整7分,而且用dsh的样本数据还更多,已经很能说明问题了
回复

使用道具 举报

     
发表于 2026-8-15 15:59 | 显示全部楼层
noneoneone 发表于 2026-8-15 15:54
雷达站的IQ上去,能说明这玄学是有事实依据吗

雷达站的分数只能说明linux+极简模式确实更强,
玄学就是给了一个windows能用的极简模式,但是效果会不会打折,不知道
回复

使用道具 举报

     
发表于 2026-8-15 16:02 来自手机 | 显示全部楼层
Windows版本显然还不算稳定,现在那几个发现极简模式问题的佬都在努力把win版本稳定下来
回复

使用道具 举报

     
发表于 2026-8-15 16:12 | 显示全部楼层
考虑到前面没有“正确使用”dsh的评分的干扰,实际极简模式+pro max的得分大概在100左右?
回复

使用道具 举报

     
发表于 2026-8-15 16:14 | 显示全部楼层
zhanglei1943 发表于 2026-8-15 16:12
考虑到前面没有“正确使用”dsh的评分的干扰,实际极简模式+pro max的得分大概在100左右? ...

这个干扰应该一直存在,因为不是每个人都会加提示词的只能说应该会大于等于现在的值
回复

使用道具 举报

     
发表于 2026-8-15 16:17 | 显示全部楼层

实验至少可以确认确实会有CoT的偏移 什么普池vs定向池

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-15 16:17 | 显示全部楼层
我一直没搞明白, ds这种没有多模态能力的ai, 为啥测试用的都是"一句话生成游戏"之类的.
除了给他配一个识图ai之外, 还有别的吗? 生图这些能力是怎么搞

—— 来自 S1Fun
回复

使用道具 举报

     
发表于 2026-8-15 16:19 来自手机 | 显示全部楼层
NeloAngelo 发表于 2026-8-15 16:17
我一直没搞明白, ds这种没有多模态能力的ai, 为啥测试用的都是"一句话生成游戏"之类的.
除了给他配一个识图 ...

一句话生成游戏最好展示。生成的游戏是用代码渲染出来的,不需要有多模态能力

评分

参与人数 1战斗力 +1 收起 理由
NeloAngelo + 1

查看全部评分

回复

使用道具 举报

     
发表于 2026-8-15 16:21 | 显示全部楼层
NeloAngelo 发表于 2026-8-15 16:17
我一直没搞明白, ds这种没有多模态能力的ai, 为啥测试用的都是"一句话生成游戏"之类的.
除了给他配一个识图 ...

没有识图能力不代表没有自己画素材或者去网上找素材的能力。缺多模态只是容易影响审美,因为他自己看不到自己画的是啥。
回复

使用道具 举报

发表于 2026-8-15 16:22 来自手机 | 显示全部楼层
野蛮人之夜 发表于 2026-8-15 15:40
我先前问过大肥鱼,它解释说"let me"是站在原地说“让我想想”,"we need"是已经看见方向,"let's do"是 ...

如果是这样的话,是不是可以判定deepseek v4 flash+deepseek harness(唤起sub agent)已经可以胜任一些在K3 max集群里不会出现大量wait的场景了?
回复

使用道具 举报

     
发表于 2026-8-15 16:22 | 显示全部楼层
藤子也是从梁子水管接出来的,价格基本上等于涨价前,没买opencodego的也可以看看藤子的

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-15 16:22 | 显示全部楼层
zhanglei1943 发表于 2026-8-15 16:12
考虑到前面没有“正确使用”dsh的评分的干扰,实际极简模式+pro max的得分大概在100左右? ...

看历史曲线凌晨到过98,后来被瞬间蹬回92。不知道是确实有方差,还是那个时间段有不少不明就里的人去蹬,特别是外国社区可能还没有传播开来?
回复

使用道具 举报

     
发表于 2026-8-15 16:26 | 显示全部楼层
这些接了官方的管子的虽然现在还没公告,但我不太信不会随官方调价的。DS也不太可能和他们签了非常死的不能改的长期价格协议。
回复

使用道具 举报

     
发表于 2026-8-15 16:29 | 显示全部楼层
IIIIIlllllIIIII 发表于 2026-8-15 16:17
实验至少可以确认确实会有CoT的偏移 什么普池vs定向池

梦回护石表…

—— 来自 S1Fun
回复

使用道具 举报

     
发表于 2026-8-15 16:32 | 显示全部楼层
龙骑士尹志平 发表于 2026-8-15 16:22
藤子也是从梁子水管接出来的,价格基本上等于涨价前,没买opencodego的也可以看看藤子的

...

如果用V4F那不如直接买opencode的,opencode对于重度使用者来说比官方没涨价之前便宜多了,10刀/月V4F近乎无限量使用,还能时不时切换别的模型
回复

使用道具 举报

     
发表于 2026-8-15 16:32 | 显示全部楼层
国内的不是经常有注入提示词, 现在的情况又对提示词特敏感, 不是很看好
而且,我不相信他们不涨价
回复

使用道具 举报

     
发表于 2026-8-15 16:35 | 显示全部楼层
你们说灰测版本有没有可能是把dsh的极简版包装了一个api给大家用的
回复

使用道具 举报

     
发表于 2026-8-15 16:38 | 显示全部楼层
闭源模型的api肯定不全是裸模型,前面应该都有一层harness的。
回复

使用道具 举报

     
发表于 2026-8-15 16:41 | 显示全部楼层
但是雷达站默认就是用极简模式跑的吧    Re:Source
回复

使用道具 举报

     
发表于 2026-8-15 16:46 | 显示全部楼层
王兰花秀丽 发表于 2026-8-15 16:41
但是雷达站默认就是用极简模式跑的吧    Re:Source

显然不是。昨天这个问题发酵前,dsh模式的pro还在84-86左右。
回复

使用道具 举报

     
发表于 2026-8-15 16:46 | 显示全部楼层
现在有搜索能力了, 经常会网上搜问题答案了,  又试了一下坦克大战, flash就自己网上扒了一个开源项目下来,然后简单修改交差, 真.完美还原
回复

使用道具 举报

     
发表于 2026-8-15 16:50 | 显示全部楼层
前面说的那个极简模式的插件效果大吗?这边想做个网页可能需要用到 skill,如果差别不大我就直接跑了。
回复

使用道具 举报

发表于 2026-8-15 16:52 来自手机 | 显示全部楼层
有意思,vllm部署的flash,问它test或hi
max很简短,we need开头
high low反而思考一堆,也不用we

纯API最简调用,无system prompt
回复

使用道具 举报

     
发表于 2026-8-15 16:56 | 显示全部楼层
HazukiShion 发表于 2026-8-15 16:50
前面说的那个极简模式的插件效果大吗?这边想做个网页可能需要用到 skill,如果差别不大我就直接跑了。 ...

dsh-anchored-standard, 有技能的, 首轮锚定, 然后第二轮对话就恢复正常了
回复

使用道具 举报

     
发表于 2026-8-15 17:03 | 显示全部楼层
看到现在,感觉和我这写文写提示词画图的影响不大,我主要还是对话模式,不用搞代码,也没有很多纪要之类的整理,还是先用cherry studio讨论和写正文吧,只是希望对“不是而是”和破折号的约束强一点,这4000字二十多个破折号我真服了

感觉楼友们和大肥鱼现在的状态:


—— 来自 S1Fun

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

发表于 2026-8-15 17:06 来自手机 | 显示全部楼层
龙骑士尹志平 发表于 2026-8-15 16:22
藤子也是从梁子水管接出来的,价格基本上等于涨价前,没买opencodego的也可以看看藤子的

...

Deepseek还没有正式涨价,正式涨价以后不可能保持不变的。
回复

使用道具 举报

     
发表于 2026-8-15 17:16 | 显示全部楼层
装插件又把dsh装崩了 懒得修了 等大佬们掏出稳定版我再上  
回复

使用道具 举报

发表于 2026-8-15 17:22 来自手机 | 显示全部楼层
藤子有自己部署的,企业版文档里会特别说明跟原厂直连的区别。别的几家应该也都是自部署

但跟不跟涨就难说了
回复

使用道具 举报

     
发表于 2026-8-15 17:35 | 显示全部楼层
唠叨 发表于 2026-8-15 17:16
装插件又把dsh装崩了 懒得修了 等大佬们掏出稳定版我再上

我让他写了个插件,基本思路是错误的情况会把错的隔离掉,必须保证dsh核心能够启动。又写了一个skill,强制要求新写的插件首先要隔离测试,备份原来的配置

目前基本没有自己把自己弄残了的情况了
回复

使用道具 举报

发表于 2026-8-15 18:00 | 显示全部楼层
唠叨 发表于 2026-8-15 17:16
装插件又把dsh装崩了 懒得修了 等大佬们掏出稳定版我再上

开两个dsh,用一个给另一个装,出问题了也好回滚
回复

使用道具 举报

     
发表于 2026-8-15 18:01 | 显示全部楼层
https://github.com/SheberDavid/v4-flash-godmode-opencode-go  发现一个给opencode go适配的flash加强插件
回复

使用道具 举报

     
发表于 2026-8-15 18:01 | 显示全部楼层
用hermes在dsh上跑了个实验对比,flash是没提升的:结论:router-standard 对 Flash 没有可测提升
4 任务 × 2 版完整矩阵(Flash deepseek-v4-flash,headless,每轮独立 cwd + 事件日志):

任务        指标        router        base(无 router)        差异
T1 构建(fibonacci)        steps/calls/chars        5 / 4 / 716        6 / 5 / 1323        router 收敛(base 多问了用户问题)
T2 构建(todo CLI)        steps/calls/errs        7 / 6 / 3        4 / 3 / 1        base 收敛(router 多试 2 次运行验证)
T3 修复(3 个 bug)        steps/calls        5 / 6        4 / 5        产物完全一致,3 bug 全修对
T4 分析        steps/calls        2 / 1        2 / 1        零差异
产物质量 4/4 全达标(T2 两版 7 项功能全通过;T3 两版修复后文件 diff 完全一致;T4 分析质量相当)。

为什么——机制三重叠加(与作者论文自洽)
Flash 是 catalog-immune 的:作者自己的数据(§B)说 Flash 换 persona 轨迹巨变但分数不动——我们实测正是这个:persona 从 weak 换 react、工具面从 4 个切 29 个,产物质量完全不变。
简单任务饱和:fib/todo/修 3 bug 都是 Flash 轻松任务(作者 P2 重访也测出简单任务 spec/mixed/react 全 5/5)。router 的差异只在 Pro + 复杂任务(Mario 10 vs 6 那类)才浮现。
headless 首轮路由失效(实测发现):system-prompt/assemble 先于 user/message 触发 → 首轮拿到的是 weak 兜底 persona,任务分类(react/spec)第二轮才生效——router 宣称的"首轮按任务注入"在 headless 单轮问答下根本没发生。
回复

使用道具 举报

发表于 2026-8-15 18:13 | 显示全部楼层
goranger 发表于 2026-8-15 18:01
用hermes在dsh上跑了个实验对比,flash是没提升的:结论:router-standard 对 Flash 没有可测提升
4 任务  ...

思考过程输出变短了吗?如果变短了,token消耗减少本身也是一种收益
回复

使用道具 举报

     
发表于 2026-8-15 18:14 | 显示全部楼层
→熙← 发表于 2026-8-15 16:56
dsh-anchored-standard, 有技能的, 首轮锚定, 然后第二轮对话就恢复正常了

首轮调用 skill 就可以了吗?非极简模式也可以?
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-25 04:42 , Processed in 0.165937 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表