最有活的ai
—— 来自 HUAWEI HOP-AL10, Android 16, 鹅球 v4.0
真几把鬼扯,建议上双盲测试,看看这些奇巧淫技是真有用还是心理作用
怎么3点左右开始v4pro又开始let me了
ternayark 发表于 2026-8-15 14:44
let me和we need到底不同在哪里
我看K3 max也是let me起手啊
我先前问过大肥鱼,它解释说"let me"是站在原地说“让我想想”,"we need"是已经看见方向,"let's do"是开始行动,"we can"是边做边确认“我们可以做到”,接着就是执行而不再犹豫。
let me 本身不是坏事,但如果出现得太频繁就说明模型在反复纠结
看雷达站,DSH Pro MAX IQ硬是蹬上去了,邪门的很。
雷达站的IQ上去,能说明这玄学是有事实依据吗
一般市民 发表于 2026-8-15 15:47
看雷达站,DSH Pro MAX IQ硬是蹬上去了,邪门的很。
雷达站的题目强制要求有docker,所以本身已经保证了linux环境
现在大家知道套路了,拿到题目的提示词后加一句:使用极简模式。直接开启最强状态,上分不奇怪。
现在96分,比用codex高了整整7分,而且用dsh的样本数据还更多,已经很能说明问题了
noneoneone 发表于 2026-8-15 15:54
雷达站的IQ上去,能说明这玄学是有事实依据吗
雷达站的分数只能说明linux+极简模式确实更强,
玄学就是给了一个windows能用的极简模式,但是效果会不会打折,不知道
Windows版本显然还不算稳定,现在那几个发现极简模式问题的佬都在努力把win版本稳定下来
考虑到前面没有“正确使用”dsh的评分的干扰,实际极简模式+pro max的得分大概在100左右?
zhanglei1943 发表于 2026-8-15 16:12
考虑到前面没有“正确使用”dsh的评分的干扰,实际极简模式+pro max的得分大概在100左右? ...
这个干扰应该一直存在,因为不是每个人都会加提示词的只能说应该会大于等于现在的值
实验至少可以确认确实会有CoT的偏移 什么普池vs定向池
我一直没搞明白, ds这种没有多模态能力的ai, 为啥测试用的都是"一句话生成游戏"之类的.
除了给他配一个识图ai之外, 还有别的吗? 生图这些能力是怎么搞
—— 来自 S1Fun
NeloAngelo 发表于 2026-8-15 16:17
我一直没搞明白, ds这种没有多模态能力的ai, 为啥测试用的都是"一句话生成游戏"之类的.
除了给他配一个识图 ...
一句话生成游戏最好展示。生成的游戏是用代码渲染出来的,不需要有多模态能力
NeloAngelo 发表于 2026-8-15 16:17
我一直没搞明白, ds这种没有多模态能力的ai, 为啥测试用的都是"一句话生成游戏"之类的.
除了给他配一个识图 ...
没有识图能力不代表没有自己画素材或者去网上找素材的能力。缺多模态只是容易影响审美,因为他自己看不到自己画的是啥。
野蛮人之夜 发表于 2026-8-15 15:40
我先前问过大肥鱼,它解释说"let me"是站在原地说“让我想想”,"we need"是已经看见方向,"let's do"是 ...
如果是这样的话,是不是可以判定deepseek v4 flash+deepseek harness(唤起sub agent)已经可以胜任一些在K3 max集群里不会出现大量wait的场景了?
藤子也是从梁子水管接出来的,价格基本上等于涨价前,没买opencodego的也可以看看藤子的
zhanglei1943 发表于 2026-8-15 16:12
考虑到前面没有“正确使用”dsh的评分的干扰,实际极简模式+pro max的得分大概在100左右? ...
看历史曲线凌晨到过98,后来被瞬间蹬回92。不知道是确实有方差,还是那个时间段有不少不明就里的人去蹬,特别是外国社区可能还没有传播开来?
这些接了官方的管子的虽然现在还没公告,但我不太信不会随官方调价的。DS也不太可能和他们签了非常死的不能改的长期价格协议。
IIIIIlllllIIIII 发表于 2026-8-15 16:17
实验至少可以确认确实会有CoT的偏移 什么普池vs定向池
梦回护石表…
—— 来自 S1Fun
龙骑士尹志平 发表于 2026-8-15 16:22
藤子也是从梁子水管接出来的,价格基本上等于涨价前,没买opencodego的也可以看看藤子的
...
如果用V4F那不如直接买opencode的,opencode对于重度使用者来说比官方没涨价之前便宜多了,10刀/月V4F近乎无限量使用,还能时不时切换别的模型
国内的不是经常有注入提示词, 现在的情况又对提示词特敏感, 不是很看好
而且,我不相信他们不涨价
你们说灰测版本有没有可能是把dsh的极简版包装了一个api给大家用的
闭源模型的api肯定不全是裸模型,前面应该都有一层harness的。
但是雷达站默认就是用极简模式跑的吧 Re:Source
王兰花秀丽 发表于 2026-8-15 16:41
但是雷达站默认就是用极简模式跑的吧 Re:Source
显然不是。昨天这个问题发酵前,dsh模式的pro还在84-86左右。
现在有搜索能力了, 经常会网上搜问题答案了,又试了一下坦克大战, flash就自己网上扒了一个开源项目下来,然后简单修改交差, 真.完美还原
前面说的那个极简模式的插件效果大吗?这边想做个网页可能需要用到 skill,如果差别不大我就直接跑了。
有意思,vllm部署的flash,问它test或hi
max很简短,we need开头
high low反而思考一堆,也不用we
纯API最简调用,无system prompt
HazukiShion 发表于 2026-8-15 16:50
前面说的那个极简模式的插件效果大吗?这边想做个网页可能需要用到 skill,如果差别不大我就直接跑了。 ...
dsh-anchored-standard, 有技能的, 首轮锚定, 然后第二轮对话就恢复正常了
看到现在,感觉和我这写文写提示词画图的影响不大,我主要还是对话模式,不用搞代码,也没有很多纪要之类的整理,还是先用cherry studio讨论和写正文吧,只是希望对“不是而是”和破折号的约束强一点,这4000字二十多个破折号我真服了
感觉楼友们和大肥鱼现在的状态:
—— 来自 S1Fun
龙骑士尹志平 发表于 2026-8-15 16:22
藤子也是从梁子水管接出来的,价格基本上等于涨价前,没买opencodego的也可以看看藤子的
...
Deepseek还没有正式涨价,正式涨价以后不可能保持不变的。
装插件又把dsh装崩了 懒得修了 等大佬们掏出稳定版我再上
藤子有自己部署的,企业版文档里会特别说明跟原厂直连的区别。别的几家应该也都是自部署
但跟不跟涨就难说了
唠叨 发表于 2026-8-15 17:16
装插件又把dsh装崩了 懒得修了 等大佬们掏出稳定版我再上
我让他写了个插件,基本思路是错误的情况会把错的隔离掉,必须保证dsh核心能够启动。又写了一个skill,强制要求新写的插件首先要隔离测试,备份原来的配置
目前基本没有自己把自己弄残了的情况了
唠叨 发表于 2026-8-15 17:16
装插件又把dsh装崩了 懒得修了 等大佬们掏出稳定版我再上
开两个dsh,用一个给另一个装,出问题了也好回滚
https://github.com/SheberDavid/v4-flash-godmode-opencode-go发现一个给opencode go适配的flash加强插件
用hermes在dsh上跑了个实验对比,flash是没提升的:结论:router-standard 对 Flash 没有可测提升
4 任务 × 2 版完整矩阵(Flash deepseek-v4-flash,headless,每轮独立 cwd + 事件日志):
任务 指标 router base(无 router) 差异
T1 构建(fibonacci) steps/calls/chars 5 / 4 / 716 6 / 5 / 1323 router 收敛(base 多问了用户问题)
T2 构建(todo CLI) steps/calls/errs 7 / 6 / 3 4 / 3 / 1 base 收敛(router 多试 2 次运行验证)
T3 修复(3 个 bug) steps/calls 5 / 6 4 / 5 产物完全一致,3 bug 全修对
T4 分析 steps/calls 2 / 1 2 / 1 零差异
产物质量 4/4 全达标(T2 两版 7 项功能全通过;T3 两版修复后文件 diff 完全一致;T4 分析质量相当)。
为什么——机制三重叠加(与作者论文自洽)
Flash 是 catalog-immune 的:作者自己的数据(§B)说 Flash 换 persona 轨迹巨变但分数不动——我们实测正是这个:persona 从 weak 换 react、工具面从 4 个切 29 个,产物质量完全不变。
简单任务饱和:fib/todo/修 3 bug 都是 Flash 轻松任务(作者 P2 重访也测出简单任务 spec/mixed/react 全 5/5)。router 的差异只在 Pro + 复杂任务(Mario 10 vs 6 那类)才浮现。
headless 首轮路由失效(实测发现):system-prompt/assemble 先于 user/message 触发 → 首轮拿到的是 weak 兜底 persona,任务分类(react/spec)第二轮才生效——router 宣称的"首轮按任务注入"在 headless 单轮问答下根本没发生。
goranger 发表于 2026-8-15 18:01
用hermes在dsh上跑了个实验对比,flash是没提升的:结论:router-standard 对 Flash 没有可测提升
4 任务...
思考过程输出变短了吗?如果变短了,token消耗减少本身也是一种收益
→熙← 发表于 2026-8-15 16:56
dsh-anchored-standard, 有技能的, 首轮锚定, 然后第二轮对话就恢复正常了
首轮调用 skill 就可以了吗?非极简模式也可以?