找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] DeepSeek V4-Flash-Vision-Exp 上线!多模态来啦|大模型讨论专楼

 火.. [复制链接]
     
发表于 2026-8-19 11:05 来自手机 | 显示全部楼层
hugosol 发表于 2026-8-19 10:43
这两天用了下gpt-5.6-sol,确实很强,逻辑比DS的模型要清晰很多
问题是太慢了(不知道是不是因为我开的只是 ...

ultra慢,只用xhigh和max档没多慢吧,看起来慢只是不像国产模型一样一直吐思考过程
回复

使用道具 举报

     
发表于 2026-8-19 11:08 来自手机 | 显示全部楼层
hugosol 发表于 2026-8-19 10:43
这两天用了下gpt-5.6-sol,确实很强,逻辑比DS的模型要清晰很多
问题是太慢了(不知道是不是因为我开的只是 ...

很多情况开high就够了

—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-19 11:12 | 显示全部楼层
本帖最后由 2017.05.04 于 2026-8-19 11:13 编辑


用户赶都赶不走.jpg

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-19 11:17 | 显示全部楼层
用harness做一个嵌入式固件开发,经常遇到播放程序卡死,harness傻乎乎等的情况,另开一个会话,监视开发会话,发现他不正常就把他拉回来
回复

使用道具 举报

     
发表于 2026-8-19 11:18 来自手机 | 显示全部楼层
雷达图上v4p max with dsh已经稳定在97分很久了,这么看来最终v4p的评价只能说中规中矩,稳超terra,比sol差一点点
回复

使用道具 举报

     
发表于 2026-8-19 11:25 | 显示全部楼层
本帖最后由 cscbzcbz 于 2026-8-19 11:27 编辑
蛋黄酱Release 发表于 2026-8-19 11:18
雷达图上v4p max with dsh已经稳定在97分很久了,这么看来最终v4p的评价只能说中规中矩,稳超terra,比sol ...


不错了,和官方测试数据给人的感觉基本符合,比最好的差一些
至少不是之前和flash拉不开差距的窘境了
回复

使用道具 举报

     
发表于 2026-8-19 11:25 | 显示全部楼层
GJRstone 发表于 2026-8-17 09:15
看今天涨价后出不出现API性能下降了。不下降就忍痛祝梁圣AGI顺利,还下降直接滑动变阻到梁处 ...

忍痛滑到梁处。我都没蹬了怎么还在api性能下降。难道说
回复

使用道具 举报

     
发表于 2026-8-19 11:26 | 显示全部楼层
好想用便宜快速的 pro 啊,flash 的智力在我的项目中撞墙了
回复

使用道具 举报

     
发表于 2026-8-19 11:26 来自手机 | 显示全部楼层
梁子能这几周内端出来pro的修复版吗?
回复

使用道具 举报

     
发表于 2026-8-19 11:27 来自手机 | 显示全部楼层
国算平台的kvcache的缓存时间是多久哇
回复

使用道具 举报

     
发表于 2026-8-19 11:31 | 显示全部楼层
zhongjie 发表于 2026-8-19 11:08
很多情况开high就够了

—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0

确实,感觉high够用,再往上很多是过度思考或者考虑一些很细的边界情况
不过改成high感觉token用量还是差不多,现在plus套餐只用Sol模型额度都不太够
还有个问题是上下文实在按272K算非常不耐用,用DeepSeek我可以用很多轮对话不停地聊,Sol问一个简单问题都要想半天再回,然后上下文又暴涨,感觉更偏向one-shot的风格
回复

使用道具 举报

     
发表于 2026-8-19 11:34 | 显示全部楼层
hugosol 发表于 2026-8-19 10:43
这两天用了下gpt-5.6-sol,确实很强,逻辑比DS的模型要清晰很多
问题是太慢了(不知道是不是因为我开的只是 ...

只用了Sol medium,结论是规划非常全面,非常非常的全面,也不会出现Luna那种误解需求的问题,但是一上午两个多小时只能做完规划效率真的低了不少。而且效率下来了感觉工作流也需要跟着做些改变,便宜的D老师可以搞快速迭代的玩法,Sol基本就不要想了。

另一个角度来看,规划深度广度够了的话可能返工的情况也会少很多吧,至少目前来看几个中型需求还没有需要返工。
回复

使用道具 举报

     
发表于 2026-8-19 11:37 | 显示全部楼层
有没有办公室工作者分享一下经验,你们用什么harness或者claw,用flash还是pro来处理蛋疼的工作小结、周报之类的文本任务

Re:Source · Xiaomi 15
回复

使用道具 举报

发表于 2026-8-19 11:38 来自手机 | 显示全部楼层
飞天荷兰人 发表于 2026-8-19 08:59
哇噢,这个可以!感谢邀请,省了一波token。

邀请好友限时活动继续延长,体验OpenSquilla新功能畅享免费 ...

已薅 感谢可用
随意接力下

邀请好友限时活动继续延长,体验OpenSquilla新功能畅享免费token
https://tokenrhythm.studio/i/rf_tr_MmhV9iYdpQWuoDNqgNlv0P55

—— 来自 realme RMX5010, Android 15, 鹅球 v3.5.99
回复

使用道具 举报

发表于 2026-8-19 11:41 来自手机 | 显示全部楼层
hugosol 发表于 2026-8-19 11:31
确实,感觉high够用,再往上很多是过度思考或者考虑一些很细的边界情况
不过改成high感觉token用量还是差 ...

Tibo在推上给了解除上下文限制的方法。
但说实话,开一m上下文的话,用量烧的就更快了。
回复

使用道具 举报

     
发表于 2026-8-19 11:44 | 显示全部楼层
LeoDT 发表于 2026-8-19 11:34
只用了Sol medium,结论是规划非常全面,非常非常的全面,也不会出现Luna那种误解需求的问题,但是一上午 ...

gpt5.6目前确实最强,考虑的非常全面,但是对应的会有过度设计的弊端。我一般让deepseek做方案初稿(很聪明,意图理解相当到位,但是专业知识有短板),让gpt来评审会好点,否则无法兼顾质量和效率。
回复

使用道具 举报

     
发表于 2026-8-19 11:46 | 显示全部楼层
本帖最后由 hugosol 于 2026-8-19 11:53 编辑
LeoDT 发表于 2026-8-19 11:34
只用了Sol medium,结论是规划非常全面,非常非常的全面,也不会出现Luna那种误解需求的问题,但是一上午 ...

工作流变化非常大,主要是上下文焦虑严重了很多,现在总算体会到matt pocock的工作流最近为什么要做那些改动了
Sol会非常积极地自动触发MCP tool和subagent,research任务可以后台异步去跑然后先讨论别的,然后原本的grilling要变成批量提问,不然上下文估计吃不住
但是体验下来其实没有比原来DS那种雷厉风行的模式要好,或者说我越了解的领域越不需要Sol这种级别的思考量,大方向错了我可以直接给agent指出来,细节问题不是很严重的话交给agent实现代码的时候自己去试错也没问题
总之现在DSV4flash和pro这种级别的模型其实已经非常够用了,我实在不想看到以后的模型继续进步都变成Sol这种风格
回复

使用道具 举报

     
发表于 2026-8-19 11:48 | 显示全部楼层
看了一圈,超算互联网这个0731基本就是原来的价格?好像也没有峰谷价,是他们自己部署的吧。

是我算错了嘛,有没有什么坑呀,求指导
回复

使用道具 举报

     
发表于 2026-8-19 11:51 | 显示全部楼层
xiaohanne 发表于 2026-8-19 11:41
Tibo在推上给了解除上下文限制的方法。
但说实话,开一m上下文的话,用量烧的就更快了。 ...

但老实说感觉不是一个参数的问题
我问个简单的事实,可以通过前面上下文总结出来的,它非要给我雷霆大思考一圈没漏洞了才敢回答,就是模型本身给人的感觉更大更笨重
同样的上下文长度DS能进行更多轮次的交互,虽然没有那么全面和严谨就是了
回复

使用道具 举报

     
发表于 2026-8-19 11:53 来自手机 | 显示全部楼层
本帖最后由 wfhtony 于 2026-8-19 11:55 编辑
cscbzcbz 发表于 2026-8-19 11:48
看了一圈,超算互联网这个0731基本就是原来的价格?好像也没有峰谷价,是他们自己部署的吧。

是我算错了嘛 ...

现在新用户有八块五的套餐可以试试咸淡。
如果你能接受高峰期频繁429报错(频繁到可能一条正常的指令可能都报错到执行不了重试到强行中断)的话,可以考虑定30块的token plan。

—— 來自 Xiaomi 23116PN5BC, Android 16, 鵝球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-19 11:55 | 显示全部楼层
wfhtony 发表于 2026-8-19 11:53
现在新用户有八块五的套餐可以试试咸淡。
如果你能接受高峰期频繁429报错(频繁到可能一条正常的指令可能 ...

谢谢,等我吧剩下的ocg额度蹬完试试
回复

使用道具 举报

     
发表于 2026-8-19 11:58 | 显示全部楼层
LeoDT 发表于 2026-8-19 11:34
只用了Sol medium,结论是规划非常全面,非常非常的全面,也不会出现Luna那种误解需求的问题,但是一上午 ...

看起来还没品尝到sol的sha256地狱

—— 来自 S1Fun
回复

使用道具 举报

     
发表于 2026-8-19 12:02 来自手机 | 显示全部楼层
千千千千鸟 发表于 2026-8-19 11:02
那看来要下载CODEX了,我用的是pi

pi也能调,你让他自己调就行

—— 来自 Xiaomi 23127PN0CC, Android 16, 鹅球 v4.0-alpha
回复

使用道具 举报

发表于 2026-8-19 12:03 | 显示全部楼层
本帖最后由 野蛮人之夜 于 2026-8-19 12:05 编辑
ml1642879 发表于 2026-8-19 11:37
有没有办公室工作者分享一下经验,你们用什么harness或者claw,用flash还是pro来处理蛋疼的工作小结、周报 ...

只涉及文本不涉及格式的话,网页版?免费
或者你在电脑上装个latex编辑器,要求网页版给你输出完整的latex格式,你自己编译成pdf格式,再用办公软件读出来转格式
回复

使用道具 举报

     
发表于 2026-8-19 12:04 | 显示全部楼层
cscbzcbz 发表于 2026-8-19 11:48
看了一圈,超算互联网这个0731基本就是原来的价格?好像也没有峰谷价,是他们自己部署的吧。

是我算错了嘛 ...

坑就是蹬的人太多了, 直接蹬爆
回复

使用道具 举报

     
发表于 2026-8-19 12:05 | 显示全部楼层
gpt的模型风格就是会想得很细很全面
刚接触简直惊为天人,哇
用久了会发现其实也就那样,如果你习惯人工多次介入来迭代修改的话5.6sol反而会显得有点慢。
回复

使用道具 举报

     
发表于 2026-8-19 12:10 | 显示全部楼层

打开1m上下文试试

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-19 12:12 | 显示全部楼层
本帖最后由 LeoDT 于 2026-8-19 12:15 编辑
R.I.P 发表于 2026-8-19 11:58
看起来还没品尝到sol的sha256地狱

—— 来自 S1Fun

这个规划阶段被我发现了一次阻止了,它是真喜欢过度设计和过度验证。而且感觉训进去过多best practice,但是该不该用他并没有标准。

编辑:其实是真想要个可以随便用的Flash,前半个月用Flash用的太舒服了。
回复

使用道具 举报

     
发表于 2026-8-19 12:13 | 显示全部楼层
其实 GPT 才是很好的执行模型…做规划很容易被细节抓住往前跑…

—— 来自 S1Fun
回复

使用道具 举报

     
发表于 2026-8-19 12:25 | 显示全部楼层
野蛮人之夜 发表于 2026-8-19 12:03
只涉及文本不涉及格式的话,网页版?免费
或者你在电脑上装个latex编辑器,要求网页版给你输出完整的latex ...

我对版式与文件格式倒没什么要求,只是想要文笔好的代笔AI,再来个能锦上添花的使用API接口的软件
我现在用的是Cherrystudio + Flash,虽然token使用量不大,但命中缓存比例很低,不知道是不是文书编写这类工作的自身特性导致
回复

使用道具 举报

     
发表于 2026-8-19 12:26 | 显示全部楼层
→熙← 发表于 2026-8-19 12:04
坑就是蹬的人太多了, 直接蹬爆

不太妙啊,希望别涨价
回复

使用道具 举报

     
发表于 2026-8-19 12:29 来自手机 | 显示全部楼层
nianiania 发表于 2026-8-18 18:02
今天才被人教育了一顿,token 是纯消耗品,没了就是没了,硬件是资产,等出了更强更好的新开源那就重新部 ...

部署运维也是钱 你是爱好者干的活也是要折算成钱
回复

使用道具 举报

     
发表于 2026-8-19 12:36 | 显示全部楼层
LeoDT 发表于 2026-8-19 12:12
这个规划阶段被我发现了一次阻止了,它是真喜欢过度设计和过度验证。而且感觉训进去过多best practice,但 ...

qwen 3.8 27b=思考更长能力差不多的v4flash
我去看了一圈感觉买两个2080ti 22g回来搭27b确实非常划算
回复

使用道具 举报

     
发表于 2026-8-19 12:38 | 显示全部楼层
Gemini 3.7 F走OpenCode的话国内不用代理
回复

使用道具 举报

发表于 2026-8-19 12:41 | 显示全部楼层
qwen3.8max我网页版用了下感觉有点gpt的风格,不知道为啥
回复

使用道具 举报

     
发表于 2026-8-19 12:43 | 显示全部楼层
本帖最后由 泰坦失足 于 2026-8-19 12:53 编辑

Claude和GPT整天发新闻说自己解决了XX数学问题还有有用的。在琢磨要不要退掉ChatGPT Pro去买Grok成品号时候想了下, 只有这两家的模型顶尖到解决了数学问题. 什么我们模型找到xx漏洞, 一句话做出xx对我都没啥吸引力. 就是我手里的5.6 Pro和very high唯一区别在于思考时间长很多很多, 一个调研任务能跑1小时.
回复

使用道具 举报

     
发表于 2026-8-19 12:50 | 显示全部楼层
本帖最后由 SmterC 于 2026-8-19 12:51 编辑

之前就觉得GPT规划方面很别扭
面对需求各种删,强调MVP不能太复杂
实现细节上过于较真,甚至把需求改歪了
所以有没有好的规划模型推荐
适合matt skills的wayfinder,grill之类的    Re:Source
回复

使用道具 举报

     
发表于 2026-8-19 12:53 | 显示全部楼层
SmterC 发表于 2026-8-19 12:50
之前就觉得GPT规划方面很别扭
面对需求各种删,强调MVP不能太复杂
实现细节上过于较真,甚至把需求改歪了

据说Claude系列比较适合?
但是a\风控我,我也懒得上赶着送钱了
回复

使用道具 举报

     
发表于 2026-8-19 12:56 | 显示全部楼层
舞以 发表于 2026-8-19 12:53
据说Claude系列比较适合?
但是a\风控我,我也懒得上赶着送钱了

4.6 的时候还行,现在 Opus5 和 sol5.6 半斤八两,而且中文巨烂。fabale5 倒是明显好一头,但是用不起也只有 API。所以现在有个 5.6 就够了

—— 来自 S1Fun
回复

使用道具 举报

发表于 2026-8-19 13:02 来自手机 | 显示全部楼层
hugosol 发表于 2026-8-19 11:51
但老实说感觉不是一个参数的问题
我问个简单的事实,可以通过前面上下文总结出来的,它非要给我雷霆大思 ...

因为5.6本质上也是一个后训练提分的模型。
凡是靠后训练提分的,个个都是雷霆大思考。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-24 22:32 , Processed in 0.115567 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表