hugosol 发表于 2026-8-19 10:43
这两天用了下gpt-5.6-sol,确实很强,逻辑比DS的模型要清晰很多
问题是太慢了(不知道是不是因为我开的只是 ...
ultra慢,只用xhigh和max档没多慢吧,看起来慢只是不像国产模型一样一直吐思考过程
hugosol 发表于 2026-8-19 10:43
这两天用了下gpt-5.6-sol,确实很强,逻辑比DS的模型要清晰很多
问题是太慢了(不知道是不是因为我开的只是 ...
很多情况开high就够了
—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0
本帖最后由 2017.05.04 于 2026-8-19 11:13 编辑
用户赶都赶不走.jpg
用harness做一个嵌入式固件开发,经常遇到播放程序卡死,harness傻乎乎等的情况,另开一个会话,监视开发会话,发现他不正常就把他拉回来
雷达图上v4p max with dsh已经稳定在97分很久了,这么看来最终v4p的评价只能说中规中矩,稳超terra,比sol差一点点
本帖最后由 cscbzcbz 于 2026-8-19 11:27 编辑
蛋黄酱Release 发表于 2026-8-19 11:18
雷达图上v4p max with dsh已经稳定在97分很久了,这么看来最终v4p的评价只能说中规中矩,稳超terra,比sol ...
不错了,和官方测试数据给人的感觉基本符合,比最好的差一些
至少不是之前和flash拉不开差距的窘境了
GJRstone 发表于 2026-8-17 09:15
看今天涨价后出不出现API性能下降了。不下降就忍痛祝梁圣AGI顺利,还下降直接滑动变阻到梁处 ...
忍痛滑到梁处。我都没蹬了怎么还在api性能下降。难道说
好想用便宜快速的 pro 啊,flash 的智力在我的项目中撞墙了
梁子能这几周内端出来pro的修复版吗?
国算平台的kvcache的缓存时间是多久哇
zhongjie 发表于 2026-8-19 11:08
很多情况开high就够了
—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0
确实,感觉high够用,再往上很多是过度思考或者考虑一些很细的边界情况
不过改成high感觉token用量还是差不多,现在plus套餐只用Sol模型额度都不太够
还有个问题是上下文实在按272K算非常不耐用,用DeepSeek我可以用很多轮对话不停地聊,Sol问一个简单问题都要想半天再回,然后上下文又暴涨,感觉更偏向one-shot的风格
hugosol 发表于 2026-8-19 10:43
这两天用了下gpt-5.6-sol,确实很强,逻辑比DS的模型要清晰很多
问题是太慢了(不知道是不是因为我开的只是 ...
只用了Sol medium,结论是规划非常全面,非常非常的全面,也不会出现Luna那种误解需求的问题,但是一上午两个多小时只能做完规划效率真的低了不少。而且效率下来了感觉工作流也需要跟着做些改变,便宜的D老师可以搞快速迭代的玩法,Sol基本就不要想了。
另一个角度来看,规划深度广度够了的话可能返工的情况也会少很多吧,至少目前来看几个中型需求还没有需要返工。
有没有办公室工作者分享一下经验,你们用什么harness或者claw,用flash还是pro来处理蛋疼的工作小结、周报之类的文本任务
Re:Source · Xiaomi 15
飞天荷兰人 发表于 2026-8-19 08:59
哇噢,这个可以!感谢邀请,省了一波token。
邀请好友限时活动继续延长,体验OpenSquilla新功能畅享免费 ...
已薅 感谢可用
随意接力下。
邀请好友限时活动继续延长,体验OpenSquilla新功能畅享免费token
https://tokenrhythm.studio/i/rf_tr_MmhV9iYdpQWuoDNqgNlv0P55
—— 来自 realme RMX5010, Android 15, 鹅球 v3.5.99
hugosol 发表于 2026-8-19 11:31
确实,感觉high够用,再往上很多是过度思考或者考虑一些很细的边界情况
不过改成high感觉token用量还是差 ...
Tibo在推上给了解除上下文限制的方法。
但说实话,开一m上下文的话,用量烧的就更快了。
LeoDT 发表于 2026-8-19 11:34
只用了Sol medium,结论是规划非常全面,非常非常的全面,也不会出现Luna那种误解需求的问题,但是一上午 ...
gpt5.6目前确实最强,考虑的非常全面,但是对应的会有过度设计的弊端。我一般让deepseek做方案初稿(很聪明,意图理解相当到位,但是专业知识有短板),让gpt来评审会好点,否则无法兼顾质量和效率。
本帖最后由 hugosol 于 2026-8-19 11:53 编辑
LeoDT 发表于 2026-8-19 11:34
只用了Sol medium,结论是规划非常全面,非常非常的全面,也不会出现Luna那种误解需求的问题,但是一上午 ...
工作流变化非常大,主要是上下文焦虑严重了很多,现在总算体会到matt pocock的工作流最近为什么要做那些改动了
Sol会非常积极地自动触发MCP tool和subagent,research任务可以后台异步去跑然后先讨论别的,然后原本的grilling要变成批量提问,不然上下文估计吃不住
但是体验下来其实没有比原来DS那种雷厉风行的模式要好,或者说我越了解的领域越不需要Sol这种级别的思考量,大方向错了我可以直接给agent指出来,细节问题不是很严重的话交给agent实现代码的时候自己去试错也没问题
总之现在DSV4flash和pro这种级别的模型其实已经非常够用了,我实在不想看到以后的模型继续进步都变成Sol这种风格
看了一圈,超算互联网这个0731基本就是原来的价格?好像也没有峰谷价,是他们自己部署的吧。
是我算错了嘛,有没有什么坑呀,求指导
xiaohanne 发表于 2026-8-19 11:41
Tibo在推上给了解除上下文限制的方法。
但说实话,开一m上下文的话,用量烧的就更快了。 ...
但老实说感觉不是一个参数的问题
我问个简单的事实,可以通过前面上下文总结出来的,它非要给我雷霆大思考一圈没漏洞了才敢回答,就是模型本身给人的感觉更大更笨重
同样的上下文长度DS能进行更多轮次的交互,虽然没有那么全面和严谨就是了
本帖最后由 wfhtony 于 2026-8-19 11:55 编辑
cscbzcbz 发表于 2026-8-19 11:48
看了一圈,超算互联网这个0731基本就是原来的价格?好像也没有峰谷价,是他们自己部署的吧。
是我算错了嘛 ...
现在新用户有八块五的套餐可以试试咸淡。
如果你能接受高峰期频繁429报错(频繁到可能一条正常的指令可能都报错到执行不了重试到强行中断)的话,可以考虑定30块的token plan。
—— 來自 Xiaomi 23116PN5BC, Android 16, 鵝球 v3.5.99
wfhtony 发表于 2026-8-19 11:53
现在新用户有八块五的套餐可以试试咸淡。
如果你能接受高峰期频繁429报错(频繁到可能一条正常的指令可能 ...
谢谢,等我吧剩下的ocg额度蹬完试试
LeoDT 发表于 2026-8-19 11:34
只用了Sol medium,结论是规划非常全面,非常非常的全面,也不会出现Luna那种误解需求的问题,但是一上午 ...
看起来还没品尝到sol的sha256地狱
—— 来自 S1Fun
千千千千鸟 发表于 2026-8-19 11:02
那看来要下载CODEX了,我用的是pi
pi也能调,你让他自己调就行
—— 来自 Xiaomi 23127PN0CC, Android 16, 鹅球 v4.0-alpha
本帖最后由 野蛮人之夜 于 2026-8-19 12:05 编辑
ml1642879 发表于 2026-8-19 11:37
有没有办公室工作者分享一下经验,你们用什么harness或者claw,用flash还是pro来处理蛋疼的工作小结、周报 ...
只涉及文本不涉及格式的话,网页版?免费
或者你在电脑上装个latex编辑器,要求网页版给你输出完整的latex格式,你自己编译成pdf格式,再用办公软件读出来转格式
cscbzcbz 发表于 2026-8-19 11:48
看了一圈,超算互联网这个0731基本就是原来的价格?好像也没有峰谷价,是他们自己部署的吧。
是我算错了嘛 ...
坑就是蹬的人太多了, 直接蹬爆
gpt的模型风格就是会想得很细很全面
刚接触简直惊为天人,哇
用久了会发现其实也就那样,如果你习惯人工多次介入来迭代修改的话5.6sol反而会显得有点慢。
打开1m上下文试试
本帖最后由 LeoDT 于 2026-8-19 12:15 编辑
R.I.P 发表于 2026-8-19 11:58
看起来还没品尝到sol的sha256地狱
—— 来自 S1Fun
这个规划阶段被我发现了一次阻止了,它是真喜欢过度设计和过度验证。而且感觉训进去过多best practice,但是该不该用他并没有标准。
编辑:其实是真想要个可以随便用的Flash,前半个月用Flash用的太舒服了。
其实 GPT 才是很好的执行模型…做规划很容易被细节抓住往前跑…
—— 来自 S1Fun
野蛮人之夜 发表于 2026-8-19 12:03
只涉及文本不涉及格式的话,网页版?免费
或者你在电脑上装个latex编辑器,要求网页版给你输出完整的latex ...
我对版式与文件格式倒没什么要求,只是想要文笔好的代笔AI,再来个能锦上添花的使用API接口的软件
我现在用的是Cherrystudio + Flash,虽然token使用量不大,但命中缓存比例很低,不知道是不是文书编写这类工作的自身特性导致
→熙← 发表于 2026-8-19 12:04
坑就是蹬的人太多了, 直接蹬爆
不太妙啊,希望别涨价
LeoDT 发表于 2026-8-19 12:12
这个规划阶段被我发现了一次阻止了,它是真喜欢过度设计和过度验证。而且感觉训进去过多best practice,但 ...
qwen 3.8 27b=思考更长能力差不多的v4flash
我去看了一圈感觉买两个2080ti 22g回来搭27b确实非常划算
Gemini 3.7 F走OpenCode的话国内不用代理
qwen3.8max我网页版用了下感觉有点gpt的风格,不知道为啥
本帖最后由 泰坦失足 于 2026-8-19 12:53 编辑
Claude和GPT整天发新闻说自己解决了XX数学问题还有有用的。在琢磨要不要退掉ChatGPT Pro去买Grok成品号时候想了下, 只有这两家的模型顶尖到解决了数学问题. 什么我们模型找到xx漏洞, 一句话做出xx对我都没啥吸引力. 就是我手里的5.6 Pro和very high唯一区别在于思考时间长很多很多, 一个调研任务能跑1小时.
本帖最后由 SmterC 于 2026-8-19 12:51 编辑
之前就觉得GPT规划方面很别扭
面对需求各种删,强调MVP不能太复杂
实现细节上过于较真,甚至把需求改歪了
所以有没有好的规划模型推荐
适合matt skills的wayfinder,grill之类的 Re:Source
SmterC 发表于 2026-8-19 12:50
之前就觉得GPT规划方面很别扭
面对需求各种删,强调MVP不能太复杂
实现细节上过于较真,甚至把需求改歪了
据说Claude系列比较适合?
但是a\风控我,我也懒得上赶着送钱了
舞以 发表于 2026-8-19 12:53
据说Claude系列比较适合?
但是a\风控我,我也懒得上赶着送钱了
4.6 的时候还行,现在 Opus5 和 sol5.6 半斤八两,而且中文巨烂。fabale5 倒是明显好一头,但是用不起也只有 API。所以现在有个 5.6 就够了
—— 来自 S1Fun
hugosol 发表于 2026-8-19 11:51
但老实说感觉不是一个参数的问题
我问个简单的事实,可以通过前面上下文总结出来的,它非要给我雷霆大思 ...
因为5.6本质上也是一个后训练提分的模型。
凡是靠后训练提分的,个个都是雷霆大思考。