jyj256 发表于 2026-8-1 09:41
私信发给你了 万一不行 你就下载文件研究一下吧
谢谢! 思路很清晰,很受启发。
看到一个主播用了zcode,做出来的我的世界有上次灰测第一二天的感觉了
有没有在Hermes上用flash正式版的大佬?说说效果如何?
qwased 发表于 2026-8-1 16:37
不接api跑agent应该无差别吧
不知道你具体指的是啥哦
但是现在官方明确说了flash-0731这个正式版检查点只上了api服务,网页端和app都是老的弱智flash
舞以 发表于 2026-8-1 18:04
不知道你具体指的是啥哦
但是现在官方明确说了flash-0731这个正式版检查点只上了api服务,网页端和app都 ...
意思是跑agent以外的用途表现应该没什么区别,我试了下接cherry studio写了点东西确实和以前一个样
qwased 发表于 2026-8-1 18:17
意思是跑agent以外的用途表现应该没什么区别,我试了下接cherry studio写了点东西确实和以前一个样 ...
其实也不能这么说,重新进行了后训练,思维链肯定也是有变化的,只不过可能没有编程和 agent 方面变化大吧。就看写文方面训练数据有没有大的变化
qwased 发表于 2026-8-1 18:17
意思是跑agent以外的用途表现应该没什么区别,我试了下接cherry studio写了点东西确实和以前一个样 ...
估计是的,这个检查点感觉就是为了做一个完成绝大多数agent工作流的执行模型。
以后的ds可能是按需要升级的模式而不是小模型只打杂的模式。
masonknight 发表于 2026-8-1 17:41
有没有在Hermes上用flash正式版的大佬?说说效果如何?
有明显提升,我主要拿来写文的,不过之前试过一句话编游戏,让pro弄个洛克人,基本上连正常流程都做不完,那天用flash做的很完整,小怪,跳跃,中boss全能正常运转
逻辑上来说 agent能力强了,写文的逻辑能力和遗忘都会好很多
阿刚 发表于 2026-8-1 18:42
有明显提升,我主要拿来写文的,不过之前试过一句话编游戏,让pro弄个洛克人,基本上连正常流程都做不完 ...
用 Hermes 编游戏吗?和其他专业编程工具比怎么样
等pro出来的斩杀线估计就是这样
话说雷肿的mimo(非pro)还能继续对标ds的flash么
挺期待的
mimo只要能达到这个水平,不也照样斩杀一大堆
—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
StarForceTi 发表于 2026-8-1 18:44
逻辑上来说 agent能力强了,写文的逻辑能力和遗忘都会好很多
还真不是,agent能力和写作有一定关系,但不是绝对相关的
我用fable5写过,这弱智玩意在opencdoe约束之下写了5000字花我20美元,它在写完自检阶段把我给它准备的细纲里每一条失败模式、skill里每一条失败模式都以正文旁白的形式写进去了
就像一个笨蛋金发双马尾大小姐一样
这个工作流程是我和gpt讨论以后建立的,在codex里gpt写完以后跑自检一旦触发失败模式就会场景重写,所以不是我的工作流有问题
—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
舞以 发表于 2026-8-1 19:06
话说雷肿的mimo(非pro)还能继续对标ds的flash么
挺期待的
别搞 上次嘲完直接进来个泼皮打滚四五页的
—— 来自 S1Fun
spaceblue 发表于 2026-8-1 19:03
等pro出来的斩杀线估计就是这样
如果就是那个灰测版,价格可能在现在预览版的左边,算上高峰价格差不多
masonknight 发表于 2026-8-1 17:41
有没有在Hermes上用flash正式版的大佬?说说效果如何?
很好很强供参考
论坛助手,iPhone
舞以 发表于 2026-8-1 19:06
话说雷肿的mimo(非pro)还能继续对标ds的flash么
挺期待的
mimo 就算了,本身基模逻辑智能就不咋地,全靠做好后训练才有 ds 没做好后训练的效果。
等等qwen3.8max 正式版
—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
厍无春 发表于 2026-8-1 18:52
用 Hermes 编游戏吗?和其他专业编程工具比怎么样
我也不懂的啊,就是之前灰测时候流行的一句话编游戏……
半江瑟瑟半江红 发表于 2026-8-1 19:15
还真不是,agent能力和写作有一定关系,但不是绝对相关的
我用fable5写过,这弱智玩意在opencdoe约束之下 ...
我个人感觉大模型越强化编程那创意写作就越差
非常怀念gpt4o
梁子你可是要搞agi的呀,千万不要把写作丢了 Re:Source
我觉得写作是最难的(尤其是比较开放的创意写作)
期待ds早日训出15t大魔吧
论坛助手,iPhone
DS不是有招聘情感智能数据产品经理么,快点发力啊
如果强化编程和创意写作真的有冲突,那可能会分化出不同模型吧? 理科模型和文科模型?
所以现在推荐用什么agent/ide,我看codex和cc被吐槽配合不行,推荐用pi,这玩意好用吗
蜇灵 发表于 2026-8-1 20:27
所以现在推荐用什么agent/ide,我看codex和cc被吐槽配合不行,推荐用pi,这玩意好用吗 ...
感觉可以等 ds 官方的 harness ,反正没几天了,没必要折腾别的,codex 先用着
qwased 发表于 2026-8-1 19:44
我个人感觉大模型越强化编程那创意写作就越差
非常怀念gpt4o
是的,coding能力越强,写东西就越想写出来逻辑,越想一旦有冲突就快速解决,然后整个故事就跟嚼蜡一样无聊,而且充满了类似元叙事一样的解说。
—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
一般市民 发表于 2026-8-1 20:02
如果强化编程和创意写作真的有冲突,那可能会分化出不同模型吧? 理科模型和文科模型? ...
我觉得倒是不需要,就看不同任务调用哪个专家的问题。
—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
蜇灵 发表于 2026-8-1 20:27
所以现在推荐用什么agent/ide,我看codex和cc被吐槽配合不行,推荐用pi,这玩意好用吗 ...
你不着急等deepseek自己的
你现在要用那么codex,正式版是专门支持了Responses API的,并且官方给了配置说明的。
至于其他的V4f正式版才几天,登别人磨合好你再学着配也行。
实际上DeepSeek官方文档一直专门写了怎么适配主流agent,并不是这次才强兼codex
论坛助手,iPhone
网页版的还是 preview 吗
德尔惠净水器 发表于 2026-8-1 20:48
网页版的还是 preview 吗
是的,估计是双休日摸了
德尔惠净水器 发表于 2026-8-1 20:48
网页版的还是 preview 吗
是的,估计是双休日摸了
opencode 还行啊...我蹬了一天 opencode go 里的 v4 flash (new)了...
周用量才5%. 根本用不完
v4f 能力属实有点强了, 除了一些特别复杂的问题和设计搞的不好,没有明确答案需要权衡利弊的也会拉胯. 特别冷门的知识它没有就不会,比如用 xxd看hex,
基本上95%+的活儿干起来 又快又好...
但这个不停"But!"的思维链还是不如灰度的 v4pro...
傻乎乎的llm天天自我怀疑"But! ...Wait!...".睿智的llm只会说 "I'm..."
看这个样子,v4pro还得好一阵子才端上来,这harness还在内测呢,刚才ds的开发者还在招募内侧人士
蜇灵 发表于 2026-8-1 20:27
所以现在推荐用什么agent/ide,我看codex和cc被吐槽配合不行,推荐用pi,这玩意好用吗 ...
用pi可以完全摸透所谓harness到底是干了什么,以及可以搞出来一个适合自己的趁手的工具,缺点就是折腾。裸pi能用,而且大多数情况够用,但是在社区里看到的别人的各种在其它harness里的奇技淫巧就需要花点时间了,不过这也是学习过程不是嘛。
个人认为如果D老师坚持开源路线,模型应该不会对自家harness做特殊的适配,所以摸透harness以及适应各种开源方案可能到时候就算要自己选也选的自信些。
另外flash新版能力命令行真的强了好多,用pi的话可能之后要考虑加强权限管理和加sandbox了。
phorcys02 发表于 2026-8-1 21:00
opencode 还行啊...我蹬了一天 opencode go 里的 v4 flash (new)了...
周用量才5%. 根本用不完
因为v4flash很便宜,这玩意在zen里都免费的
不过目前的zen的flash好像还不是正式版
—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0