erliuer 发表于 2026-8-1 16:42

jyj256 发表于 2026-8-1 09:41
私信发给你了 万一不行 你就下载文件研究一下吧

谢谢!   思路很清晰,很受启发。

M乔梦 发表于 2026-8-1 17:14

nxmonitor 发表于 2026-8-1 17:35

看到一个主播用了zcode,做出来的我的世界有上次灰测第一二天的感觉了

jyj256 发表于 2026-8-1 17:36

masonknight 发表于 2026-8-1 17:41

有没有在Hermes上用flash正式版的大佬?说说效果如何?

舞以 发表于 2026-8-1 18:04

qwased 发表于 2026-8-1 16:37
不接api跑agent应该无差别吧

不知道你具体指的是啥哦
但是现在官方明确说了flash-0731这个正式版检查点只上了api服务,网页端和app都是老的弱智flash

qwased 发表于 2026-8-1 18:17

舞以 发表于 2026-8-1 18:04
不知道你具体指的是啥哦
但是现在官方明确说了flash-0731这个正式版检查点只上了api服务,网页端和app都 ...

意思是跑agent以外的用途表现应该没什么区别,我试了下接cherry studio写了点东西确实和以前一个样

厍无春 发表于 2026-8-1 18:28

qwased 发表于 2026-8-1 18:17
意思是跑agent以外的用途表现应该没什么区别,我试了下接cherry studio写了点东西确实和以前一个样 ...

其实也不能这么说,重新进行了后训练,思维链肯定也是有变化的,只不过可能没有编程和 agent 方面变化大吧。就看写文方面训练数据有没有大的变化

舞以 发表于 2026-8-1 18:29

qwased 发表于 2026-8-1 18:17
意思是跑agent以外的用途表现应该没什么区别,我试了下接cherry studio写了点东西确实和以前一个样 ...

估计是的,这个检查点感觉就是为了做一个完成绝大多数agent工作流的执行模型。
以后的ds可能是按需要升级的模式而不是小模型只打杂的模式。

阿刚 发表于 2026-8-1 18:42

masonknight 发表于 2026-8-1 17:41
有没有在Hermes上用flash正式版的大佬?说说效果如何?

有明显提升,我主要拿来写文的,不过之前试过一句话编游戏,让pro弄个洛克人,基本上连正常流程都做不完,那天用flash做的很完整,小怪,跳跃,中boss全能正常运转

StarForceTi 发表于 2026-8-1 18:44

逻辑上来说 agent能力强了,写文的逻辑能力和遗忘都会好很多

厍无春 发表于 2026-8-1 18:52

阿刚 发表于 2026-8-1 18:42
有明显提升,我主要拿来写文的,不过之前试过一句话编游戏,让pro弄个洛克人,基本上连正常流程都做不完 ...

用 Hermes 编游戏吗?和其他专业编程工具比怎么样

spaceblue 发表于 2026-8-1 19:03



等pro出来的斩杀线估计就是这样

舞以 发表于 2026-8-1 19:06

话说雷肿的mimo(非pro)还能继续对标ds的flash么
挺期待的

lactone 发表于 2026-8-1 19:13

mimo只要能达到这个水平,不也照样斩杀一大堆

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

半江瑟瑟半江红 发表于 2026-8-1 19:15

StarForceTi 发表于 2026-8-1 18:44
逻辑上来说 agent能力强了,写文的逻辑能力和遗忘都会好很多

还真不是,agent能力和写作有一定关系,但不是绝对相关的
我用fable5写过,这弱智玩意在opencdoe约束之下写了5000字花我20美元,它在写完自检阶段把我给它准备的细纲里每一条失败模式、skill里每一条失败模式都以正文旁白的形式写进去了
就像一个笨蛋金发双马尾大小姐一样
这个工作流程是我和gpt讨论以后建立的,在codex里gpt写完以后跑自检一旦触发失败模式就会场景重写,所以不是我的工作流有问题

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

空き地卯木 发表于 2026-8-1 19:18

舞以 发表于 2026-8-1 19:06
话说雷肿的mimo(非pro)还能继续对标ds的flash么
挺期待的

别搞 上次嘲完直接进来个泼皮打滚四五页的

—— 来自 S1Fun

nxmonitor 发表于 2026-8-1 19:18

spaceblue 发表于 2026-8-1 19:03
等pro出来的斩杀线估计就是这样

如果就是那个灰测版,价格可能在现在预览版的左边,算上高峰价格差不多

goranger 发表于 2026-8-1 19:20

masonknight 发表于 2026-8-1 17:41
有没有在Hermes上用flash正式版的大佬?说说效果如何?

很好很强供参考

论坛助手,iPhone

厍无春 发表于 2026-8-1 19:22

舞以 发表于 2026-8-1 19:06
话说雷肿的mimo(非pro)还能继续对标ds的flash么
挺期待的

mimo 就算了,本身基模逻辑智能就不咋地,全靠做好后训练才有 ds 没做好后训练的效果。

lactone 发表于 2026-8-1 19:31

等等qwen3.8max 正式版

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

阿刚 发表于 2026-8-1 19:41

厍无春 发表于 2026-8-1 18:52
用 Hermes 编游戏吗?和其他专业编程工具比怎么样

我也不懂的啊,就是之前灰测时候流行的一句话编游戏……

qwased 发表于 2026-8-1 19:44

半江瑟瑟半江红 发表于 2026-8-1 19:15
还真不是,agent能力和写作有一定关系,但不是绝对相关的
我用fable5写过,这弱智玩意在opencdoe约束之下 ...

我个人感觉大模型越强化编程那创意写作就越差
非常怀念gpt4o

王兰花秀丽 发表于 2026-8-1 19:47

梁子你可是要搞agi的呀,千万不要把写作丢了    Re:Source

舞以 发表于 2026-8-1 19:47

我觉得写作是最难的(尤其是比较开放的创意写作)
期待ds早日训出15t大魔吧

论坛助手,iPhone

绝地潜兵 发表于 2026-8-1 19:56

DS不是有招聘情感智能数据产品经理么,快点发力啊

一般市民 发表于 2026-8-1 20:02

如果强化编程和创意写作真的有冲突,那可能会分化出不同模型吧? 理科模型和文科模型?

蜇灵 发表于 2026-8-1 20:27

所以现在推荐用什么agent/ide,我看codex和cc被吐槽配合不行,推荐用pi,这玩意好用吗

厍无春 发表于 2026-8-1 20:34

蜇灵 发表于 2026-8-1 20:27
所以现在推荐用什么agent/ide,我看codex和cc被吐槽配合不行,推荐用pi,这玩意好用吗 ...

感觉可以等 ds 官方的 harness ,反正没几天了,没必要折腾别的,codex 先用着

半江瑟瑟半江红 发表于 2026-8-1 20:34

qwased 发表于 2026-8-1 19:44
我个人感觉大模型越强化编程那创意写作就越差
非常怀念gpt4o

是的,coding能力越强,写东西就越想写出来逻辑,越想一旦有冲突就快速解决,然后整个故事就跟嚼蜡一样无聊,而且充满了类似元叙事一样的解说。

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

半江瑟瑟半江红 发表于 2026-8-1 20:35

一般市民 发表于 2026-8-1 20:02
如果强化编程和创意写作真的有冲突,那可能会分化出不同模型吧? 理科模型和文科模型? ...

我觉得倒是不需要,就看不同任务调用哪个专家的问题。

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

sellboy 发表于 2026-8-1 20:37

蜇灵 发表于 2026-8-1 20:27
所以现在推荐用什么agent/ide,我看codex和cc被吐槽配合不行,推荐用pi,这玩意好用吗 ...

你不着急等deepseek自己的
你现在要用那么codex,正式版是专门支持了Responses API的,并且官方给了配置说明的。

至于其他的V4f正式版才几天,登别人磨合好你再学着配也行。

goranger 发表于 2026-8-1 20:40

实际上DeepSeek官方文档一直专门写了怎么适配主流agent,并不是这次才强兼codex

论坛助手,iPhone

德尔惠净水器 发表于 2026-8-1 20:48

网页版的还是 preview 吗

半江瑟瑟半江红 发表于 2026-8-1 20:52

德尔惠净水器 发表于 2026-8-1 20:48
网页版的还是 preview 吗

是的,估计是双休日摸了

半江瑟瑟半江红 发表于 2026-8-1 20:52

德尔惠净水器 发表于 2026-8-1 20:48
网页版的还是 preview 吗

是的,估计是双休日摸了

phorcys02 发表于 2026-8-1 21:00

opencode 还行啊...我蹬了一天 opencode go 里的 v4 flash (new)了...
周用量才5%. 根本用不完

v4f 能力属实有点强了, 除了一些特别复杂的问题和设计搞的不好,没有明确答案需要权衡利弊的也会拉胯. 特别冷门的知识它没有就不会,比如用 xxd看hex,
基本上95%+的活儿干起来 又快又好...
但这个不停"But!"的思维链还是不如灰度的 v4pro...
傻乎乎的llm天天自我怀疑"But! ...Wait!...".睿智的llm只会说 "I'm..."

奈落的孤火花 发表于 2026-8-1 21:07

看这个样子,v4pro还得好一阵子才端上来,这harness还在内测呢,刚才ds的开发者还在招募内侧人士

LeoDT 发表于 2026-8-1 21:24

蜇灵 发表于 2026-8-1 20:27
所以现在推荐用什么agent/ide,我看codex和cc被吐槽配合不行,推荐用pi,这玩意好用吗 ...

用pi可以完全摸透所谓harness到底是干了什么,以及可以搞出来一个适合自己的趁手的工具,缺点就是折腾。裸pi能用,而且大多数情况够用,但是在社区里看到的别人的各种在其它harness里的奇技淫巧就需要花点时间了,不过这也是学习过程不是嘛。

个人认为如果D老师坚持开源路线,模型应该不会对自家harness做特殊的适配,所以摸透harness以及适应各种开源方案可能到时候就算要自己选也选的自信些。

另外flash新版能力命令行真的强了好多,用pi的话可能之后要考虑加强权限管理和加sandbox了。

半江瑟瑟半江红 发表于 2026-8-1 21:29

phorcys02 发表于 2026-8-1 21:00
opencode 还行啊...我蹬了一天 opencode go 里的 v4 flash (new)了...
周用量才5%. 根本用不完


因为v4flash很便宜,这玩意在zen里都免费的
不过目前的zen的flash好像还不是正式版

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
页: 108 109 110 111 112 113 114 115 116 117 [118] 119 120 121 122 123 124 125 126 127
查看完整版本: Ox Alpha被认领,GLM-5.3-Flash上线|大模型讨论专楼