找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] 正式版 v4 flash 已上线,pro 8月初|DeepSeek v4讨论专楼

 火.. [复制链接]
     
发表于 2026-8-2 10:03 | 显示全部楼层
网页版PRO的知识库是2026年4月,难道也在灰度V4吗
回答和之前的V3完全不一样
回复

使用道具 举报

头像被屏蔽
     
发表于 2026-8-2 10:10 | 显示全部楼层
提示: 作者被禁止或删除 内容自动屏蔽
回复

使用道具 举报

     
发表于 2026-8-2 10:14 来自手机 | 显示全部楼层
昨天就有人说网页版pro好像变了

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

发表于 2026-8-2 10:25 | 显示全部楼层
アコ 发表于 2026-8-2 09:58
帮我助力,一起拿大奖!完成注册即可获得68元免费token额度
https://tokenrhythm.studio/i/rf_tr_4C00s8CJf ...

这个站的V4F还是preview版本
回复

使用道具 举报

     
发表于 2026-8-2 10:32 | 显示全部楼层
漫无止境的八月初开始了

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

头像被屏蔽
     
发表于 2026-8-2 10:32 | 显示全部楼层
提示: 作者被禁止或删除 内容自动屏蔽
回复

使用道具 举报

发表于 2026-8-2 10:35 | 显示全部楼层
1.新版V4F的写作能力也是提升的

2.专门的coding模型早就有了,后面厂家还是默默换回通用大模型

3.文科理科分科本来就是不科学的

4.现在主要没有厂家专门去提升写作能力











回复

使用道具 举报

     
发表于 2026-8-2 10:36 来自手机 | 显示全部楼层
奈落的孤火花 发表于 2026-8-2 09:36
感谢,不过看了一下怎么dsv4f不支持response api,难道还是老款,我看官方新款已经支持了 ...

responses只是一种请求结构,是需要供应商自己来适配实现的,不是ds自己做了其他人就能直接拿来用,这个接口本身和模型版本没有联系
回复

使用道具 举报

     
发表于 2026-8-2 10:53 | 显示全部楼层
大佬们请教下,你们搞规模较大的工程时,怎么确保执行时不乱写的?想参考下工作流或者方法
回复

使用道具 举报

     
发表于 2026-8-2 10:54 | 显示全部楼层
怎么还天天去检查知识库的日期, 模型根本不知道自己是啥时候, 全是幻觉
回复

使用道具 举报

     
发表于 2026-8-2 11:02 | 显示全部楼层
梁圣什么时候搞出来持续学习,对写文是有跨时代巨大帮助的
回复

使用道具 举报

头像被屏蔽
     
发表于 2026-8-2 11:02 | 显示全部楼层
提示: 作者被禁止或删除 内容自动屏蔽
回复

使用道具 举报

     
发表于 2026-8-2 11:22 | 显示全部楼层
帮我助力,一起拿大奖!完成注册即可获得68元免费token额度
https://tokenrhythm.studio/i/rf_tr_M7nBXPFooQSBG-WRbq43IPAV
拿到赶紧蹬了,免得像硅基一样赖账
回复

使用道具 举报

     
发表于 2026-8-2 11:28 来自手机 | 显示全部楼层
flash的token用量确实是上涨的感觉
以前opencode free的flash的免费额度能用到晚上才用完 现在一个上午就没了

—— 来自 OnePlus PJX110, Android 14, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-2 11:36 | 显示全部楼层
neptunehs 发表于 2026-8-2 11:28
flash的token用量确实是上涨的感觉
以前opencode free的flash的免费额度能用到晚上才用完 现在一个上午就没 ...

换个harness,然后再配个识图的小模型,会好一点,不然现在会反复截图验证,但是没法识图额外消耗token,甚至容易左右互搏
回复

使用道具 举报

     
发表于 2026-8-2 11:38 来自手机 | 显示全部楼层
这两天测了一下酒馆的效果,用了几个不同的预设。感觉这个和以前的思路都不一样。如果用的是激活原生思维链的预设,那么他会在思维链先打一个草稿然后检查符不符合预设的每一个要求,如果预设要求复杂,甚至可能出现在思维链里面修改7、8遍的情况,不过这个对指令的遵守又确实是特别强的。

—— 来自 HONOR PTP-AN70, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-2 11:38 | 显示全部楼层
https://deng.codexradar.com/
Codex雷达多了V4flash, 和luna max差不多, 价格是1/5. 算了下20刀Plus=400刀 API可用于 luna max=等效80刀DS 4flash=10刀OpenCode GO/月给的60刀额度.
回复

使用道具 举报

     
发表于 2026-8-2 11:39 来自手机 | 显示全部楼层
nxmonitor 发表于 2026-8-2 11:36
换个harness,然后再配个识图的小模型,会好一点,不然现在会反复截图验证,但是没法识图额外消耗token, ...

opencode free哪能换 又不是opencode go

—— 来自 OnePlus PJX110, Android 14, 鹅球 v3.5.99
回复

使用道具 举报

发表于 2026-8-2 11:48 来自手机 | 显示全部楼层
serj005 发表于 2026-8-2 10:36
responses只是一种请求结构,是需要供应商自己来适配实现的,不是ds自己做了其他人就能直接拿来用,这个 ...

转发的就可以吧

—— 来自 Xiaomi 22041211AC, Android 12, 鹅球 v4.0-alpha
回复

使用道具 举报

     
发表于 2026-8-2 11:52 来自手机 | 显示全部楼层
→熙← 发表于 2026-8-2 10:54
怎么还天天去检查知识库的日期, 模型根本不知道自己是啥时候, 全是幻觉

有道理,下次应该问一问相关新闻是否知道
回复

使用道具 举报

     
发表于 2026-8-2 11:59 | 显示全部楼层
我看了 ds 关于 codex 的文档,客户端是不是必须先登录进去才能用 ds?单位电脑禁止挂梯子,有没有跳过的办法?

回复

使用道具 举报

     
发表于 2026-8-2 11:59 | 显示全部楼层
北呱南飞去 发表于 2026-8-2 11:59
我看了 ds 关于 codex 的文档,客户端是不是必须先登录进去才能用 ds?单位电脑禁止挂梯子,有没有跳过的办 ...

直接换一个就行,比如zcode或者PI,codex测下来并不是很好
回复

使用道具 举报

     
发表于 2026-8-2 12:13 | 显示全部楼层
北呱南飞去 发表于 2026-8-2 11:59
我看了 ds 关于 codex 的文档,客户端是不是必须先登录进去才能用 ds?单位电脑禁止挂梯子,有没有跳过的办 ...

不用,安装完 codex 启动一下,不用登录,再把它完全关了,运行官方文档给的那个指令就行
回复

使用道具 举报

     
发表于 2026-8-2 12:16 来自手机 | 显示全部楼层
opencode也不错,其他有更好的么?
回复

使用道具 举报

     
发表于 2026-8-2 12:26 | 显示全部楼层
专门用来识图的模型用哪个好呢
回复

使用道具 举报

     
发表于 2026-8-2 12:36 | 显示全部楼层
抽搐一下 发表于 2026-8-2 12:26
专门用来识图的模型用哪个好呢

GPT 5.6 LUNA
回复

使用道具 举报

     
发表于 2026-8-2 12:36 来自手机 | 显示全部楼层
话说国产harness和ccoc到底有多大差距

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-2 12:44 来自手机 | 显示全部楼层
lactone 发表于 2026-8-2 12:36
话说国产harness和ccoc到底有多大差距

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99 ...

代码不好说但是日常办公workbuddy完胜,非程序员无脑选workbuddy就行了
回复

使用道具 举报

     
发表于 2026-8-2 13:22 来自手机 | 显示全部楼层
北呱南飞去 发表于 2026-8-2 11:59
我看了 ds 关于 codex 的文档,客户端是不是必须先登录进去才能用 ds?单位电脑禁止挂梯子,有没有跳过的办 ...

我是直接让claude code搞定的每次这俩哪个有问题就让另一个来检查身体但我用的cli
回复

使用道具 举报

发表于 2026-8-2 13:40 来自手机 | 显示全部楼层
jyj256 发表于 2026-8-2 11:02
感觉v4f还是太小了 我这几天和k3比较过  写文还是不如k3 k3的问题是甲太厚 类脑的预设也破不了 只能等v4p ...

k3 能破,你用的什么渠道 k3

—— 来自 鹅球 v4.0-alpha
回复

使用道具 举报

     
发表于 2026-8-2 13:41 | 显示全部楼层
探讨了一下llm的两项能力,觉得挺有趣发出来:LLM 生成是前向一次 pass,注意力是自回归的——它"看到"的上下文里有什么才会联想什么。它的联想能力其实是"上下文内联想":如果错误 C 在上下文里(比如代码文件已经被读过、在上下文中),那模型"可能"会发现它——但这依赖:

错误 C 是否在上下文中
注意力是否分配到那里
有没有余力(token budget)去注意
人脑是并行激活的——潜意识一直在后台跑,联觉、直觉、走神都是并行处理的表现。LLM 没有"后台进程"。

但我要补充一些反驳/深化:

其实 LLM 有某种"内隐联想"——预训练让模型对模式敏感,你给它代码片段,它可能"感觉到"哪里不对(就像人看到熟悉的模式异常)。但这种能力不稳定,而且只在生成路径中被激活。
解决思路现实路径:
多轮/多角度生成:让一个模型看代码两次(一次实现 B,一次专门审查)——这其实就是"对抗性审查"子代理的原理,我们已经在用了!用户自己也建立过这套(派子代理对抗审查)。
专门的"审查 pass":实现 B 之后再跑一个"顺手检查"轮次,把"发现 C"变成显式任务。这比依赖生成时偶然联想可靠得多。——gpt就在用这个
工具辅助:静态分析、lint、搜索——把"联想"外部化。代码里有没有同类 bug(用户自己举过例:修 batch_sensenova.py 时没看 extract_pipeline_v3.py 的 CharacterRegister——这就是联想失败的实例,解决办法是 grep 3 个相关文件)。
结构化上下文:把"项目全貌"放进去(AGENTS.md 就是干这个的)——联想需要材料,材料在上下文里才能联想。
有意思的补充:多模型并行生成(用户说的理想方案)其实技术上已经有雏形——MoE(混合专家)内部就是多个专家网络同时参与;还有 speculative decoding。但"多个完整 LLM 并行生成再综合"(ensemble)确实贵。不过对关键任务,可以先并行跑 2 个不同模型看同一问题,比对答案——这也是一种"多大脑"。成本翻倍,但关键任务值得。
回复

使用道具 举报

头像被屏蔽
发表于 2026-8-2 14:12 来自手机 | 显示全部楼层
提示: 该帖被管理员或版主屏蔽
回复

使用道具 举报

     
发表于 2026-8-2 15:18 来自手机 | 显示全部楼层
很久就在那边l 发表于 2026-8-2 12:44
代码不好说但是日常办公workbuddy完胜,非程序员无脑选workbuddy就行了

不太想用企鹅的东西

—— 来自 HUAWEI ALN-AL10, Android 12, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-2 15:25 | 显示全部楼层
asier 发表于 2026-8-2 11:22
帮我助力,一起拿大奖!完成注册即可获得68元免费token额度
https://tokenrhythm.studio/i/rf_tr_M7nBXPFoo ...

帮我助力,一起拿大奖!完成注册即可获得68元免费token额度
https://tokenrhythm.studio/i/rf_tr_F2ejBlz-c88SGu81og8TKEW3

传下去
回复

使用道具 举报

     
发表于 2026-8-2 15:58 来自手机 | 显示全部楼层
冤枉呐 发表于 2026-8-2 15:25
帮我助力,一起拿大奖!完成注册即可获得68元免费token额度
https://tokenrhythm.studio/i/rf_tr_F2ejBlz ...

活动暂未开放 都结束了吗(

—— 来自 OnePlus PJX110, Android 14, 鹅球 v3.5.99
回复

使用道具 举报

发表于 2026-8-2 16:04 | 显示全部楼层
很快啊,上午开放下午就没有羊毛了
回复

使用道具 举报

     
发表于 2026-8-2 16:07 | 显示全部楼层
neptunehs 发表于 2026-8-2 15:58
活动暂未开放 都结束了吗(

—— 来自 OnePlus PJX110, Android 14, 鹅球 v3.5.99

我好像已经是最后一个了……刚复制出来一刷新没了
回复

使用道具 举报

     
发表于 2026-8-2 16:15 | 显示全部楼层
那个羊毛,我注册了之后让codex给我试了试,搞得我都不想用了。。。。

对。按这次实测,我不建议把这两个模型当成“可精确控制、可以放心长期跑复杂任务”的正式来源。

但两个模型的问题程度不一样。

GLM-5.2 是明确不可靠。`high` 虽然能正常完成题目,思考、流式、工具调用也都通,但 `max` 在官方 128K 最大输出下仍把所有 token 消耗在 reasoning,最终一个字的正文都没有。这不是轻微波动,而是严重的停止行为异常。更麻烦的是,基元律动还拒绝 GLM 官方的 `thinking.type=enabled`,而 `disabled` 和 `reasoning_effort=none` 又关不掉思考。这说明通过这个渠道无法完整控制 GLM 的官方思考协议。

Qwen3.7 Max 稍好一些。它的回答、流式 reasoning、工具调用都能正常工作,六位密码题也答对了。但基元律动拒绝 Qwen 官方的 `enable_thinking`,故意写一个非法的 `reasoning_effort` 也照样接受。也就是说,它目前更像一个“默认一直思考、但控制旋钮是假的”模型。普通使用可以,不能相信界面上的档位,也不能保证将来网关行为变动后仍保持现在的默认思考状态。

所以我的实际判断是:

| 用途 | GLM-5.2 | Qwen3.7 Max |
|---|---|---|
| 偶尔短问答 | 勉强可用,只限 high | 可用 |
| 简单工具任务 | 可用,但必须限制在 high | 可用 |
| 长推理、复杂证明 | 不建议 | 可以尝试,但不能控制思考预算 |
| 无人看管长任务 | 不建议 | 不建议 |
| 依赖稳定 effort 的工作流 | 不可用 | 不可用 |
| 替代官方 API | 不可以 | 不可以 |
| 作为高优先级默认来源 | 不应该 | 我也不建议 |

我之前已经把 GLM 的真实出站档位锁到 high,把 Qwen 的假档位撤掉了,所以当前配置不会再轻易踩到最严重的问题。但“经过防护后不容易炸”和“这个渠道本身可靠”是两回事。

更合适的处置是把这两个来源从“高优先级正式模型”降成“手动选择的赠送额度实验模型”:

```text
默认工作
  → 官方 DeepSeek / 已验证的 Kimi / 原生 GPT 等现有稳定来源

用户手动点名,或任务失败代价很低
  → 基元律动 Qwen3.7 Max

只做短期试用并固定 high
  → 基元律动 GLM-5.2
```

如果你希望的是“平时交给 Claude Code 或 Codex 自动选,而且优先消耗这三把赠送额度”,那我认为不合适。自动高优先级最怕的不是直接报错,而是这种请求返回 200、模型也一直生成,看起来一切正常,十几分钟后才发现 128K 全烧完却没有正文。

从可靠性角度,最干净的选择其实是:保留 Key 和实验记录,但把 GLM-5.2、Qwen3.7 Max 从 CPA 与 OpenCodex 的日常模型选择器中移除。以后基元律动明确补齐官方字段支持,或者我们复测确认协议已经修好,再重新接入。现在这两个模型留在正式选择器里的收益主要是赠送额度,代价是行为不可控,我认为不值。
回复

使用道具 举报

     
发表于 2026-8-2 16:18 | 显示全部楼层
opencode go订阅蹬flash 也太爽了,用不完的感觉啊
回复

使用道具 举报

     
发表于 2026-8-2 16:50 | 显示全部楼层
看了下东山奈央的评测文章,看起来ds的第一方harness还真有说法
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-6 12:10 , Processed in 0.285037 second(s), 6 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表