找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] 正式版 v4 flash 已上线,pro 8月初|DeepSeek v4讨论专楼

 火.. [复制链接]
     
发表于 2026-8-5 18:24 来自手机 | 显示全部楼层
中国人 发表于 2026-8-5 17:55
不行,今天下午严重流口水,不应该啊,指令依从能力和理解能力不应该这么差啊,跑得多了上下文被占据多了导 ...

正常情况上下文别超过1/4智力就是正常的,50%上下文之后可用性就大幅下降了
回复

使用道具 举报

     
发表于 2026-8-5 18:25 来自手机 | 显示全部楼层
官方的其实比opencode go里的性能强一点,长上下文的时候很明显
回复

使用道具 举报

     
发表于 2026-8-5 19:48 | 显示全部楼层
梁子啊,5号过去还能叫月初吗    Re:Source
回复

使用道具 举报

     
发表于 2026-8-5 19:49 | 显示全部楼层
继续发pi插件
https://pi.dev/packages/@firstpick/pi-extension-safety-guard
唯一能用的防误删,之前试过N个沙盒和权限插件,要么太烦、要么规则一堆但对复合指令无能为力、要么沙盒默认防联网防gpg把git和gradle炸掉还不防误删当前目录
https://pi.dev/packages/@alexanderfortin/pi-deepseek-usage
实时DeepSeek官网余额
https://pi.dev/packages/pi-cache-optimizer
缓存率优化,有待测试
回复

使用道具 举报

     
发表于 2026-8-5 19:55 | 显示全部楼层
lly778 发表于 2026-8-5 17:48
codex最离谱的是新版本不能调用luna作为子代理,这个bug好几天了也不修。

—— 来自 Xiaomi 2211133C, And ...

可以套一层paseo

—— 来自 S1Fun
回复

使用道具 举报

     
发表于 2026-8-5 19:58 来自手机 | 显示全部楼层
scikirbypoke 发表于 2026-8-5 19:49
继续发pi插件
https://pi.dev/packages/@firstpick/pi-extension-safety-guard
唯一能用的防误删,之前试过 ...

哥要不要单开一楼,最近刚从OpenCode转到Pi

—— 来自 HUAWEI NOH-AN00, Android 12, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-5 20:11 | 显示全部楼层
DSV4pro预览版的smart zone大概是200K
flash预览版比pro要小得多,长上下文基本没法用
现在体感flash正式版的smart zone已经反超pro预览版了,完全没预料到后训练会有这方面的提升
回复

使用道具 举报

     
发表于 2026-8-5 20:11 来自手机 | 显示全部楼层
無始無終 发表于 2026-8-5 19:58
哥要不要单开一楼,最近刚从OpenCode转到Pi

—— 来自 HUAWEI NOH-AN00, Android 12, 鹅球 v4.0 ...

那样的话AI专楼就有点太多了
回复

使用道具 举报

     
发表于 2026-8-5 20:19 | 显示全部楼层
hugosol 发表于 2026-8-5 20:11
DSV4pro预览版的smart zone大概是200K
flash预览版比pro要小得多,长上下文基本没法用
现在体感flash正式版 ...

gpt指导说后训练还挺重要的

能,而且**后训练恰恰是决定“标称上下文窗口”能转化成多少“有效上下文窗口”的重要环节之一**。

但要先区分三种不同的“窗口”:

| 层次          | 含义                              | 后训练能否改善               |
| ----------- | ------------------------------- | --------------------- |
| **硬窗口**     | 推理系统最多允许输入多少 token,例如 128K、256K | 普通 SFT/RL 基本不能        |
| **可稳定建模窗口** | 位置编码和注意力机制在多长范围内仍能正常工作          | 通常需要长上下文继续预训练、位置外推训练等 |
| **有效窗口**    | 在某一具体任务上,模型还能可靠寻找、整合和使用多远的信息    | **后训练可以明显改善**         |

因此,比较准确的结论是:

> **后训练能够把模型的有效上下文窗口向右推,但通常是在既有硬窗口和长上下文基础能力之内,提高利用率,而不是凭空创造新的容量。**

---

## 一、有效上下文窗口不是一个固定数值

厂商所说的“支持 200K 上下文”,通常只表示模型和推理系统能接受这段输入,不等于模型能同等可靠地使用其中每一部分。

更合理的定义是:

[
L_{\text{effective}}(T,\theta)
==============================

\max L\quad
\text{s.t. 模型在任务 }T\text{、长度 }L\text{ 时性能仍高于阈值 }\theta
]

也就是说,有效窗口取决于:

* 任务是什么;
* 上下文中有多少干扰信息;
* 需要找一个事实,还是整合几十处信息;
* 是否要跨文档推理;
* 输出是否需要长期保持全局一致;
* 对“可靠”的要求有多高。

一个模型可能在 500K token 中成功找出一个明确的随机字符串,但面对 80K token 的代码仓库,无法稳定理解多个模块之间的状态约束。前者是检索,后者包含检索、关联、推理、计划和持续状态维护,实际难度完全不同。

RULER 的结果正说明了这一点:不少模型在简单的“大海捞针”测试上接近满分,但当任务变成多目标检索、多跳追踪或聚合时,性能会随上下文增长明显下降;在其测试的模型中,虽然都宣称支持至少 32K,上下文达到 32K 时仍能保持良好表现的只有大约一半。([arXiv][1])

所以“有效窗口”最好理解为一组任务相关的性能曲线,而不是模型卡上的一个整数。

---

## 二、后训练究竟改善了什么

### 1. 教模型从长上下文中寻找相关信息

预训练模型可能已经具备“看到”长序列的能力,但不一定形成了稳定的行为策略:

* 应该搜索哪些线索;
* 哪些段落只是干扰;
* 用户问题应当与哪些证据建立联系;
* 找到证据之后,如何把它带入后续推理;
* 当多个候选信息冲突时,应当如何验证。

长上下文 SFT 可以直接训练这种行为。LongAlign 使用 8K—64K 的长指令数据进行对齐,在长上下文任务上相对其他训练方案最高取得约 30% 的改进,同时没有明显破坏短上下文能力。([arXiv][2])

这里增加的不是注意力层的“存储空间”,而是模型使用已有注意力和表示能力的策略。

可以类比为:硬窗口决定桌面有多大,后训练决定模型会不会整理桌面、查找文件以及把相关文件放到手边。

---

### 2. 改善抗干扰能力

上下文变长之后,最严重的问题往往不是模型完全找不到目标,而是:

* 无关文本激活了错误联想;
* 相似实体互相污染;
* 早期指令与后期指令竞争;
* 模型找到正确证据后,又被后续干扰覆盖;
* 多份文档中相似但不相同的信息被错误合并。

长上下文后训练可以通过构造包含困难负例、相似干扰项、冲突证据和多来源信息的数据,训练模型提高选择性。

所以,有效窗口的提高经常表现为:**相同长度下,加入更多无关信息后,性能下降得更慢。**

这比单纯在空白文本中埋一个密码更接近真实的长上下文能力。

---

### 3. 改善跨段落聚合和多跳推理

检索到一处信息只是第一步。复杂任务还要求模型:

1. 在上下文不同位置找到多处事实;
2. 判断这些事实是否属于同一实体或事件;
3. 按时间、因果或依赖关系组织;
4. 在中间推理过程中保留已经得到的结论;
5. 最后生成全局一致的答案。

后训练能够教会模型这种“检索—选证—整合—验证”的策略。

2026 年的 LongRLVR 工作还发现,普通的、只根据最终答案打分的 RLVR,在长上下文任务上信号过于稀疏:模型即使最终答错,也很难知道究竟是找错了证据、漏掉了证据,还是推理过程出错。该工作加入了可验证的“上下文证据奖励”,直接奖励正确的证据定位和 grounding,在其 14B 模型实验中,将 RULER-QA 从 73.17 提升到 88.90,将 LongBench v2 从 39.8 提升到 46.5。([arXiv][3])

这说明后训练不只是让模型“更愿意回答”,还可以直接塑造它在长上下文中的信息流动方式。

---

## 三、但是后训练不能完全替代长上下文预训练

这里需要区分狭义和广义的“后训练”。

### 狭义后训练

通常指:

* 指令微调;
* 偏好优化;
* RLHF、RLAIF;
* RLVR;
* 工具使用和 Agent 训练。

这种后训练主要提升**窗口利用率**,不能轻易改变模型的硬性位置范围。

例如,一个真正只在 8K 位置范围内训练和配置的模型,不能仅靠少量问答 SFT,就稳定变成 128K 模型。位置编码外推、注意力稳定性、长距离表示分布等问题仍然存在。

### 广义的预训练后阶段

如果把以下过程也算作后训练:

* 长上下文继续预训练;
* RoPE 缩放或位置编码适配;
* 在书籍、代码仓库和长文档上继续训练;
* 使用超过目标推理长度的训练序列;
* 再进行上下文任务 SFT;

那么它不仅能提高有效窗口,还可能提高模型真正可稳定支持的长度。

ProLong 的研究发现,长上下文继续训练的数据组成、训练序列长度和后续 SFT 都会影响最终能力;特别是训练序列长度超过评测长度时,长上下文性能往往更好。其 8B 模型经过约 400 亿 token 的继续训练后,在 128K 任务上超过了若干同规模模型,并能在部分任务上继续处理到 512K。([arXiv][4])

因此,真正可靠的长上下文模型通常不是“先训练一个短上下文基座,再用几千条长问答补一下”,而是:

[
\text{位置与架构支持}
+
\text{长序列继续预训练}
+
\text{任务型后训练}
+
\text{推理与 Harness 管理}
]

---

## 四、LongAlign 与 ProLong 看似得出了不同结论

LongAlign 强调:

> 长上下文能力需要相似长度的指令微调数据。

而 ProLong 的研究又发现:

> 如果长上下文继续预训练做得充分,仅使用短指令数据进行 SFT,也可能获得很强的长上下文性能。([arXiv][4])

两者并不真正矛盾,关键在于基座状态不同。

### 基座缺少长上下文能力时

长上下文 SFT 会非常重要,因为它同时承担:

* 教模型处理长输入;
* 教模型遵循长输入中的任务;
* 教模型输出与远距离证据对应的答案。

但这种提高可能较脆弱,尤其容易停留在特定任务格式上。

### 基座已经经过充分长上下文继续预训练时

模型可能已经学会:

* 在远距离建立表示;
* 跨较长序列预测;
* 维持位置和语义关系;
* 从长代码、书籍和文档中提取规律。

这时短上下文 SFT 主要负责把基础能力转化为指令跟随能力,不一定要求每条 SFT 数据本身都达到 128K。

所以可以把它概括为:

> **长上下文继续预训练决定“有没有这套底层能力”,后训练决定“能否按用户要求把它调用出来”。**

后训练足够强时可以弥补一部分基础训练不足,但通常不能无限替代基础。

---

## 五、后训练对不同类型的有效窗口,提升幅度并不一样

| 能力           | 后训练可改善程度 | 主要瓶颈            |
| ------------ | -------: | --------------- |
| 单一事实检索       |       较大 | 位置偏差、干扰项        |
| 多目标检索        |       较大 | 遗漏、候选混淆         |
| 跨文档聚合        |     中到较大 | 实体对齐、证据整合       |
| 多跳推理         |       中等 | 中间状态和证据链        |
| 长篇写作一致性      |       中等 | 目标漂移、局部生成偏好     |
| 大型代码库理解      |       中等 | 动态依赖、隐含状态、仓库结构  |
| 长时间 Agent 工作 |   仅靠模型有限 | 上下文管理、工具重读、任务账本 |
| 超过位置支持范围     |      很有限 | 位置编码和基础训练       |

后训练最容易提高的是“正确取用已有信息”。

最难提高的是“在几十万 token 内构造并持续维护一个复杂、动态、全局一致的世界模型”。后者不仅受检索能力限制,还受模型推理深度、工作记忆、输出策略和 Harness 状态管理限制。

---

## 六、为什么模型会出现“窗口很大,但越用越笨”

模型的注意力机制虽然允许每个 token 与大量历史 token 建立联系,但这不意味着模型拥有一个无损数据库。

随着上下文增长,会同时发生:

### 信息竞争

更多 token 竞争有限的注意力和表示资源。即使计算量随长度增加,模型每层的维度、头数和推理深度并没有同比增加。

### 位置分布偏移

模型可能主要在较短序列上训练。推理时把相关信息放在 150K 位置,属于训练中较少见的分布。

### 中间状态损耗

多步任务需要不断把旧信息重新编码进当前隐状态。模型通常不会把全部过去内容重新完整推理一次,而是根据当前 token 对历史表示进行选择性读取。

### 策略漂移

长对话中会积累许多局部目标、修正、例外和历史决策。模型可能仍能检索到它们,却无法判断哪些约束当前仍然有效。

因此,后训练提高有效窗口,本质上是在训练模型更好地分配这套有限资源,而不是消除有限性本身。

---

## 七、对于 Coding Agent,有效窗口尤其不等于模型窗口

在 Coding Agent 中,可以至少区分三种窗口:

1. **原始 token 窗口**:模型本次调用实际看到的内容;
2. **任务有效窗口**:模型能可靠利用多少历史需求、代码和测试结果;
3. **系统有效窗口**:模型加上搜索、文件读取、摘要、任务账本、Git diff 和重新验证之后,能维持多大规模的项目状态。

后训练可以改善第二层,例如让模型:

* 更主动寻找定义和调用点;
* 在修改前读取相关测试;
* 发现缺少信息时使用工具;
* 避免只依据最近打开的文件;
* 在较长历史中遵守早期需求;
* 修改后重新验证关键假设。

但第三层主要依赖 Harness。

一个 200K 模型如果 Harness 无差别地塞入日志、旧文件和重复 diff,实际有效窗口可能很差;一个 64K 模型如果能够按需检索、保存结构化任务状态、定期重新读取真实文件,系统有效窗口反而可能更大。

因此,你此前设想的精细上下文管理模块,与模型后训练不是替代关系,而是乘法关系:

[
\text{Agent 有效上下文}
\approx
\text{模型长上下文能力}
\times
\text{后训练形成的使用策略}
\times
\text{Harness 提供的信息质量}
]

其中任何一项接近零,扩大标称窗口的收益都会迅速递减。

---

## 最终判断

**后训练确实可以提升有效上下文窗口,而且这很可能是当前前沿模型代际改进的重要来源之一。**

不过它提升的主要是:

* 检索可靠性;
* 抗干扰能力;
* 多处证据整合;
* 上下文 grounding;
* 长任务中的行为策略;
* 何时搜索、重读、总结和验证。

它不能独立解决:

* 位置编码超出范围;
* 基座从未学过长距离结构;
* 固定模型容量下的信息竞争;
* 无限长度的精确记忆;
* Agent 长期状态管理。

所以,与其说后训练“扩大了模型的大脑容量”,不如说它**提高了模型对既有长上下文空间的有效带宽和使用效率**。同样是 200K 窗口,一个后训练不充分的模型可能只有前后各几千 token 真正可靠;一个经过长上下文继续训练、SFT 和专门 RL 的模型,则可能在相当大范围内稳定进行检索和聚合。但越接近复杂的全局推理、仓库级修改和长周期 Agent 任务,实际有效窗口仍会远小于标称窗口。

[1]: https://arxiv.org/abs/2404.06654 "[2404.06654] RULER: What's the Real Context Size of Your Long-Context Language Models?"
[2]: https://arxiv.org/abs/2401.18058 "[2401.18058] LongAlign: A Recipe for Long Context Alignment of Large Language Models"
[3]: https://arxiv.org/abs/2603.02146 "[2603.02146] LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards"
[4]: https://arxiv.org/abs/2410.02660 "[2410.02660] How to Train Long-Context Language Models (Effectively)"
回复

使用道具 举报

     
发表于 2026-8-5 21:03 | 显示全部楼层
舞以 发表于 2026-8-5 20:19
gpt指导说后训练还挺重要的

对的对的
不过flash还是偶尔会漏信息,还是期待pro快点端出来
回复

使用道具 举报

     
发表于 2026-8-5 21:56 | 显示全部楼层
想请教一下,pi有什么做上下文压缩的方案,现在dsv4f,做个任务很容易就突破1m限制

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-5 22:11 来自手机 | 显示全部楼层
风速前进mo 发表于 2026-8-5 21:56
想请教一下,pi有什么做上下文压缩的方案,现在dsv4f,做个任务很容易就突破1m限制

论坛助手,iPhone ...

/compat
觉得不满意应该能调提示词或者找到其他插件的压缩
回复

使用道具 举报

     
发表于 2026-8-5 22:15 | 显示全部楼层
scikirbypoke 发表于 2026-8-5 22:11
/compat
觉得不满意应该能调提示词或者找到其他插件的压缩

谢谢,明天试试

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-5 22:21 | 显示全部楼层
pro有效上下文能达到500k吗

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-5 22:48 来自手机 | 显示全部楼层
已经用到flash的极限性能了,解几何算法bug还是为难它了

—— 来自 HUAWEI ALN-AL00, Android 12, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-8-5 23:55 | 显示全部楼层
话说flash现在在cot里好像不会写伪代码了,之前会不会?
反正k3是会写的,不知道flash正式版的cot是不是已经进化过了

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-8-6 00:02 | 显示全部楼层
CCauchy 发表于 2026-8-5 22:21
pro有效上下文能达到500k吗

论坛助手,iPhone

flash 都到 40k 了,pro50k 应该可以
回复

使用道具 举报

     
发表于 2026-8-6 00:21 来自手机 | 显示全部楼层
舞以 发表于 2026-8-5 23:55
话说flash现在在cot里好像不会写伪代码了,之前会不会?
反正k3是会写的,不知道flash正式版的cot是不是已 ...

应该是pro下放的
回复

使用道具 举报

     
发表于 2026-8-6 07:34 | 显示全部楼层
昨天试了下用来汉化游戏,也不错,dsv4f去提取文字,让dsv4f主动外包给本地部署的qwen8b,再把汉化后的文字替换回去一轮下来花不了几个钱
回复

使用道具 举报

     
发表于 2026-8-6 08:02 | 显示全部楼层

硅基世界也有左转的红灯
回复

使用道具 举报

     
发表于 2026-8-6 08:11 来自手机 | 显示全部楼层
jeff dean带骨干跑路,哈基米估计彻底完蛋了。
不愧是谷歌,连跑路的人都一个比一个重量级。这就是大公司的人才储备吗?

——来自 NX789J 上的 S1er 客户端
回复

使用道具 举报

     
发表于 2026-8-6 08:27 来自手机 | 显示全部楼层
flash比之前慢了很多
回复

使用道具 举报

发表于 2026-8-6 08:41 来自手机 | 显示全部楼层

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-8-6 08:54 | 显示全部楼层

这个没准的,也许是差点进神秘园,也许就是生死边缘悟道了才能去干deepseek呢
回复

使用道具 举报

发表于 2026-8-6 09:03 | 显示全部楼层
我用的之前楼里推的羊毛第三方,速度很快,也没降智,但是我想用pro ga和harness啊,这周不出的话再次从梁圣降格到牢梁
回复

使用道具 举报

     
发表于 2026-8-6 09:06 来自手机 | 显示全部楼层
sellboy 发表于 2026-8-6 08:54
这个没准的,也许是差点进神秘园,也许就是生死边缘悟道了才能去干deepseek呢 ...

也许已经被掉包了,出来的这个梁圣是未来的ASI用时间机器送过来促成AGI实现的机器人

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-6 09:10 来自手机 | 显示全部楼层
当光停止 发表于 2026-8-6 08:11
jeff dean带骨干跑路,哈基米估计彻底完蛋了。
不愧是谷歌,连跑路的人都一个比一个重量级。这就是大公司的 ...

不是?Jeff Dean他不都在谷歌干了快三十年吗?他都能跑路卧槽

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-8-6 09:10 | 显示全部楼层
计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大,请合理安排您的使用。具体方案以正式通知为准。
回复

使用道具 举报

     
发表于 2026-8-6 09:11 | 显示全部楼层
计费页面上方显示的,大的要来了?
回复

使用道具 举报

     
发表于 2026-8-6 09:12 | 显示全部楼层
卧槽要涨价了
回复

使用道具 举报

发表于 2026-8-6 09:15 来自手机 | 显示全部楼层
这下变牢梁了
回复

使用道具 举报

     
发表于 2026-8-6 09:15 | 显示全部楼层
什么要涨价了,是按之前峰谷定价吗,还是再进一步涨
回复

使用道具 举报

发表于 2026-8-6 09:17 | 显示全部楼层
感觉是推理量大到他们的研究工作用的资源都要拿来跑了    Re:Source
回复

使用道具 举报

     
发表于 2026-8-6 09:18 | 显示全部楼层
不要啊牢梁
回复

使用道具 举报

     
发表于 2026-8-6 09:21 | 显示全部楼层
蹬太狠了吧
用户赶都赶不走.jpg
回复

使用道具 举报

     
发表于 2026-8-6 09:21 | 显示全部楼层
8月初还剩两天了。
回复

使用道具 举报

     
发表于 2026-8-6 09:22 | 显示全部楼层
涨价也好,倒是端上来啊!    Re:Source
回复

使用道具 举报

发表于 2026-8-6 09:22 | 显示全部楼层
还是算力卡资源不够,不然这个价格也能回本
回复

使用道具 举报

     
发表于 2026-8-6 09:22 来自手机 | 显示全部楼层
不!

—— 来自 realme RMX3700, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-8-6 09:23 | 显示全部楼层
赚肯定是赚,但是算力没冗余了吧
都怪美帝和菊花(
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-6 10:14 , Processed in 0.173520 second(s), 6 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表