找回密码
 立即注册
搜索
查看: 3104|回复: 28

[科技] 预告一下,搓了一整套dsh的记忆系统,能让长程对话保持在150k上下文以内,即将开源

[复制链接]
     
发表于 2026-8-31 21:36 | 显示全部楼层 |阅读模式
此帖将于2026-09-30 21:32自动关闭
实测200多万字原始对话流,实际调用模型的上下文始终保持在150k以内,让qwen3.8这样的本地模型彻底可以成为主力模型,256k上下文部署成本很低
且对话不会膨胀(或者说膨胀速度很慢),记忆甚至比目前市面所有agent用的上下文机制都要清晰,不会失忆,且很容易回忆起历史细节(具体逻辑和实现理念,会在开源同期公布)
目前在做开源前的准备和进一步测试,预计会在几周内开源

评分

参与人数 10战斗力 +13 收起 理由
JRPG + 1 前排
灰烬刺猬 + 2 好评加鹅
梅林的三角裤 + 2 好评加鹅
piako + 1
Bronzecraft + 1 资瓷
ov_efly + 1
shiny酱 + 1 好评加鹅
黑川エレン + 1 好评加鹅
luorenyuan + 2 好评加鹅
大智若愚琪露诺 + 1 好评加鹅

查看全部评分

回复

使用道具 举报

     
发表于 2026-8-31 21:42 | 显示全部楼层
那它会导致上下文缓存被破坏一直在prefill吗
回复

使用道具 举报

     
发表于 2026-8-31 23:03 来自手机 | 显示全部楼层
前排支持,看我留哪个版本的qwen3.8

—— 来自 Xiaomi 25019PNF3C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-8-31 23:16 来自手机 | 显示全部楼层
先收个藏
回复

使用道具 举报

发表于 2026-8-31 23:20 | 显示全部楼层
有点东西,前排围观
回复

使用道具 举报

     
发表于 2026-8-31 23:22 | 显示全部楼层
回复

使用道具 举报

     
发表于 2026-8-31 23:41 来自手机 | 显示全部楼层
马克一下

—— 来自 samsung SM-S9180, Android 13, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-8-31 23:41 来自手机 | 显示全部楼层
标记

—— 来自 samsung SM-S9180, Android 13, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-8-31 23:43 来自手机 | 显示全部楼层
标记一下,顺带问下,19年哪那个游戏后来咋样了,

—— 来自 OnePlus PJZ110, Android 15, 鹅球 v4.0-alpha
回复

使用道具 举报

     
发表于 2026-9-1 00:26 | 显示全部楼层
马克屯
回复

使用道具 举报

发表于 2026-9-1 02:28 来自手机 | 显示全部楼层
借用泥潭贴子的图

回复

使用道具 举报

     
发表于 2026-9-1 03:00 | 显示全部楼层
泥潭有面子系列
回复

使用道具 举报

     
发表于 2026-9-1 04:15 | 显示全部楼层
先插个眼

回复

使用道具 举报

发表于 2026-9-1 07:43 来自手机 | 显示全部楼层
这要什么样的硬件配置?
回复

使用道具 举报

     
发表于 2026-9-1 07:48 | 显示全部楼层
本帖最后由 catbone 于 2026-9-1 07:53 编辑

什么原理?有没有副作用?
回复

使用道具 举报

     
发表于 2026-9-1 08:10 来自手机 | 显示全部楼层
马克下

—— 来自 Xiaomi 25102RKBEC, Android 16, 鹅球 v4.0-alpha
回复

使用道具 举报

     
 楼主| 发表于 2026-9-1 08:41 | 显示全部楼层
qwased 发表于 2026-8-31 21:42
那它会导致上下文缓存被破坏一直在prefill吗

最大的成本来自于你第一次接入时,它会彻底破坏你原有的上下文,并且需要花费一些算力重构上下文,之后上下文的基本结构是不变的,当然,根据我的观察,上下文缓存命中率的确比之前用dsh原生上下文要低(现在是85%)左右,但原来dsh的95%以上,其上下文长度也远超我现在
所以其实,我现在成本还很低(上下文短),跑glm 5.3实际跑起来的消耗速度,甚至低于150%额度的zcode
回复

使用道具 举报

     
 楼主| 发表于 2026-9-1 08:41 | 显示全部楼层
O小不点0 发表于 2026-8-31 23:43
标记一下,顺带问下,19年哪那个游戏后来咋样了,

—— 来自 OnePlus PJZ110, Android 15, 鹅球 v4.0-alph ...

那当然是什么狗屎也没做出来拉
回复

使用道具 举报

     
 楼主| 发表于 2026-9-1 08:42 | 显示全部楼层
希德尼娅 发表于 2026-9-1 07:43
这要什么样的硬件配置?

不需要硬件配置,只是一套新的上下文机制
回复

使用道具 举报

     
 楼主| 发表于 2026-9-1 08:44 | 显示全部楼层
catbone 发表于 2026-9-1 07:48
什么原理?有没有副作用?

开源前会尽量测试,看看有没有副作用或bug,具体原理我在尝试写论文(当然是ai主笔),看有没有机会发表,发表不了,我就公开发布好了
回复

使用道具 举报

发表于 2026-9-1 09:03 来自手机 | 显示全部楼层
有点像augment搞的动态上下文载入?它们之前就靠这个在200k上下文时代可以一直做长任务而不超上下文。
回复

使用道具 举报

     
发表于 2026-9-1 09:35 来自手机 | 显示全部楼层
插眼等

—— 来自 vivo V2403A, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
 楼主| 发表于 2026-9-1 09:35 | 显示全部楼层
Wiksy 发表于 2026-9-1 09:03
有点像augment搞的动态上下文载入?它们之前就靠这个在200k上下文时代可以一直做长任务而不超上下文。 ...

完全不一样
回复

使用道具 举报

     
发表于 2026-9-1 09:52 | 显示全部楼层
来支持一下,对本地大模型应该很好用,不用管什么缓存命中率
回复

使用道具 举报

     
发表于 2026-9-1 09:59 | 显示全部楼层
本地模型Prefill时间长,特别Mac,频繁压缩上下文体验应该不会太好
回复

使用道具 举报

发表于 2026-9-1 10:10 | 显示全部楼层
marks佩恩
回复

使用道具 举报

     
发表于 2026-9-1 10:36 | 显示全部楼层
mark一下,等大佬救命了
顺便问问大佬
我16G显存,用ollama跑qwen3:14b,启动了dsh,但是感觉本地读写权限有问题,开了full danger权限
这个是模型不支持dsh的工具调用,还是dsh的有配置没设置?
或者有什么地方可以讨论这种问题?
回复

使用道具 举报

     
发表于 2026-9-1 11:49 来自手机 | 显示全部楼层
bourier 发表于 2026-9-1 10:36
mark一下,等大佬救命了
顺便问问大佬
我16G显存,用ollama跑qwen3:14b,启动了dsh,但是感觉本地读写权限 ...

qwen3~3.6在agent都是一坨,你可以试试3.8 27b本地化,那个才像样,140k上下文刚好塞到15.9缓存

—— 来自 HONOR MAA-AN10, Android 16, 鹅球 v3.5.99-debug
回复

使用道具 举报

     
发表于 2026-9-1 12:28 | 显示全部楼层
是装配式上下文?
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-9-1 13:07 , Processed in 0.225773 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表