找回密码
 立即注册
搜索
楼主: sky453055730

[科技] 预告一下,搓了一整套dsh的记忆系统,能让长程对话保持在150k上下文以内,即将开源

[复制链接]
     
 楼主| 发表于 2026-9-1 19:28 | 显示全部楼层
qwased 发表于 2026-9-1 19:04
有没有考虑多模态的影响呢,之前的上下文管理插件对历史消息里面的图片处理感觉都有点问题 ...

实话实说,完全没有考虑多模态,我只用语言模型。。。
回复

使用道具 举报

     
发表于 2026-9-1 19:47 | 显示全部楼层
c月光咖啡 发表于 2026-9-1 11:49
qwen3~3.6在agent都是一坨,你可以试试3.8 27b本地化,那个才像样,140k上下文刚好塞到15.9缓存

—— 来 ...

多谢,我就怀疑是模型调用tool的问题,之前没自己弄过本地的
回复

使用道具 举报

     
发表于 2026-9-1 19:47 | 显示全部楼层
qwased 发表于 2026-9-1 15:22
看我的帖子换qwen3.8 27b iq3xxs

多谢大佬,我去试试
回复

使用道具 举报

     
发表于 2026-9-1 20:28 | 显示全部楼层
马克一记可以拿来写小说吗?有18+限制没
回复

使用道具 举报

     
发表于 2026-9-3 00:21 | 显示全部楼层
mark一下;等公开
回复

使用道具 举报

     
发表于 2026-9-3 00:56 | 显示全部楼层
sky453055730 发表于 2026-9-1 08:41
最大的成本来自于你第一次接入时,它会彻底破坏你原有的上下文,并且需要花费一些算力重构上下文,之后上 ...

85%缓存命中率比较低了。 DS 的长上下文在 coding 场景缓存命中率一般能达到98-99%。如果150k 缓存命中率85% ,输入成本相当于600多 K 的99%命中上下文了(升价后缓存命中是1/30,升价前缓存价格是非缓存的1%那 lz 的方法就完全没意义了)。 如果过多裁剪上下文,让1M 上下文的优势消失,甚至还会消耗更多的 token 来推理。

这个方案感觉效果可能不会太好。
回复

使用道具 举报

     
发表于 2026-9-3 09:55 来自手机 | 显示全部楼层
插眼

—— 来自 Xiaomi 22081212C, Android 15, 鹅球 v3.5.99
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-9-21 12:46 , Processed in 0.080445 second(s), 6 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表