goranger 发表于 2026-8-25 19:39

舞以 发表于 2026-8-25 17:59
沃克巴蒂真是滕子一步好棋吧
大厂卷coding真没啥意思,优化好白领办公是真的对了


workbuddy不支持linux神器不

论坛助手,iPhone

catbone 发表于 2026-8-25 19:40

舞以 发表于 2026-8-25 18:01
Codex 272k上下文我以为已经很小了,hy3上下文多长啊,1m上下文不都开源了么

论坛助手,iPhone ...

256k,实际可用192k

tillnight 发表于 2026-8-25 19:44

hy3毕竟是对标上一代模型的,hy4应该是原生支持1m的。但是给不给你用是另一回事,从workbuddy现在其他模型的上下文要加价看,估计也是对标gpt,想开长上下文就用量翻倍。

舞以 发表于 2026-8-25 19:53

catbone 发表于 2026-8-25 19:40
256k,实际可用192k

这也太小了艹

龙骑士尹志平 发表于 2026-8-25 20:15

tonyunreal 发表于 2026-8-25 19:30
https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next

还是千问团队爽快,千问4架构新模型直接发下载( ...

qwen4要出来了?国模太卷了

iken 发表于 2026-8-25 20:23

唠叨 发表于 2026-8-24 23:29
nsfw还是得grok
https://ofox.io/r/2ta382
x-ai/grok-4.1-fast模型超便宜

opencode go的grok在dsh会报web_search无效参数错,搜索配置其他都不行,这个的在dsh能用吗?

overflowal 发表于 2026-8-25 20:30

tonyunreal 发表于 2026-8-25 19:30
https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next

还是千问团队爽快,千问4架构新模型直接发下载( ...

n-gram,线性注意力+稀疏注意力, 也正常,deepseek v4过后,发现这样压也可以那就继续压。
QSA我猜应该就是个DSA的变体,topk那套    Re:Source

舞以 发表于 2026-8-25 20:33

dsh官方的上下文压缩是不是会调用flash模型啊
我刚刚查了下我在下午的梁文峰时间花了米,好亏惹

startraveller 发表于 2026-8-25 20:41

tonyunreal 发表于 2026-8-25 19:30
https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next

还是千问团队爽快,千问4架构新模型直接发下载( ...

120BA6B,感觉是DGX Spark 快乐模啊

杀人鲸 发表于 2026-8-25 21:22

我嘞个去,客户端怎么又升级了?242了。最近7天,可以说一连升级了三次。所以,这是准备把最新的识图模型也配置到客户端来吗?

—— 来自 S1Fun

qwased 发表于 2026-8-25 21:31

杀人鲸 发表于 2026-8-25 21:22
我嘞个去,客户端怎么又升级了?242了。最近7天,可以说一连升级了三次。所以,这是准备把最新的识图模型也 ...

识图模式就是啊

杀人鲸 发表于 2026-8-25 21:41

qwased 发表于 2026-8-25 21:31
识图模式就是啊

哦,还真是。最近出了这个新模型,也不知道什么时候能普及到客户端上。只不过客户端上不是已经有一个可以看图的了吗?

—— 来自 S1Fun

overflowal 发表于 2026-8-25 21:44

杀人鲸 发表于 2026-8-25 21:41
哦,还真是。最近出了这个新模型,也不知道什么时候能普及到客户端上。只不过客户端上不是已经有一个可以 ...

你在说什么?   识图模式不就是用的vision Re:Source

serj005 发表于 2026-8-25 21:45

杀人鲸 发表于 2026-8-25 21:41
哦,还真是。最近出了这个新模型,也不知道什么时候能普及到客户端上。只不过客户端上不是已经有一个可以 ...
现在的识图模式模型就是v4f-vision-exp,区别是以前的识图模式不支持联网搜索,现在能用联网搜索了

qwased 发表于 2026-8-25 22:49

startraveller 发表于 2026-8-25 20:41
120BA6B,感觉是DGX Spark 快乐模啊

小红书上有qwen团队的说不虚v4flash,感觉要真的那dgx价格又要再翻倍了

tonyunreal 发表于 2026-8-25 23:18

舞以 发表于 2026-8-25 20:33
dsh官方的上下文压缩是不是会调用flash模型啊
我刚刚查了下我在下午的梁文峰时间花了米,好亏惹 ...

联网搜索会按flash扣钱
子代理默认开pro

这两个坑要小心,用插件可以替换掉

—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99

RookieTnT 发表于 2026-8-25 23:23

goranger 发表于 2026-8-21 23:57
讲讲路子兄弟,适合拿自己大号嫖吗

开个小号就行了. 闲鱼应该有卖的吧. 不行就去薅腾讯的hy3呗. 翻译不用那么高性能都行 😂

舞以 发表于 2026-8-25 23:23

我让它自己查了下,发现是对话开始时是在中午的梁文谷用的flash,所以这个session里的默认模型就被设定了成了flash,后来我换sol干活的时候,它自动拉起来的子代理就会选择session的默认模型,也就是flash。🌚

论坛助手,iPhone

zy450 发表于 2026-8-25 23:24

scikirbypoke 发表于 2026-8-25 18:27
pi-vcc特别好用,无llm调用的结构化快速压缩,还有让ai能搜整个上下文的回忆功能 ...

感谢推荐,明天试试

RookieTnT 发表于 2026-8-25 23:25

舞以 发表于 2026-8-25 20:33
dsh官方的上下文压缩是不是会调用flash模型啊
我刚刚查了下我在下午的梁文峰时间花了米,好亏惹 ...

现在还有harness上下文压缩不用llm吗?

qwased 发表于 2026-8-25 23:30

本帖最后由 qwased 于 2026-8-25 23:34 编辑

RookieTnT 发表于 2026-8-25 23:25
现在还有harness上下文压缩不用llm吗?

上面说的pi vcc,我在接qwen3.8测试,可以的话72k上下文 apex mini量化就很可用了,这玩意差不多等于q5s量化了

舞以 发表于 2026-8-25 23:30

本帖最后由 舞以 于 2026-8-25 23:33 编辑

dsh的默认上下文压缩用的模型应该是当前模型,不过也有类似pi-vcc的插件了,可以试试
https://github.com/TsFreddie/dsh-compaction-instant
这是gpt帮我找到的,有需要的漏油可以看看

kinfox 发表于 2026-8-25 23:43

今晚测了一下,用pi来接本地的模型qwen3.8,找到一个很不错的q4量化模型,跑起来特别顺。速度可以到60,70。pi那边接了一个国内开发者做的超级长上下文自动压缩,感觉单对话的长任务完全没有后顾之忧了。。
因为pi干净,所以本地模型速度提升特别大😭
反正难的任务才去用api,起码钱包是保住了😂 测试随便扔个游戏截图给本地ai,然后让它复刻玩法自己重新设计一个,四十分钟就加我提一堆策划优化需求修改就搞完了,反正保底是够用了。

阿刚 发表于 2026-8-25 23:49

话说是上下文压缩还是让他自己做记录之后开新会话好点

startraveller 发表于 2026-8-25 23:52

qwased 发表于 2026-8-25 22:49
小红书上有qwen团队的说不虚v4flash,感觉要真的那dgx价格又要再翻倍了

125B NVFP4 + 51B n-gram 估计就80G左右,激活6B不吃内存带宽,如果能加个DFlash 2说不定单Spark能飙到80tps +。

真是这样估计全世界的Spark要卖断货。

qwased 发表于 2026-8-26 00:02

kinfox 发表于 2026-8-25 23:43
今晚测了一下,用pi来接本地的模型qwen3.8,找到一个很不错的q4量化模型,跑起来特别顺。速度可以到60,70 ...

你用的是哪个模型,apex吗
我现在感觉有pi vcc这种压缩上下文的插件之后确实上下文长度需求低多了,反正难做的事情也不会用它

舞以 发表于 2026-8-26 00:06

codex又重置了?

论坛助手,iPhone

舞以 发表于 2026-8-26 00:08


难绷喵

唠叨 发表于 2026-8-26 00:18

iken 发表于 2026-8-25 20:23
opencode go的grok在dsh会报web_search无效参数错,搜索配置其他都不行,这个的在dsh能用吗? ...

应该可以吧 我接酒馆用的

jonarryn 发表于 2026-8-26 00:24

serj005 发表于 2026-8-25 21:45
现在的识图模式模型就是v4f-vision-exp,区别是以前的识图模式不支持联网搜索,现在能用联网搜索了 ...

也就是说,现在识图模式是v4f正式版水平,其它还是预览版?

舞以 发表于 2026-8-26 00:30

jonarryn 发表于 2026-8-26 00:24
也就是说,现在识图模式是v4f正式版水平,其它还是预览版?

都更新了:三个模式分别是flash正式版、pro正式版和这个flash的多模态exp模型

tonyunreal 发表于 2026-8-26 00:39

tonyunreal 发表于 2026-8-24 20:22
看红迪上说国外版Minimax Plan 8月25号要再次涨价?

涨了10%
$20 / $50 / $120 -> $22 / $55 / $132

qwased 发表于 2026-8-26 00:44

给omp装了webui,如果再加上没涨价的flash0731,就是理想中的dsh了

qwased 发表于 2026-8-26 00:56

阿刚 发表于 2026-8-25 23:49
话说是上下文压缩还是让他自己做记录之后开新会话好点

无人值守的长程任务肯定只能上下文压缩了,人就在旁边等的话我会在上下文300~400K左右就让写交接文档开新对话

阿刚 发表于 2026-8-26 01:02

qwased 发表于 2026-8-26 00:56
无人值守的长程任务肯定只能上下文压缩了,人就在旁边等的话我会在上下文300~400K左右就让写交接文档开新 ...

卢克倒不至于无人值守……那还是定期交接就好

qwased 发表于 2026-8-26 01:08

本帖最后由 qwased 于 2026-8-26 01:09 编辑

阿刚 发表于 2026-8-26 01:02
卢克倒不至于无人值守……那还是定期交接就好

上下文多了一句话就哐哐掉余额
顺便上面楼友说的pi vcc很好用,就是不知道怎么调压缩阈值

Znesmoc 发表于 2026-8-26 01:10

还想着用ai整点音频相关的活,试了一下Openrouter里的谷歌和OPENAI的模型就是报错,直连就是区域锁,走代理就说违反服务协议
还有啥能用的靠谱的中转站吗

舞以 发表于 2026-8-26 01:13

我试了下dsh版的vcclike,看起来还行,也能自己调阈值,默认是0.5,我改成了0.8哈哈
傻卵sol的窗口太jb小了,这个月降级到5x,额度不能挥霍了

论坛助手,iPhone

mintslime 发表于 2026-8-26 04:20

Znesmoc 发表于 2026-8-26 01:10
还想着用ai整点音频相关的活,试了一下Openrouter里的谷歌和OPENAI的模型就是报错,直连就是区域锁,走代理 ...

号脏了,换个新号走代理支付宝充钱试试,我的新号支付宝充目前还没事

schneehertz 发表于 2026-8-26 08:12

Znesmoc 发表于 2026-8-26 01:10
还想着用ai整点音频相关的活,试了一下Openrouter里的谷歌和OPENAI的模型就是报错,直连就是区域锁,走代理 ...

换个梯子试试?

—— 来自 Xiaomi 23127PN0CC, Android 16, 鹅球 v4.0-alpha
页: 270 271 272 273 274 275 276 277 278 279 [280] 281 282 283 284 285 286 287 288 289
查看完整版本: Ox Alpha被认领,GLM-5.3-Flash上线|大模型讨论专楼