zfy1989 发表于 2026-8-27 19:13

qqq2142 发表于 2026-8-27 15:50
我还是不行,难道是我姿势真的有问题?

还有一个选项要勾选,你找找我在电脑旁边,有说明的

—— 来自 HONOR PTP-AN70, Android 16, 鹅球 v3.5.99

qwased 发表于 2026-8-27 19:25

olo12138 发表于 2026-8-27 19:04
我主要是玩gal时要用来翻译一些galgame,本地部署方便点

hy mt2 1.8b,手机都能跑,就500MB大小
不过翻译出来的文本就是个顺畅一点的谷歌机翻

UncleDracula 发表于 2026-8-27 19:26

olo12138 发表于 2026-8-27 19:04
我主要是玩gal时要用来翻译一些galgame,本地部署方便点

https://github.com/Tencent-Hunyuan/Hy-MT/blob/main/README_CN.md
这个,1.8B,吊打机翻

olo12138 发表于 2026-8-27 19:35

UncleDracula 发表于 2026-8-27 19:26
https://github.com/Tencent-Hunyuan/Hy-MT/blob/main/README_CN.md
这个,1.8B,吊打机翻

ok,多谢

龙骑士尹志平 发表于 2026-8-27 19:41

豆包虽然蠢,但是互联网知识非常全面,有时候我和大肥鱼两个大眼瞪小眼雷霆大思考,项目进行不下去的时候,去问问豆姐或者哈基米,可能会有意外收获。大肥鱼你不和他说他不会主动上网去搜索的,不知道其他模型怎么样。

UncleDracula 发表于 2026-8-27 19:56

龙骑士尹志平 发表于 2026-8-27 19:41
豆包虽然蠢,但是互联网知识非常全面,有时候我和大肥鱼两个大眼瞪小眼雷霆大思考,项目进行不下去的时候, ...

哈基米虽然agent拉跨,但世界知识没得说,独一档,我都是当设计顾问用的

kylezy123 发表于 2026-8-27 20:28

本帖最后由 kylezy123 于 2026-8-27 20:29 编辑

斯卡文分则能成 发表于 2026-8-27 19:07
基元律动好用嘛
有邀请码嘛
邀请好友限时活动继续延长,体验OpenSquilla新功能畅享免费token
https://tokenrhythm.studio/i/rf_tr_Xo7qCRL2xImqZIs_bKz8J3Sx使问一下他们那个软件就能获得68块钱。脚本没啥问题有时候会504报错

lactone 发表于 2026-8-27 20:32

本帖最后由 lactone 于 2026-8-27 20:42 编辑

知乎上有个peng bo自己搞了个大模型,国模的后训练只是蒸馏,所以自己蒸馏一个模型,说是年底能得到同尺度开源模型的性能

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99

cscbzcbz 发表于 2026-8-27 20:34

lactone 发表于 2026-8-27 20:32
知乎上有个peng bo自己搞了个大模型,说是为了证明国模的后训练只是蒸馏,所以自己蒸馏一个模型,说是年底 ...

祝他好运

lactone 发表于 2026-8-27 20:44

cscbzcbz 发表于 2026-8-27 20:34
祝他好运

不过这个人还挺厉害的,提了一个RWKV架构,说是结合了rnn和transformer的优势

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99

唠叨 发表于 2026-8-27 20:59

大佬们有能本地部署的无甲写书模型推荐吗? 16g5060ti

goranger 发表于 2026-8-27 21:02

本帖最后由 goranger 于 2026-8-27 23:03 编辑

用iPhone登录grok,马善人送了7天订阅试用,还包含一张重置卡,用auth授权跑在hermes里,感觉很快,拿来跑子代理绰绰有余,今晚又能使劲蹬了

cscbzcbz 发表于 2026-8-27 21:08

lactone 发表于 2026-8-27 20:44
不过这个人还挺厉害的,提了一个RWKV架构,说是结合了rnn和transformer的优势

—— 来自 HONOR AAK-AN00 ...



AI真的好用


他是谁:彭博(PENG Bo),RWKV 架构作者、元始智能创始人。RWKV 是"RNN+Transformer 结合体":训练可并行、推理无 KV cache、纯 RNN,主打低算力低成本。

他说的原话(2026.8 知乎帖):

"大模的实际用途就是给小模蒸馏"——他认为国模后训练大多靠蒸馏。
RWKV7 G1i 13B/7B/3B/1B(纯 RNN),目前 code/STEM 还差 Qwen3.5 一截,目标是年底全面追上,全部训练只用"十几 T tokens",9 月还有更强的 G1j。
有没有可能?

✅ 方向可行:蒸馏+强数据让小模型追平同尺度开源,有历史先例(R1-Distill、Qwen 系)。
⚠️ 三个风险:① 学生上限=老师,追平要看对标哪档(9B/27B/35B);② "只是蒸馏"是过度简化,他自己也要预训练基座;③ 目前缺第三方独立评测,"年底追上"是路线图承诺,不是成绩单。
定性:技术上有可能、成本确实低,但"年底全面追平"是激进目标,风险在数据质量和验证,不在钱。
代价(估算):

13B×约12T tokens ≈ 40~50 万 H100 GPU·小时
云 GPU:约 $100~300万(全家桶)
蒸馏数据:$15~100万
总计约 $50万300万(人民币几百万两千万),比从头训前沿模型便宜 1~2 个数量级
一句话:值得关注的开源项目,当"板上钉钉"看就过了。

半江瑟瑟半江红 发表于 2026-8-27 21:13

唠叨 发表于 2026-8-27 20:59
大佬们有能本地部署的无甲写书模型推荐吗? 16g5060ti

本地部署参数太小写作会很悲剧的
而且这个显存……恕我直言……真的不中咧

qz66618 发表于 2026-8-27 21:40

这人我看了下他的研究和发言,感觉是有想法有实力的,但是他这一套发言我不好说能不能成,感觉不像是能推翻当前transformer路线的人

FACS 发表于 2026-8-27 21:50

rwkv说了有好几年了

自由之紫roy 发表于 2026-8-27 21:54

还是想等本地能跑的fable5级别的模型 70b大小

startraveller 发表于 2026-8-27 22:07

qz66618 发表于 2026-8-27 21:40
这人我看了下他的研究和发言,感觉是有想法有实力的,但是他这一套发言我不好说能不能成,感觉不像是能推翻 ...

有点本事但是过于自嗨

noneoneone 发表于 2026-8-27 22:19

我记得好早前就看过他提出的RWKV,说主流路线是错的。

德尔惠净水器 发表于 2026-8-27 22:20

glm5.3f大概在哪个水平

舞以 发表于 2026-8-27 22:22

德尔惠净水器 发表于 2026-8-27 22:20
glm5.3f大概在哪个水平

更贵的v4fve差不多,glm订阅用户的性价比选择

论坛助手,iPhone

qwased 发表于 2026-8-27 22:35

自由之紫roy 发表于 2026-8-27 21:54
还是想等本地能跑的fable5级别的模型 70b大小

感觉其实是不可能的,现在DS4F/qwen3.8next/GLM5.3T全都是蒸自家大模型然后超长思考换智力,和kimi k3/fable/sol这种直觉就很强的模型表现完全不一样

→熙← 发表于 2026-8-27 22:36

德尔惠净水器 发表于 2026-8-27 22:20
glm5.3f大概在哪个水平

不算太好用, 智商很怪, 会跑歪, 没ds4v舒服
速度还没glm5.3快
缓存不便宜, 多轮对话消耗挺大

crow_wine 发表于 2026-8-27 22:43

这些高参数一样都是顶级大雷霆思考,只是你只能看见kimi的而已

舞以 发表于 2026-8-27 22:45

炒作模型的“直觉”不可取,fable照样雷霆思考

论坛助手,iPhone

crow_wine 发表于 2026-8-27 22:45

现在感觉就是这个架构感觉有点走到头,不仅堆规模,还堆思考输出,但是算力没有同步的线性增长

德尔惠净水器 发表于 2026-8-27 22:48

目前大模型有没有自己的“摩尔定律”

qwased 发表于 2026-8-27 23:09

https://github.com/Felliks/qwen38-flash-next-one-dgx-spark

dgx单机方案,常态30tk/s输出,买了dgx的坛友来个实测啊

tillnight 发表于 2026-8-27 23:27

本帖最后由 tillnight 于 2026-8-27 23:33 编辑

qwased 发表于 2026-8-27 22:35
感觉其实是不可能的,现在DS4F/qwen3.8next/GLM5.3T全都是蒸自家大模型然后超长思考换智力,和kimi k3/fa ...
“直觉”,指不给你看思维链。

哦,虽然没有思维链,但对着sol这输出速度还觉得他直觉而没有思考人生,那也很灵性了。

至于给你看一部分思维链的k3,真用过就知道一样在那里let me, but wait左右互博,哪门子直觉。

UncleDracula 发表于 2026-8-27 23:37

qwased 发表于 2026-8-27 23:09
https://github.com/Felliks/qwen38-flash-next-one-dgx-spark

dgx单机方案,常态30tk/s输出,买了dgx的坛 ...

才30?那这笔钱不如蹬DSH来的划算吧

冤枉呐 发表于 2026-8-27 23:39

qqq2142 发表于 2026-8-27 15:50
我还是不行,难道是我姿势真的有问题?

兄弟,我对你插件市场这个插件很感兴趣啊

—— 来自 HUAWEI ALN-AL10, Android 12, 鹅球 v3.5.99

novalli 发表于 2026-8-27 23:41

现在本地部署一般怎么搞?ollama?好久没上手不知道现在发展到什么样了?

—— 来自 Xiaomi 25042PN24C, Android 16, 鹅球 v4.0-alpha

startraveller 发表于 2026-8-27 23:50

qwased 发表于 2026-8-27 23:09
https://github.com/Felliks/qwen38-flash-next-one-dgx-spark

dgx单机方案,常态30tk/s输出,买了dgx的坛 ...

周末试试,单台还是太慢了,得上两台。

qwased 发表于 2026-8-27 23:54

startraveller 发表于 2026-8-27 23:50
周末试试,单台还是太慢了,得上两台。

似乎16G显存+64G内存都能跑个10~20tk/s
rtx5000pro可以开mtp跑到100tk/s以上,只要体验能到dsv4f的8成就很无敌了

xiaohanne 发表于 2026-8-27 23:54

舞以 发表于 2026-8-27 22:45
炒作模型的“直觉”不可取,fable照样雷霆思考

论坛助手,iPhone

不是直觉,是效率

startraveller 发表于 2026-8-28 00:32

qwased 发表于 2026-8-27 23:54
似乎16G显存+64G内存都能跑个10~20tk/s
rtx5000pro可以开mtp跑到100tk/s以上,只要体验能到dsv4f的8成就 ...

72G 显存应该还行,16+64只能花式量化了

qwased 发表于 2026-8-28 00:37

startraveller 发表于 2026-8-28 00:32
72G 显存应该还行,16+64只能花式量化了
那一坨ngram可以丢ssd的

真红之闪电 发表于 2026-8-28 00:43

傻吧喵 发表于 2026-8-27 16:01
当然是黄油呀,不懂怎么破没研究这个,不过翻上面评论有说deepseek现在不好破的,对ai只会网页和填入相关 ...

我刚试了下,小黄文还是一样写呀。

—— 来自 S1Fun

qqq2142 发表于 2026-8-28 00:59

冤枉呐 发表于 2026-8-27 23:39
兄弟,我对你插件市场这个插件很感兴趣啊

—— 来自 HUAWEI ALN-AL10, Android 12, 鹅球 v3.5.99 ...

我用的是一个打包客户端叫Deepseek-Harness-Desktop
https://github.com/dsh-tauri-desk/deepseek-harness-desktop

zerona 发表于 2026-8-28 01:17

zfy1989 发表于 2026-8-27 09:03
可以的,https://github.com/yexi-by/dsh-unrestricted#readme,这个

确实可用了。
页: 282 283 284 285 286 287 288 289 290 291 [292] 293
查看完整版本: Ox Alpha被认领,GLM-5.3-Flash上线|大模型讨论专楼