nxmonitor 发表于 2026-8-27 11:09

wandeeees 发表于 2026-8-27 11:06
感觉deepseek的神秘灰测模型应该就是加上了这个engram,看他思考的时候非常自信,能很好的规划任务 ...
出了以后就知道了,我觉得可能大模型用上engram更强,一两百B的模型用着可能是因为智力不够的问题,老是在改里面的东西,导致思维链超长,运行时间也离谱

nxmonitor 发表于 2026-8-27 11:13

V4FV其实已经卡在过度思考的边缘了,新出的这两个的完成任务的时长绝对是不能忍的

唠叨 发表于 2026-8-27 11:24

给了GLM-5.3-Flash一个285MB的工具,minimaxM3写的,改了一个小bug,一轮改完,但是改完后一直在自检,卡了几分钟没动,我手动停止了,加了2个小功能,第一轮改完又在自检卡住,我手动停止,测试了一下,因为描述不到位只做好了一个功能,第二个功能做了一半,完善描述后一轮做好。但是一直在做最后检查和收尾。感觉检查和收尾比改bug做功能还慢。一共用了7天体验卡的165积分,还行。但是有个大问题,我接入的hermes,两次强调【你是多模态模型 可以自己看图片】,但是他还是认为【截图我暂时看不了】。

goranger 发表于 2026-8-27 11:25

目前我的订阅结构:gpt plus。网页版review github代码,规划;
luna跑在hermes层做agent接口(但是luna对话体验不如DeepSeek,目前开发阶段主要看中他指令遵从和安全意识比较高),缺点是慢。
DeepSeek、ox这类模型做子代理,之前用minimax m3,但发现minimax任务完成率太低了,总需要主agent返工。
另外谷善人的agy cli当一个系统外高级子代理。
minimax plus年付(一直想退,但是又觉得150%周限退了可惜),主要拿来跑记忆提炼、以及网页压缩、上下文压缩、视觉等hermes里的8个辅助模型,以及一些需要消耗大量token的实验性任务。但minimax连稳定的输出结构都不能保持。
后续考虑:opencode go套餐里的低价模型比如小米、musk啥的接替minimax的位置。月度成本已经140+80+70了。opencode其实跟minimax年付重复了,而且是不是能体验点其他更聪明的模型。希望minimax能下半年发发力起码蒸馏出来个flashTT

kinfox 发表于 2026-8-27 11:33

蹬完了,,做的还是意外的不错。看起来像模像样,总感觉这个ai肯定吃了很多小红薯的资料
准备扔给我的玩家测试了……

hugosol 发表于 2026-8-27 11:39

LeoDT 发表于 2026-8-27 09:34
写代码的话,现在有一波“什么记忆系统都不靠谱,代码才是唯一事实”的小趋势。

我实际体验下来也是,优 ...

写代码的话肯定要自己管理上下文吧,什么自动记忆系统都是干扰
真正有价值需要持久化的东西就要记成文档,什么该记什么不该记这个问题业界都还在争论,怎么可能指望ai帮你自动记

唠叨 发表于 2026-8-27 11:40

goranger 发表于 2026-8-27 11:25
目前我的订阅结构:gpt plus。网页版review github代码,规划;
luna跑在hermes层做agent接口(但是luna对 ...

我开了minimax的MAX月付 不过蹬了1.15B token后觉的理科工作还是不太适合他但是文科方面的工作完成的很好下个月我会改成plus
我不需要重度编程v4完全能满足我理科方面的工作了 所以昨天开了commandcode爽蹬 opencodego套餐5美元开了一个月月用量82.1%了还剩14 天 1 小时到期不续了
其他火山 api易 阿里云 deepseek都有几元余额没用完 留着备用吧

古畑任三郎2015 发表于 2026-8-27 11:46

几个都看了下,工作日还是太贵了,一天一顿饭钱还是太痛了,索性还是本地27b跑跑吧,晚上再蹬

很久就在那边l 发表于 2026-8-27 11:48

老黄上了0813,现在没多少人发现速度还很快

goranger 发表于 2026-8-27 11:52

唠叨 发表于 2026-8-27 11:40
我开了minimax的MAX月付 不过蹬了1.15B token后觉的理科工作还是不太适合他但是文科方面的工作完成的很 ...

我咋看linux do上说cg又是路由好几个供应商导致掉缓存又是说要涨价的。

med 发表于 2026-8-27 11:57

d4v挺好用的,现在这些sol ultra又慢又贵的模型到底谁在用啊 不知道怎么弄的

唠叨 发表于 2026-8-27 12:01

本帖最后由 唠叨 于 2026-8-27 12:02 编辑

goranger 发表于 2026-8-27 11:52
我咋看linux do上说cg又是路由好几个供应商导致掉缓存又是说要涨价的。


除了速度比官网慢一半外没察觉到什么问题,智力也正常,

官网我也一直在蹬,除了速度没有明显区别。

tonyunreal 发表于 2026-8-27 12:36

https://stock.10jqka.com.cn/20260827/c679342056.shtml

阿里云公告,大模型服务平台百炼将于北京时间2026年8月27日12:00:00起,对Qwen3.8-Flash模型模式计费单价进行下调调整。Qwen3.8-Flash是千问最新推出的多模态大模型,原生支持百万级上下文窗口,可一次性处理超长文档、代码仓库与复杂对话,在编程辅助、智能体协作、图文理解等场景中表现突出,兼容OpenAI与Anthropic接口协议,适合构建高并发应用与智能工作流。具体如下:输入价格调整前1元,调整后0.8元;输出价格调整前3元,调整后2.7元。

qwased 发表于 2026-8-27 12:37

tonyunreal 发表于 2026-8-27 12:36
https://stock.10jqka.com.cn/20260827/c679342056.shtml

阿里云公告,大模型服务平台百炼将于北京时间202 ...

不调缓存价格感觉还是亏

→熙← 发表于 2026-8-27 12:40

tonyunreal 发表于 2026-8-27 12:36
https://stock.10jqka.com.cn/20260827/c679342056.shtml

阿里云公告,大模型服务平台百炼将于北京时间202 ...

缓存一毛,打平梁文峰, 到梁文谷就不行了

cscbzcbz 发表于 2026-8-27 12:41

为什么都对缓存命中的价格语焉不详?这么不坦率

lactone 发表于 2026-8-27 12:49

牢梁缓存价格这么低,推理毛利还能做到80%以上

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99

CCauchy 发表于 2026-8-27 12:54

原来gpt不说人话不是免费网页版的问题吗

论坛助手,iPhone

半江瑟瑟半江红 发表于 2026-8-27 12:55

CCauchy 发表于 2026-8-27 12:54
原来gpt不说人话不是免费网页版的问题吗

论坛助手,iPhone

这模型就这样,电报体加不说人话,跟名片似的

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

ycjiang1337 发表于 2026-8-27 12:56

lactone 发表于 2026-8-27 12:49
牢梁缓存价格这么低,推理毛利还能做到80%以上

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99 ...

SSD缓存是梁叔叔的独家秘籍

赤星ビスコ 发表于 2026-8-27 12:58

med 发表于 2026-8-27 11:57
d4v挺好用的,现在这些sol ultra又慢又贵的模型到底谁在用啊不知道怎么弄的 ...

通过日志查bug这个场景最适合,而且还要思考开高,开个窗口和worktree扔一边让它慢慢玩就行

CCauchy 发表于 2026-8-27 13:01

半江瑟瑟半江红 发表于 2026-8-27 12:55
这模型就这样,电报体加不说人话,跟名片似的

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0 ...

a畜的感觉也不是很说人话,目前还是哈吉米3.1读起来最舒服,就是有的时候有点舔狗,ds就中规中矩

论坛助手,iPhone

半江瑟瑟半江红 发表于 2026-8-27 13:03

CCauchy 发表于 2026-8-27 13:01
a畜的感觉也不是很说人话,目前还是哈吉米3.1读起来最舒服,就是有的时候有点舔狗,ds就中规中矩

论坛助 ...

Gemini太舔了,有点恶心。d指导这方面我觉得最好

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

来都来了 发表于 2026-8-27 13:04

因为现在的智能体缓存命中率都能到 98% 以上,所以一个大模型的缓存命中价格直接决定了这个模型的使用费用。所以你看到谁家的模型吹自己输入输出有多便宜,却闭口不提缓存命中价格的时候,你只要呵呵就可以了

lactone 发表于 2026-8-27 13:05

我觉得kimi是立场最坚定的,主打一个任何讨论都给你nuance

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99

scikirbypoke 发表于 2026-8-27 13:08

tillnight 发表于 2026-8-27 10:45
别洗了,谷歌研究员直接引用猜牛来的推,然后说如果说这是咕咕嘎嘎会怎么样?然后多名谷歌研究员用各种暧 ...

之前只看了一点截图,怎么能这么蹭的

→熙← 发表于 2026-8-27 13:14

0813用we need思维链还是很强的

kinfox 发表于 2026-8-27 13:19

好贵啊啊啊啊,glm5.3flash给我修一些bug就可以修几百上千积分。。。根本不能爽登。
还是我本地的qwen3.8 27b好,踏踏实实的干活,质量也能保持 还不花钱
唉。。。ds的0.4折时代啥时候回来

Lorraine_Kinney 发表于 2026-8-27 13:24

我试了下,把日常翻译的ds4flash换成了qwen3.8flash也还行,之前阿里那边qwenmt都比ds4flash贵

阿刚 发表于 2026-8-27 13:31

唠叨 发表于 2026-8-27 11:24
给了GLM-5.3-Flash一个285MB的工具,minimaxM3写的,改了一个小bug,一轮改完,但是改完后一直在自检,卡了 ...

看不了那个是Hermes识图和主模型设置的问题,一开始v4fv也碰到过

hugosol 发表于 2026-8-27 13:35

A和O的模型因为不说人话所以国外有人专门做了一个skill,让它们用 ASD-STE100 Simplified Technical English 表达……
其实主要还是因为他们的旗舰模型太慢了,像DS不说人话你可以直接追问它让它解释,sol什么的雷霆大思考半天给你一段不说人话的回答真的要气死,再追问几轮上下文就用完了,这样子根本是没法用的

med 发表于 2026-8-27 13:41

赤星ビスコ 发表于 2026-8-27 12:58
通过日志查bug这个场景最适合,而且还要思考开高,开个窗口和worktree扔一边让它慢慢玩就行

...

sol ultra 一个任务就几个小时,各种corner case考虑的尽善尽美,然后主线跑错了,疯掉了

NaAgfykp 发表于 2026-8-27 13:45

我想用 fable 帮我做科研,就是探索一下潜在的创新点的话,是只要随便接一个 Agent 就行,还是说必须得要用官方 Agent?
另外这里的 Fable 是第三方中转站的 api

tonyunreal 发表于 2026-8-27 13:46

本帖最后由 tonyunreal 于 2026-8-27 16:46 编辑

牛来第三个demo蹬完,用时76分钟

输入235K 缓存9.7M 输出151K,缓存命中98%,39 tok/s
消费¥1.45

又改了8轮bug花了约¥1.7

https://deepdemos.top/demo/glm-5-3-flash-cc8bb3c1

冤枉呐 发表于 2026-8-27 13:54

kinfox 发表于 2026-8-27 11:33
蹬完了,,做的还是意外的不错。看起来像模像样,总感觉这个ai肯定吃了很多小红薯的资料
准备扔给我的玩家 ...

求测试

—— 来自 HUAWEI ALN-AL10, Android 12, 鹅球 v3.5.99

冤枉呐 发表于 2026-8-27 13:57

cscbzcbz 发表于 2026-8-27 12:41
为什么都对缓存命中的价格语焉不详?这么不坦率

阿里从来不坦诚

—— 来自 HUAWEI ALN-AL10, Android 12, 鹅球 v3.5.99

goranger 发表于 2026-8-27 14:07

悲报,我的七天体验卡一上午用完了TT,总计大概不到五千万token全部跑子代理

论坛助手,iPhone

Freewolf 发表于 2026-8-27 14:11

现在网页/pdf翻译有什么推荐的模型?本地跑小模型太慢了,在线api之前用d4f不错,但涨价后高峰有点用不起了

tonyunreal 发表于 2026-8-27 14:20

本帖最后由 tonyunreal 于 2026-8-27 14:48 编辑

goranger 发表于 2026-8-27 14:07
悲报,我的七天体验卡一上午用完了TT,总计大概不到五千万token全部跑子代理

论坛助手,iPhone ...
正常的,赠送的应该就是lite套餐单日水平,只能给入门用户尝尝鲜用

qwased 发表于 2026-8-27 14:24

Freewolf 发表于 2026-8-27 14:11
现在网页/pdf翻译有什么推荐的模型?本地跑小模型太慢了,在线api之前用d4f不错,但涨价后高峰有点用不起了 ...

你的显卡是什么?有12G显存就能跑hy mt2 7b了,我觉得比跑在线大模型快很多,质量也没啥差别
页: 280 281 282 283 284 285 286 287 288 289 [290] 291 292 293
查看完整版本: Ox Alpha被认领,GLM-5.3-Flash上线|大模型讨论专楼