找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] DeepSeek V4.1 Flash:更强、更快、更普惠 | 大模型讨论专楼

 火... [复制链接]
     
发表于 2026-9-4 18:24 | 显示全部楼层
muermaru 发表于 2026-9-4 15:48
kimi的甲好破吗,我看有人评价现在k3是写文最好的

K3写文不知道留白,不中
回复

使用道具 举报

     
发表于 2026-9-4 18:26 | 显示全部楼层
买了个kimi订阅,智商还行,但是老是429,一个活重试了好多次
回复

使用道具 举报

     
发表于 2026-9-4 18:26 来自手机 | 显示全部楼层
本帖最后由 lactone 于 2026-9-4 18:47 编辑

感觉大模型几个里程碑是gpt4-dsr1-gemini pro-opus4.6-fable,然后是astra

编辑了

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-9-4 18:37 | 显示全部楼层
两天半的梁文谷,爽蹬开始
回复

使用道具 举报

     
发表于 2026-9-4 18:38 来自手机 | 显示全部楼层
lactone 发表于 2026-9-4 18:26
感觉大模型几个里程碑是gpt4-dsr1-gemini pro-opus4.6-fable,然后是astra

国模现在压力山大

何意味?我看跑分和x的一些反馈,astra水平和fable5.1差不多
回复

使用道具 举报

     
发表于 2026-9-4 18:41 | 显示全部楼层
本帖最后由 squallx 于 2026-9-4 18:47 编辑
lactone 发表于 2026-9-4 18:26
感觉大模型几个里程碑是gpt4-dsr1-gemini pro-opus4.6-fable,然后是astra

国模现在压力山大

笑死 什么时候LUNA价格能随便蹬SOL了再来咩吧 要带节奏换点套路行不行
回复

使用道具 举报

     
发表于 2026-9-4 18:42 来自手机 | 显示全部楼层
莫名其妙。
回复

使用道具 举报

     
发表于 2026-9-4 18:43 来自手机 | 显示全部楼层
lactone 发表于 2026-9-4 18:26
感觉大模型几个里程碑是gpt4-dsr1-gemini pro-opus4.6-fable,然后是astra

国模现在压力山大

开玩笑,压力再大能比今年三四月份大?

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-9-4 18:50 来自手机 | 显示全部楼层
浪费喝咖啡 发表于 2026-9-4 18:38
何意味?我看跑分和x的一些反馈,astra水平和fable5.1差不多

不是,其实是openai会营销

说实话我觉得astra硬实力进步不大,但是openai这波宣传直接绑定agi,而且还刻意把arc-agi-3这个benchmark分刷高,明显是想换战场了

Gemini pro后的这一波coding浪潮实际上是a\带起来的,现在openai宣传是不玩这个了

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-9-4 18:57 来自手机 | 显示全部楼层

因为程序员识货啊
你说现在模型是什么东西 那我只能说是经过一些人工育种的莎士比亚🐒
今天试了fable我的评价是不看模型名不知道更新了


— from motorola XT2603-1, Android 16, S1 Next Goose v4.0
回复

使用道具 举报

     
发表于 2026-9-4 18:59 | 显示全部楼层
问题是除了coding其他领域的变现能力到底如何也没人知道啊
如果撑不起业绩那还是一上市就连环爆
回复

使用道具 举报

发表于 2026-9-4 19:06 | 显示全部楼层
很同意某个随机刷到的观点

模型评测的手段太匮乏了,又乱又主观
回复

使用道具 举报

     
发表于 2026-9-4 19:09 来自手机 | 显示全部楼层
付费能力强的用户需要的能力才是模型需要并且应该优先解决的能力。像oneshot做游戏 有什么意义吗
回复

使用道具 举报

     
发表于 2026-9-4 19:19 | 显示全部楼层
jinuzuktII 发表于 2026-9-4 19:06
很同意某个随机刷到的观点

模型评测的手段太匮乏了,又乱又主观

LLM现在依然是纯黑盒,大伙测起来自然也就盲人摸象了
反正能解决问题就行
回复

使用道具 举报

头像被屏蔽
发表于 2026-9-4 19:26 | 显示全部楼层
提示: 作者被禁止或删除 内容自动屏蔽
回复

使用道具 举报

     
发表于 2026-9-4 19:27 | 显示全部楼层
haiuhfuwah 发表于 2026-9-4 19:09
付费能力强的用户需要的能力才是模型需要并且应该优先解决的能力。像oneshot做游戏 有什么意义吗 ...

openai要上市,肯定要整这些

过两天astra上线了,肯定满世界oneshot做游戏的视频
回复

使用道具 举报

     
发表于 2026-9-4 19:33 | 显示全部楼层
llm原理上还是不黑盒的吧,本质上字典压缩解压算法,你真给它输入一半莎士比亚它当然能把莎士比亚解压出来。只是这本字典确实不可名状
回复

使用道具 举报

发表于 2026-9-4 19:33 | 显示全部楼层
大部分公开benchmark 其实是垃圾,真的好的benchmark估计都在模型厂内部    Re:Source
回复

使用道具 举报

     
发表于 2026-9-4 19:40 来自手机 | 显示全部楼层
大模型公司都哪里不行宣传哪里,o以前前端视觉不行,这次拼命宣传,A以前数学不行,现在就天天宣传数学
回复

使用道具 举报

发表于 2026-9-4 19:51 | 显示全部楼层
补一个过期资讯

未被推送ASTRA的订阅账户每天一个重置卡

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-9-4 19:53 来自手机 | 显示全部楼层


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×

评分

参与人数 1战斗力 +1 收起 理由
德尔惠净水器 + 1 欢乐多

查看全部评分

回复

使用道具 举报

     
发表于 2026-9-4 19:56 | 显示全部楼层
怎么又是Astra又是Omen啥时候来个brimstorm
回复

使用道具 举报

     
发表于 2026-9-4 20:11 来自手机 | 显示全部楼层
zcode是不是又在送token了
没订阅的能领吗

—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-9-4 20:12 来自手机 | 显示全部楼层
突然想起来我对kimi有这么多滤镜因为我是苏剑林人迷。

泥潭也有是苏剑林而非杨植麟人迷的朋友吗🤣
回复

使用道具 举报

     
发表于 2026-9-4 20:32 | 显示全部楼层
tonyunreal 发表于 2026-9-4 20:11
zcode是不是又在送token了
没订阅的能领吗

应该是可以的


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-9-4 20:32 来自手机 | 显示全部楼层
kimi本来就是硬实力国模最强

除了慢没毛病

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-9-4 20:40 | 显示全部楼层
zcode无订阅的直接进就行,今天就能领,明天生效

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-9-4 20:42 | 显示全部楼层
opus4.6时代,猫老板可是认为国模在agent领域落后一年的
回复

使用道具 举报

     
发表于 2026-9-4 20:42 | 显示全部楼层
等60分钟拿95分和等5分钟拿70分,实际上后者体验还更好一点
大概过了及格线后,如果不能100%的做到一件事情,反而是越快得到结果有反馈,通过人来调整更加顺畅。
回复

使用道具 举报

     
发表于 2026-9-4 20:48 | 显示全部楼层
这边有痕迹未发的已经有 Kimi 3.1(大概率),GLM-6,DSv5,Qwen 4,说不定这个月就全出来了
回复

使用道具 举报

     
发表于 2026-9-4 20:49 | 显示全部楼层
startraveller 发表于 2026-9-4 20:48
这边有痕迹未发的已经有 Kimi 3.1(大概率),GLM-6,DSv5,Qwen 4,说不定这个月就全出来了 ...

怎么中美回合制了。
回复

使用道具 举报

     
发表于 2026-9-4 20:52 来自手机 | 显示全部楼层
大参数搭配小参数,大参数规划并指挥小参数,又好又快又省干完活。这样做有可能吗?

—— 来自 HUAWEI HOP-AL10, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-9-4 20:53 | 显示全部楼层
airshit 发表于 2026-9-4 20:52
大参数搭配小参数,大参数规划并指挥小参数,又好又快又省干完活。这样做有可能吗?

—— 来自 HUAWEI HOP ...

有啊,大家都是这么干的。

需要耐心调教agent不然会被大模型api烧破产。
回复

使用道具 举报

     
发表于 2026-9-4 20:53 | 显示全部楼层
等Astra上线蹬两张重置卡的用量,看看到底啥水平,拉了的话下个月就把100刀的订阅钱送给杨圣算了
k3在coding上我觉得比sol是强的,速度么都半斤八两。
回复

使用道具 举报

     
发表于 2026-9-4 20:55 | 显示全部楼层
overflowal 发表于 2026-9-4 19:33
大部分公开benchmark 其实是垃圾,真的好的benchmark估计都在模型厂内部    Re:Source ...

qwen的问题估计就是内部不像其他几家有鲜明的“好模型该咋样”的认知
表现出来就是狂刷公开benchmark
回复

使用道具 举报

     
发表于 2026-9-4 20:59 | 显示全部楼层
airshit 发表于 2026-9-4 20:52
大参数搭配小参数,大参数规划并指挥小参数,又好又快又省干完活。这样做有可能吗?

—— 来自 HUAWEI HOP ...

很多这么干的

如果你用 Claude Code 的话,可以用 Fable 指挥,让其他模型干活的模式,这样最经济,可以用的时间比较长。

用 Fable 指挥其他 Agent 效果很好是因为它给的指令很详细,基本上不会出什么岔子。

大部分任务你选 Fable + High(或者Medium,千万别Max及以上),然后后面加一句:

--- 提示词开始 ---

注意你的主要任务是分析、编排和验证,具体任务尽可能交给 subagent(Opus 或 Sonnet)去执行。自己只做需求澄清、方案拆解、任务分发和结果验收,实现类工作(读大量代码、写代码、跑测试、批量修改)一律用 Agent 工具派给 subagent 执行。
回复

使用道具 举报

发表于 2026-9-4 21:05 来自手机 | 显示全部楼层
cc内部自己调用subagent时候会自己切模型么?这一周就给梁子送了几百块,好肉疼

—— 来自 Xiaomi 24129PN74C, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-9-4 21:09 来自手机 | 显示全部楼层
startraveller 发表于 2026-9-4 20:48
这边有痕迹未发的已经有 Kimi 3.1(大概率),GLM-6,DSv5,Qwen 4,说不定这个月就全出来了 ...

Glm6这个真没有
回复

使用道具 举报

     
发表于 2026-9-4 21:28 | 显示全部楼层
dsh的GitHub仓库已经提交了0.1.3-alpha.1
飞速更新啊
回复

使用道具 举报

     
发表于 2026-9-4 21:32 来自手机 | 显示全部楼层
command code的dsv4flash好像量化有点狠,群友测体素建模能力烂完了,就比基元律动那个彻底失败无法运行的好点
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-9-23 12:14 , Processed in 0.170156 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表