找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] DeepSeek V4.1 Flash:更强、更快、更普惠 | 大模型讨论专楼

 火... [复制链接]
发表于 2026-9-4 07:44 | 显示全部楼层

这个榜已经坏了    Re:Source
回复

使用道具 举报

     
发表于 2026-9-4 07:52 来自手机 | 显示全部楼层
tibo说还没发Astra的延迟一天发一张重置卡

—— 来自 HONOR AAP-AN00, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-9-4 08:22 | 显示全部楼层
我去AIG来了,openai以后不准再提这个词咯
回复

使用道具 举报

     
 楼主| 发表于 2026-9-4 08:25 | 显示全部楼层
OPENAI也要有自己的肥波
现在怎么商稿都突出一个吹吹乐
回复

使用道具 举报

     
发表于 2026-9-4 08:33 来自手机 | 显示全部楼层
这两家为了上市吃相太难看了
回复

使用道具 举报

     
发表于 2026-9-4 08:35 | 显示全部楼层
那么今天大肥鱼有活吗
回复

使用道具 举报

     
发表于 2026-9-4 08:35 | 显示全部楼层
我只能骂奥特曼是个sb了,大家不用claude用codex的原因,不就是因为便宜吗?astra和fable一样贵,这谁用阿?
回复

使用道具 举报

     
发表于 2026-9-4 08:39 | 显示全部楼层
晚这么久,就端出来一个oai版Fable?
o➗也没活了啊,除非实际上便宜不少

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-9-4 08:47 | 显示全部楼层
舞以 发表于 2026-9-4 08:39
晚这么久,就端出来一个oai版Fable?
o➗也没活了啊,除非实际上便宜不少

就是一点不便宜啊
回复

使用道具 举报

     
发表于 2026-9-4 08:48 | 显示全部楼层
zy450 发表于 2026-9-4 08:35
那么今天大肥鱼有活吗

早上让大肥鱼自己预测了一下,今天大概率没活
回复

使用道具 举报

     
发表于 2026-9-4 08:51 | 显示全部楼层
但是除了 Coding ,Astra 其他跑分都爆表了。现在还用不到,等 rollout 了试试。
回复

使用道具 举报

     
发表于 2026-9-4 08:58 来自手机 | 显示全部楼层
其他跑分都是小巧思,比如arc agi这个就是换个harness的事情,其他垂类领域知识提升都是靠着参数硬堆上去的
回复

使用道具 举报

     
发表于 2026-9-4 09:00 来自手机 | 显示全部楼层
开源模型真的是k3一骑绝尘,但是口袋好痛。

用他家订阅会节约吗?
回复

使用道具 举报

     
发表于 2026-9-4 09:04 | 显示全部楼层
nxmonitor 发表于 2026-9-4 08:58
其他跑分都是小巧思,比如arc agi这个就是换个harness的事情,其他垂类领域知识提升都是靠着参数硬堆上去的 ...

computer use的提升还是实打实的,前端视觉也提升了,毕竟参数相对5.6大了很多,就是太贵了。
回复

使用道具 举报

发表于 2026-9-4 09:06 | 显示全部楼层
AraTurambar 发表于 2026-9-4 09:00
开源模型真的是k3一骑绝尘,但是口袋好痛。

用他家订阅会节约吗?

试用了一次k3,花掉了我小几百块钱,任务完成得也就那样,钱包好疼……

还是回归大肥鱼温暖的怀抱吧
回复

使用道具 举报

     
发表于 2026-9-4 09:09 来自手机 | 显示全部楼层
未知伤亡 发表于 2026-9-4 09:06
试用了一次k3,花掉了我小几百块钱,任务完成得也就那样,钱包好疼……

还是回归大肥鱼温暖的怀抱吧 ...

写代码谁都会,数学我怎样都用fable做,但是k3说话太好听了,各种中日英混合隐喻得心应手和fable差不多。

就是真贵啊。
回复

使用道具 举报

     
发表于 2026-9-4 09:09 来自手机 | 显示全部楼层
K3 也是专武效果最好,好多知识库和付费的接口它是自带的
回复

使用道具 举报

     
发表于 2026-9-4 09:09 | 显示全部楼层
原生得分63%
上harness才推到99%

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-9-4 09:11 | 显示全部楼层
AraTurambar 发表于 2026-9-4 09:09
写代码谁都会,数学我怎样都用fable做,但是k3说话太好听了,各种中日英混合隐喻得心应手和fable差不多。 ...

对的,只有 K3和 fable 用起来是让人感到他是聪明的
回复

使用道具 举报

     
发表于 2026-9-4 09:11 | 显示全部楼层
k3目前是国产模型用得最舒服的,有些方面比gpt-5.6表现好,做ppt更是没有对手,就是慢了点,贵了点。
回复

使用道具 举报

     
发表于 2026-9-4 09:13 | 显示全部楼层
drodchang 发表于 2026-9-4 09:04
computer use的提升还是实打实的,前端视觉也提升了,毕竟参数相对5.6大了很多,就是太贵了。 ...

所谓的conputer use是视觉操作电脑,对于AI来说是个无意义的低效手段,你要是搞具身智能还行……
回复

使用道具 举报

     
发表于 2026-9-4 09:13 来自手机 | 显示全部楼层
drodchang 发表于 2026-9-4 09:11
k3目前是国产模型用得最舒服的,有些方面比gpt-5.6表现好,做ppt更是没有对手,就是慢了点,贵了点。 ...

我用的fireworks api,速度起飞,我都是让他把活都扔给dsv4f做只管总结和规划。
回复

使用道具 举报

     
发表于 2026-9-4 09:17 来自手机 | 显示全部楼层
nxmonitor 发表于 2026-9-4 09:13
所谓的conputer use是视觉操作电脑,对于AI来说是个无意义的低效手段,你要是搞具身智能还行…… ...

所以马斯克给我推销grok bot我理都不理,我买你x premium+只是为了抓你推特流的,谁要你bot。
回复

使用道具 举报

     
发表于 2026-9-4 09:18 | 显示全部楼层
nxmonitor 发表于 2026-9-4 09:13
所谓的conputer use是视觉操作电脑,对于AI来说是个无意义的低效手段,你要是搞具身智能还行…… ...

computer use在日常生活工作中是很有用的,不是每个人都只用大模型来编程。
回复

使用道具 举报

     
发表于 2026-9-4 09:18 | 显示全部楼层
应该codex会有一次大更新吧    Re:Source
回复

使用道具 举报

     
发表于 2026-9-4 09:20 | 显示全部楼层
本帖最后由 舞以 于 2026-9-4 09:21 编辑

不知道我用的订阅k3是不是假的
如果不涉及到他们的官方skill和插件包,问题讨论和意图理解都一般般,没感觉和dsv4pro有跨代差距。
反而coding还可以。
也可能是我问的问题对于llm来说太难了?反正没有哪个模型让我觉得哇好聪明的感觉。
回复

使用道具 举报

     
发表于 2026-9-4 09:20 | 显示全部楼层
drodchang 发表于 2026-9-4 09:18
computer use在日常生活工作中是很有用的,不是每个人都只用大模型来编程。 ...

和马斯克搞视觉方案有区别吗?有雷达不用用可见光,就是这个感觉……
回复

使用道具 举报

     
发表于 2026-9-4 09:22 | 显示全部楼层
nxmonitor 发表于 2026-9-4 09:20
和马斯克搞视觉方案有区别吗?有雷达不用用可见光,就是这个感觉……

有总比没有好,以后会有越来越多的公司加入的。
回复

使用道具 举报

     
发表于 2026-9-4 09:22 来自手机 | 显示全部楼层
舞以 发表于 2026-9-4 09:20
不知道我用的订阅k3是不是假的
如果不涉及到他们的官方skill和插件包,问题讨论和意图理解都一般般,没感觉 ...

那可能就是订阅降智了。

烧api的素质没话说。
回复

使用道具 举报

     
发表于 2026-9-4 09:26 | 显示全部楼层
AraTurambar 发表于 2026-9-4 09:22
那可能就是订阅降智了。

烧api的素质没话说。

我也烧过api,感觉没啥区别吧
可能是我和llm有时候讨论的问题太开放,太难了
反正当前几个模型给我的感觉更像是文风和表达差异
不过我没用过fable,不知道有没有明显差距,反正上一次让我觉得模型明显变聪明还是gpt到5,ds更新到v4那个时候。
后面的更新基本就是针对agent特化了。
回复

使用道具 举报

     
发表于 2026-9-4 09:26 | 显示全部楼层
nxmonitor 发表于 2026-9-4 09:13
所谓的conputer use是视觉操作电脑,对于AI来说是个无意义的低效手段,你要是搞具身智能还行…… ...

computer use 在不少任务都挺有用的,比如让它搞游戏,它会自己试玩自己调试自己改。
回复

使用道具 举报

     
发表于 2026-9-4 09:28 | 显示全部楼层
不过k3相比dsv4pro在物理数学方面有明显的提升,不知道是参数量优势还是后训练做了加强。
回复

使用道具 举报

     
发表于 2026-9-4 09:35 来自手机 | 显示全部楼层
舞以 发表于 2026-9-4 09:28
不过k3相比dsv4pro在物理数学方面有明显的提升,不知道是参数量优势还是后训练做了加强。 ...

Ds搞数学一般都是中期特化一个吧,就像之前的terminus
回复

使用道具 举报

     
发表于 2026-9-4 09:37 | 显示全部楼层
Promeus 发表于 2026-9-4 09:35
Ds搞数学一般都是中期特化一个吧,就像之前的terminus

我看有消息说ds团队算国内模型厂最重视数学的,但是和oa两家比资源还是受限不少。

论坛助手,iPhone
回复

使用道具 举报

     
发表于 2026-9-4 09:38 来自手机 | 显示全部楼层
舞以 发表于 2026-9-4 09:26
我也烧过api,感觉没啥区别吧
可能是我和llm有时候讨论的问题太开放,太难了
反正当前几个模型给我的感觉 ...

我的hermes SOUL.md用本雅明的写法(拆字法文字游戏,数字段落,天使和灵光这些关键词)但其实写的是科耶夫加沃格林,只有k3 get到了。

D4p哪怕我挑明了请他分析一下都没看懂我在说什么,在那里本雅明hhh
回复

使用道具 举报

     
发表于 2026-9-4 09:40 | 显示全部楼层
AraTurambar 发表于 2026-9-4 09:38
我的hermes SOUL.md用本雅明的写法(拆字法文字游戏,数字段落,天使和灵光这些关键词)但其实写的是科耶 ...

那就是场景差异了吧,我一般做的是文史问题的讨论,几个模型的回答都大差不差,k3和v4pro的回答更符合中文习惯,gpt看起来更充实,但是也就一个水平,还不说人话。
回复

使用道具 举报

     
发表于 2026-9-4 09:43 来自手机 | 显示全部楼层
startraveller 发表于 2026-9-4 09:26
computer use 在不少任务都挺有用的,比如让它搞游戏,它会自己试玩自己调试自己改。 ...

flash模型搞这个还有点意思,旗舰模型没人舍得用那么贵的token来进行电脑日常操作吧
回复

使用道具 举报

     
发表于 2026-9-4 09:43 | 显示全部楼层
k3 特别是复杂系统设计、大项目规划方面确实目前还是国产最强。不过 glm ds 在执行 scope 明确的任务的时候体验会反超 k3。
回复

使用道具 举报

     
发表于 2026-9-4 09:45 | 显示全部楼层
qwased 发表于 2026-9-4 09:43
flash模型搞这个还有点意思,旗舰模型没人舍得用那么贵的token来进行电脑日常操作吧 ...

订阅的话 GPT 的 token 单价很低的,消耗还好
回复

使用道具 举报

     
发表于 2026-9-4 09:48 来自手机 | 显示全部楼层
舞以 发表于 2026-9-4 09:37
我看有消息说ds团队算国内模型厂最重视数学的,但是和oa两家比资源还是受限不少。

论坛助手,iPhone ...

会特意做数学模型就足以说明重视了,另外我说错了不是terminus是Speciale
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-9-23 12:30 , Processed in 0.153686 second(s), 6 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表