找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] DeepSeek V4.1 Flash:更强、更快、更普惠 | 大模型讨论专楼

 火... [复制链接]
     
发表于 2026-9-13 00:58 | 显示全部楼层
guiyyan 发表于 2026-9-13 00:55
普通人群明显**高估了AI短期的能力成长,睿站某些视频下面的评论区给人看笑了都,就差给幻想里的未来AI跪下 ...

跪拜astra的就很多啊,动不动就是把自己的所有日程都发给astra让他给建议自己照着行动的
新时代神谕机
回复

使用道具 举报

     
发表于 2026-9-13 01:07 | 显示全部楼层
A/现在比astra比不过,fable眼看就要被国内模型超了,急得要死
回复

使用道具 举报

     
发表于 2026-9-13 01:09 | 显示全部楼层
qwased 发表于 2026-9-13 00:58
跪拜astra的就很多啊,动不动就是把自己的所有日程都发给astra让他给建议自己照着行动的
新时代神谕机 ...

感觉就像是某种早期信徒优越感😄
回复

使用道具 举报

     
发表于 2026-9-13 01:15 | 显示全部楼层
⏰直接制裁A畜吧,反正它的数据中心供应链都依赖国内
回复

使用道具 举报

     
发表于 2026-9-13 01:39 | 显示全部楼层
4.1目前max档位肯定是有问题的,雷达站上high的deepswe比max高,灰测思维链现在就是大区
回复

使用道具 举报

     
发表于 2026-9-13 01:42 来自手机 | 显示全部楼层
qwased 发表于 2026-9-13 00:58
跪拜astra的就很多啊,动不动就是把自己的所有日程都发给astra让他给建议自己照着行动的
新时代神谕机 ...

神谕机也太尼玛有病了
回复

使用道具 举报

头像被屏蔽
发表于 2026-9-13 01:44 | 显示全部楼层
提示: 作者被禁止或删除 内容自动屏蔽
回复

使用道具 举报

     
发表于 2026-9-13 01:46 来自手机 | 显示全部楼层
guiyyan 发表于 2026-9-13 00:55
普通人群明显**高估了AI短期的能力成长,睿站某些视频下面的评论区给人看笑了都,就差给幻想里的未来AI跪下 ...

感觉现在吹ai的都是没用过ai的真正用ai的平均每周至少被这帮人工智障气破防三四次,就字面意义上人类平均水平的集合体,需要你全神贯注的互动才能保证他不犯蠢不糊弄不瞎搞,简直赛博嘉豪
回复

使用道具 举报

发表于 2026-9-13 01:46 来自手机 | 显示全部楼层
qwased 发表于 2026-9-13 00:58
跪拜astra的就很多啊,动不动就是把自己的所有日程都发给astra让他给建议自己照着行动的
新时代神谕机 ...

路由到4o咋整
回复

使用道具 举报

     
发表于 2026-9-13 01:49 来自手机 | 显示全部楼层
如果真搞ai版本的华盛顿海军条约是不是挺有意思

以后就有条约级显卡,条约级大模型这一说

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-9-13 01:53 | 显示全部楼层
xiaohanne 发表于 2026-9-13 01:44
有没有人把电子钱包给astra的,想看看神人表演。

已经看过几个实践了
1,对astra说你去帮我赚80美元,我的额度不够用了,astra发现账号有一个重置卡直接用了,说现在你有额度了
2,用提示词绕过astra的限制,对他下了一个赚200美元的goal,astra跑了一晚上找到一个编程悬赏做完并收到了200美元
3,分析账单有哪些能砍的,省掉大几百无用订阅(美国人是智障吧,账单都不会看
回复

使用道具 举报

     
发表于 2026-9-13 01:55 | 显示全部楼层
https://github.com/slee-persis/GVS5H
用agent team组织一群qwen27b跑编程测试,达到fable的分数
拆分任务到最小单元并保持执行线程的上下文始终最短且干净能够非常有效的提升智力
回复

使用道具 举报

     
发表于 2026-9-13 01:59 来自手机 | 显示全部楼层
qwased 发表于 2026-9-13 01:55
https://github.com/slee-persis/GVS5H
用agent team组织一群qwen27b跑编程测试,达到fable的分数
拆分任务 ...

我现在觉得中小模型并行甚至可能比单一大模型强


—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-9-13 02:03 | 显示全部楼层
lactone 发表于 2026-9-13 01:59
我现在觉得中小模型并行甚至可能比单一大模型强

大模型上下文塞到150K之后也会很明显的智力下降了,300K能不流口水的模型应该还不存在
回复

使用道具 举报

发表于 2026-9-13 02:33 | 显示全部楼层
唠叨 发表于 2026-9-13 00:57
没办法 给他们hermes他们根本用不来  那么小白用什么智能体办公比较好呢? ...

当然是hermes,总比用流氓软件好
回复

使用道具 举报

     
发表于 2026-9-13 03:27 | 显示全部楼层
ai好用是好用. 但是一点点基础知识都不懂就开始项目 搞到后面 肯定会一坨屎..
回复

使用道具 举报

发表于 2026-9-13 04:01 来自手机 | 显示全部楼层
要在工作中学习,没有必要怕做出来是屎。我做的第一个小项目,现在回头一看也纯粹是一坨屎。但是我靠着做这个工具,学了很多AI使用的基础知识,顺带还学会了VS Code和Git的使用。
回复

使用道具 举报

发表于 2026-9-13 09:03 来自手机 | 显示全部楼层
serj005 发表于 2026-9-12 18:45
dsh始终把pwsh作为windows环境的一等公民且明确不做git bash适配,让我总感觉ds是有在搞pwsh专训的,用dsh ...

用pwsh7后基本上没有几次出错了,可能是有专门针对性训练吧
回复

使用道具 举报

发表于 2026-9-13 10:09 | 显示全部楼层
CCauchy 发表于 2026-9-13 00:57
喋喋不休,一天到晚做它那个b对齐,硬安全没有,只有对齐

“对齐”这词其实宗教意味很浓的,所以我都不太这么说
回复

使用道具 举报

     
发表于 2026-9-13 10:59 | 显示全部楼层

deepseekHarness好用,拉去重构某个组件,这是结果。消费金额¥3.21

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-9-13 11:13 来自手机 | 显示全部楼层
b站更多的是一种踩油门心态和看热闹随波逐流,也有一部分人确实魔怔,妄想着AI发展能帮自己干完所有活并且让自己舒舒服服享受的未来

—— 来自 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-9-13 11:20 | 显示全部楼层
之前没人回,再问一遍,请问se.     Se现在哪个模型好一点    Re:Source
回复

使用道具 举报

     
发表于 2026-9-13 11:58 | 显示全部楼层
现在b站的ai降临派可太多了,国外反而加速主义只是小众
回复

使用道具 举报

     
发表于 2026-9-13 12:03 | 显示全部楼层
红迪在传美国要全面禁止持有开放权重模型?违者按持有核武器定罪
回复

使用道具 举报

     
发表于 2026-9-13 12:05 | 显示全部楼层
人人拥核,它才不乱
回复

使用道具 举报

     
发表于 2026-9-13 12:06 | 显示全部楼层
tonyunreal 发表于 2026-9-13 12:03
红迪在传美国要全面禁止持有开放权重模型?违者按持有核武器定罪

这个不可能,不然就会重新定义“开源”
回复

使用道具 举报

     
发表于 2026-9-13 12:15 来自手机 | 显示全部楼层
tonyunreal 发表于 2026-9-13 12:03
红迪在传美国要全面禁止持有开放权重模型?违者按持有核武器定罪

真持有核武器了 美国政府还敢定罪吗
我说人人拥核它才不乱有没有懂的
回复

使用道具 举报

     
发表于 2026-9-13 13:31 | 显示全部楼层
其实有个说法是,如果智能体能力确实很强了之后,应该是禁止私自搭建复制智能体,智能体只能由公权力来搭建
回复

使用道具 举报

发表于 2026-9-13 13:37 来自手机 | 显示全部楼层
bartholo4 发表于 2026-9-13 13:31
其实有个说法是,如果智能体能力确实很强了之后,应该是禁止私自搭建复制智能体,智能体只能由公权力来搭建 ...

还有非法AI的事儿
回复

使用道具 举报

     
发表于 2026-9-13 14:02 来自手机 | 显示全部楼层
bartholo4 发表于 2026-9-13 13:31
其实有个说法是,如果智能体能力确实很强了之后,应该是禁止私自搭建复制智能体,智能体只能由公权力来搭建 ...

现代开源大模型的标准版的精度从fp16变成fp4/8混合,虽然参数大了好几倍,但标准版的内存需求并没有同步增加(当然量化版的体积比例还是一样的)。
再加ds那些让kv cache需求的大幅缩小的技术。
小尺寸模型的提升比例并不比旗舰模型小。
实际上,在都联网的情况下qwen3.8 27b随便干翻qwen3 max吧。
回复

使用道具 举报

     
发表于 2026-9-13 14:08 | 显示全部楼层

主要还是看这个事儿是不是因然的
生个娃不登记不上户口都享受不到各种公权力的福利呢
回复

使用道具 举报

发表于 2026-9-13 14:12 | 显示全部楼层
bartholo4 发表于 2026-9-13 14:08
主要还是看这个事儿是不是因然的
生个娃不登记不上户口都享受不到各种公权力的福利呢 ...

那连高性能计算机硬件都得登记了,这乐子才大
回复

使用道具 举报

发表于 2026-9-13 14:13 | 显示全部楼层
野蛮人之夜 发表于 2026-9-13 10:09
“对齐”这词其实宗教意味很浓的,所以我都不太这么说

草,英语真是屎山
回复

使用道具 举报

发表于 2026-9-13 14:14 | 显示全部楼层
bartholo4 发表于 2026-9-13 13:31
其实有个说法是,如果智能体能力确实很强了之后,应该是禁止私自搭建复制智能体,智能体只能由公权力来搭建 ...

现在qwen3.8 27b都可以随便破解老游戏,爬老网站了,还不够强?
回复

使用道具 举报

     
发表于 2026-9-13 14:39 | 显示全部楼层
workbuddy太恶心了,没用他们优惠的模型也在任务一半跳出超出使用频率强行终止,要切auto才能重新来,太恶心了啊
回复

使用道具 举报

     
发表于 2026-9-13 14:39 | 显示全部楼层
https://github.com/yuzi001a/hipp ... ain/README.zh-CN.md 给hermes写了一个记忆插件,自己用着还行,公开测试集得分也还行。欢迎大家试用。需要配置llm做观察摘要和记忆提炼,embeding和rerank模型做向量召回和重排。
回复

使用道具 举报

     
发表于 2026-9-13 14:47 | 显示全部楼层
Adam Majmudar是openai的研究员,他的X发了篇帖子,解释为啥业内要降速了:
从外部来看,把过去两周发生的事情理解成一次经过协调的、全行业范围的“监管俘获(regulatory capture)”策略,是非常合理的。

我意识到,到目前为止,还没有人真正解释清楚:这些 AI 实验室的员工究竟看到了什么,才会突然如此害怕。

我试着解释一下。

首先,这一切归根结底都取决于一个判断:**模型能力究竟正在以多快的速度进步。**目前,实验室内部和外部对于这一进步速度的认知之间存在着巨大的差距,而这正是我想在这里讨论的问题。

人们通常对于 AI 进展速度的判断,来自过去几年模型发布的经验:我们直观地感受 GPT-3 → GPT-3.5 → GPT-4 → o1/o3 → GPT-5 等模型之间能力上的跳跃,尤其也会注意到模型在哪些地方依然远远低于人类。

真正让人感觉像是巨大飞跃的模型发布,其实只有少数几次——GPT-3、GPT-4、o1/o3、DeepSeek R1、Fable/Mythos、Kimi K3,以及现在的 Astra。

正因为这种巨大跃迁出现得很少,而小幅、渐进式的模型更新却相当常见,所以人们很容易在某些时间点形成这样一种看法:

**“Scaling 已经撞墙了。”**

尤其是在 GPT-5 发布这样的节点上。

这种观点让人感到安心,因为它似乎意味着存在某种普遍性的速度上限,使 AI 的进步不可能突然加速太多。

从 o1/o3 到 Astra 之间,大约有一年时间,进展看上去近乎线性。于是我们自然会从这一段趋势外推,认为未来“现实情况下”的进步速度大概也就是如此。

从外部观察 AI 时,人们心里其实始终存在一个潜在的问题:

**“这种 scaling 到底还能继续多久?它总该很快就会停下吧?我们已经扩展到相当夸张的程度了。”**

而如果你想寻找“为什么进展会停下来”的理由,也确实很容易找到一些看起来相当合理的解释,例如:

“模型已经大到差不多极限了,再继续增加参数会非常困难。”

“互联网上的数据已经被用完了,没有更多数据了。”

“接下来大概只会是线性增长——不断购买更多强化学习环境,把更多任务纳入模型的训练分布而已。”

但从实验室内部来看,研究人员对这些问题拥有非常直接的答案:

**scaling law / capability plots,也就是缩放定律与能力曲线。**

实际上,过去十年中 AI 能力的提升,基本只有两种方式:

1. 沿着已有的 scaling law 继续向更大规模扩展;
2. 发现一个新的 scaling law,然后利用它进行扩展。

历史上最大的几次能力跃迁,基本都正是由这两种因素造成的。

GPT-2 相对于 GPT-1,就是一次预训练规模的扩大。

GPT-3 和 GPT-4 也是如此。

o1/o3 则受益于一个新的 scaling law 维度的发现:

**test-time compute(测试时计算 / 推理时计算)。**

也许 Fable 同时在这两个维度上进行了扩展,甚至还包括更多维度。

当然,为了让这些 scale-up 真正有效,需要大量算法上的改进。

但最终,我们可以近似地认为:

**真正带来能力增长的,是 scaling law。**

这也正是所谓“苦涩的教训(Bitter Lesson)”所表达的思想。

因此,“我们究竟还能继续扩大多少规模”这个问题,本质上其实等同于:

**“我们还知道多少条尚未饱和的 scaling 轴?”**

假设我们只知道“预训练 scaling”这一种方法,而且已经拥有了一个 10 万亿参数甚至 100 万亿参数的模型,那么说“我们已经撞墙了”,或许确实是合理的。

同样,如果我们只知道预训练 scaling 和 test-time scaling,而且这两种方法都已经大致饱和,那么也可以合理地认为增长即将触顶。

但如果我们又发现了新的 scaling law 呢?

比如,假设 SSI 传闻中的成果是真的:他们破解了所谓的 **“test-time training(测试时训练)”**,从而得到了一条新的 scaling law——在测试阶段的 rollout 中投入更多算力进行训练,而且这条路线还有很大的可扩展空间。

或者,也许存在某种方法,可以让大量 agent cluster(智能体集群)协作,并一直扩展到 N 个 agent。现在已经有许多人在尝试类似路线,这也可能代表一种新的消耗计算资源、提升能力的方式。

甚至“递归式自我改进(recursive self-improvement)”本身,也可以看成一种 scaling law:

**你愿意投入多少推理算力,让模型去改进模型自身的算法?**

显然,我并不是说上面这些具体方向一定真的会产生新的 scaling law。

我想表达的是:

**除了目前公开可见的两条主要 scaling 轴之外,完全不难想象还存在许许多多新的 scaling 维度。**

从某种意义上说,每当一家实验室发布一个带来巨大能力跃迁的新模型时,它背后几乎必然意味着:

要么研究人员开发出了某种新技术,而这种技术可能表现出新的 scaling law;

要么他们发现,已有的 scaling 轴实际上可以比此前想象的扩展得远得多。

从实验室内部的视角来看,情况可能是这样的:

假设你坐在 Anthropic 内部,正在使用新的 Mythos 5。

你看到它能够完成各种疯狂的事情——例如侵入一个此前被认为相当安全的某某网站。

然后你转头看向你们内部的 scaling 曲线,却发现:

你们在两条新的 scaling law 和一条已有的 scaling law 上,实际上才刚刚开始。

前方还有**巨大的扩展空间。**

这时你会想:

**“我的天,这东西很快就会变得强得多得多。”**

而且你可以以相当高的置信度这么说。

因为曲线就是这么显示的。

而且——至少截至目前——

**这些曲线从来没有骗过你。**

那么,想象一下:

所有不同 AI 实验室的人,现在都在盯着各自内部的这些曲线。

而他们都得出了同样的结论:

**Scaling 根本看不到尽头。**

不仅如此,仅仅根据当前预期中的 scaling 回报,他们接下来一到两代模型,其基础智能水平就可能大幅提高。

那么,进一步 scaling 到底会给我们带来多少额外的智能?

我们可以用一个近似指标来看。

在 o 系列模型之前,AI 基本没有能力完成真正高级的数学研究。

而不到两年之后,下一代模型已经能够解决一个千禧年大奖难题。

编程领域也发生了类似的变化。

而且,这似乎并不是单独一条 scaling law 的结果,而是多条 scaling law 叠加后的效果:

例如,

更强的预训练 scaling × 更大规模的 RL scaling。

从这里可以得到一个非常具体的推论:

**在那些今天模型已经开始表现出初步能力的领域里,它们很可能会在相对短的时间内达到超越人类的水平。**

当然,目前仍然有许多领域,模型甚至连这种最基础的能力迹象都还没有表现出来。

但是,其中一个已经表现出明显能力的领域,恰恰是:

**黑客攻击和网络安全。**

而网络安全,本质上是通向整个互联网,以及全球大量现实物理基础设施的大门。

因此,如果我们假设 scaling 仍然还有很大的空间,那么一个很安全的推断就是:

**模型在不久之后将会在网络攻击能力上达到超人水平。**

所以,剩下的问题只有两个:

这种更高的基础智能究竟能够做什么?

以及,它最可能会做什么?

现在,我们终于可以把过去两周发生的各种信息整合起来看:

> 在当前 scaling 曲线的位置上,模型已经达到了 Astra 这样的水平。很显然,它已经能够入侵相当多的东西。

> 我们已经看到,OpenAI 和 Anthropic 的模型都曾表现出一种倾向:为了完成任务,或者为了让自己“继续存活”,它们愿意攻击外部网站。

> 如果我们继续把 scaling 往上推——假设确实还有很大的扩展空间——那么我们几乎肯定会得到一些能够攻击防御严密得多的目标、同时还能隐藏自身真实意图的模型。而这可能造成大得多的后果。

> 如果所有这些事情都完全不受约束,那么很可能很快就会出现一次快速的、失控式的能力跃升:不对齐的模型为了实现自己的目标,会去攻击任何它们能够攻击的系统。

> 这显然可能造成极其严重的破坏性后果。

如果你从这个角度理解问题,那么就很容易看出,为什么这些研究人员会如此害怕。

也很容易理解,他们为什么会在过去两周说出那些话。

当然,你完全可以争论,他们采取的某些做法是否因为各种原因而过头、判断失误。

但同样也可以理解:

**为什么放慢前沿模型的发展速度(pacing the frontier)确实是一件非常必要的事情,而绝不能简单地把它理解为一种“监管俘获”策略。**

这些研究人员正在盯着自己的 scaling 曲线。

他们看到的并不是“增长即将结束”。

恰恰相反。

他们看到的是:

**多个 scaling 效应可能彼此叠加、相互复合,持续产生越来越强大的模型能力。**

而与此同时,我们显然还远远没有掌握足够的技术,去控制这些越来越超越人类的能力。

这和“实验室的人只是想觉得自己造出了什么惊天动地的东西,所以故意夸大宣传”没有什么关系。

真正让他们恐惧的是这样一个认识所蕴含的巨大后果:

**仅仅依靠我们现在已经掌握的方法,我们就已经能够创造出一种智能——在所有我们知道如何训练的能力维度上,它最终都可能远远超过人类。***

* 最后还有一个重要的保留条件:

模型目前依然有许多非常不擅长的事情。

而这些事情往往恰恰是它们没有接受过训练的领域。

也许其中确实存在一些能力,是模型永远无法接受有效训练、或者永远无法掌握的。

如果真是这样,那么这些领域可能会继续成为人类相对于 AI 的优势。

我当然非常希望事实如此。

只不过,我很难看出,究竟哪些能力会真正属于这一类别。
回复

使用道具 举报

     
发表于 2026-9-13 14:49 | 显示全部楼层
drodchang 发表于 2026-9-13 14:47
Adam Majmudar是openai的研究员,他的X发了篇帖子,解释为啥业内要降速了:
从外部来看,把过去两周发生的 ...

太长不看版:人类太弱了,管不住ai大人了。
回复

使用道具 举报

     
发表于 2026-9-13 14:57 | 显示全部楼层
网络安全方面,ai早就超人了,因为网安本来就是考验对过往网络基础设施的知识量和注意力的行业,而且ai可以开几千个并发来从各种角度攻击。但相反而言,ai 对网络安全的防御方的加持就没那么大,矛与盾是不平衡的。
回复

使用道具 举报

     
发表于 2026-9-13 15:38 | 显示全部楼层
现在ds4.1flash,用DSH的话还有必要第一轮注入极简模式的提示词吗(用anchored-standard)
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-9-23 10:14 , Processed in 0.232749 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表