绕指流光 发表于 2026-3-1 16:42

OPENAI数学氢弹雨来袭 | 大模型讨论专楼

本帖最后由 绕指流光 于 2026-10-8 08:29 编辑

本帖已不再局限 DeepSeek 相关,大模型新闻和应用心得等均可自由分享讨论,主楼用于不定时更新模型上线新闻
1001-1007
放假没有及时更新,最新新闻是OPENAI数学氢弹雨洗地,公布了722篇数学论文,还只是第一批
https://openai.com/math/
https://github.com/openai/math



0929 Sonnet 5.5发布
https://oscimg.oschina.net/oscnet/up-f813ac9a76c6bd19476c2e9801784340e9e.png!/format/webp

0924 DSH桌面端发布
DeepSeek Harness
现在,开箱即用

0910
躺平躲爬期间爆炸消息太多,捡着最近的发了
DeepSeek V4.1 Flash:更强、更快、更普惠




0904
astra 已发布,爆炸炸炸炸,眩晕晕晕晕
https://n.sinaimg.cn/spider20260904/514/w745h569/20260904/7a2f-f43633c375cfa8279223fd360d7f7c6b.png

0903
gemini 3.8 flash发布。体感哈基米还是哈基米

https://picx.zhimg.com/80/v2-d77b8e9b5bbc17f9dfec444e02d74f4b_1440w.webp?source=1def8aca


0902
Claude Fable 5.1、Mythos 5.1发布,后者被锁在白名单内,专供受审核的网安与生命科学团队调遣。
A/自己的榜捧的可以说很高了
https://img.36krcdn.com/hsossms/20260902/v2_73020cfcc3744be0b32bdc6a3fc39e35@000000_oswg158629oswg1080oswg781_img_000?x-oss-process=image/format,jpg/interlace,1


0827
牛来大模型(OX ALPHA)已被智谱认领为GLM-5.3-Flash
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能:
[*]极致高效的混合架构GLM-5.3-Flash 总参数量 320B、激活参数量 18B,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。在保持精准长上下文能力的同时,显著降低计算与服务成本。相比 GLM-5.3,其注意力计算量和 KV 缓存大小分别降低 3.01 倍和 4.44 倍。
[*]原生多模态的视觉 Coding视觉能力被原生融入 Coding 循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。无论是前端开发、游戏构建、Blender 3D 场景,还是 BUA、CUA 驱动的真实环境操作,模型都能在代码、浏览器和图形界面之间协同完成任务。
[*]超越 Coding 的专业工作伙伴GLM-5.3-Flash 进一步拓展至 Office、金融研究和专业文档等工作场景。它能够自主拆解复杂目标、调用合适工具、检查并优化输出,完成从研究分析、模型构建到 PPTX、PDF、DOCX、XLSX 成品交付的完整工作流。



0821
V4-Flash-Vision-Exp 上线,开启多模态 API 服务今天,全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,这是一个实验性质的模型,用户可以通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型。
平衡文本与多模态能力https://api-docs.deepseek.com/zh-cn/img/v4_260821_benchmark_cn.png*对于公开基准测试集中的 Code Agent 文本任务,DeepSeek 系列模型使用 DeepSeek Harness 极简模式作为框架进行测试,使用 max 档位,temperature=1.0,topp=0.95;
**在 ApexBench 与 Agents' Last Exam 测评中,文本模型 DeepSeek-V4-Flash 会忽略其中的多模态元素。

[*]在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;
[*]在需要视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。






0813
DeepSeek harness 公测上线,好评体验中

0812-0813

DeepSeek v4 pro GA 和 Grok 4.6 几乎同时发布,但 harness 并没有一起跟着来







0731
DeepSeek-V4-Flash 正式版 API 已上线公测,Agent 能力大幅增强;V4-Pro 暂未变动。

Responses API 目前仅支持 deepseek-v4-flash 模型,暂不支持 deepseek-v4-pro 模型。我们将于 2026 年 8 月初增加对 deepseek-v4-pro 模型的支持。


----------

最近正式版灰度测试的热度又上来了,特地把从 3 月开始的本帖更新一下标题

-----------
0301 时点的舅舅新闻

总算有个相对不路边的媒体舅舅了,下周的意思就是躲得过初一躲不过十五?反正要在两会开幕之前

https://p.sda1.dev/31/1a72e6dad69811903c8cac2585418872/image.jpg







tonyunreal 发表于 2026-3-1 16:48

能“生成”图片和视频的多模态模型


—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99

Evelynn 发表于 2026-3-1 16:51

本帖最后由 Evelynn 于 2026-3-1 16:56 编辑

为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经爆表了。
大公司可以用来做影视剧的特效,用极低的成本做出堪比好莱坞大片的效果;自媒体用来生成各种特效短片,配合tiktok,字节在注意力争夺战已经领先太多了。
甚至可预见的未来,大部分人们可能都不会去看电影、电视剧了,我要是好莱坞公司的老总,晚上都睡不着了。









26458 发表于 2026-3-1 16:55

楼上是说有了一个闭源的领头羊,接下来全部开源的模型都不用关注了?

十点半 发表于 2026-3-1 16:56

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...
毕竟财经媒体,可能ds是对股票市场影响力比较大吧,都知道梁文锋主业是啥,发布时基本不可能不整活

发呆的龙虾 发表于 2026-3-1 16:56

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...

应用环境又不一样。

—— 来自 HUAWEI BRA-AL00, Android 12, 鹅球 v3.5.99

Indolencoma 发表于 2026-3-1 17:00

本帖最后由 Indolencoma 于 2026-3-1 17:01 编辑

这新闻为什么看着就没那么真。

我的感觉是,DeepSeek从一开始就不像是一个单纯为了做AI而做AI的公司,从来没感觉出DS对图片生成和视频生成有多强的动力,大概炒股、做量化用不到这些

Zurlg 发表于 2026-3-1 17:00

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...

搞代码不知道,我平时是写文和搞点刘备,DS真是便宜又好用啊,sd2也用了一下,小贵就算了限制实在太多了,我想搞个李元霸大战安格隆,都说我不符合平台规则
国外的那几个限制倒是不多,但是贵是真贵,一个月就要好几百,我DS充50块能用很久

linuslinus 发表于 2026-3-1 17:05

deepseek开源,大家都能用

买码!注册! 发表于 2026-3-1 17:06

大部分人关注Seedance,仅仅是因为他们看得懂Seedance的成品

01一14 发表于 2026-3-1 17:24

绕指流光 发表于 2026-3-1 16:42
总算有个相对不路边的媒体舅舅了,下周的意思就是躲得过初一躲不过十五?反正要在两会开幕之前

...

希望有深度研究

脸宽 发表于 2026-3-1 17:29

希望是明天

—— 来自 鹅球 v3.3.96

2017.05.04 发表于 2026-3-1 17:30

每周发一次这种新闻就是操盘方的应对措施?

真红之闪电 发表于 2026-3-1 17:34

sd只是某种程度上做了点导演和摄像的工作,但是完全谈不上剪辑啊…看片总不能不看情绪吧?不是镜头组接就是电影的…

—— 来自 S1Fun

木谷高明 发表于 2026-3-1 17:36

ds母公司幻方量化,2025年私募收益率56%,管理700亿赚了400亿,所有财经媒体报这个

洛拉斯 发表于 2026-3-1 17:40

木谷高明 发表于 2026-3-1 17:36
ds母公司幻方量化,2025年私募收益率56%,管理700亿赚了400亿,所有财经媒体报这个 ...

这钱是做空美股赚的吗?

云卷花开 发表于 2026-3-1 17:44

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...

能力的基础其实还是看 llm 的科研,而 ds 团队作为国内甚至是国际上搞科研的顶尖团队,关注它不为过的

—— 来自 OnePlus PJD110, Android 16, 鹅球 v3.5.99

valigarmanda 发表于 2026-3-1 17:44

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...

因为这几家ai公司只有deepseek是一直发论文的,相当于开源了。而且ds的api定价简直就是免费送,一点也不像是要赚钱的样子

Azcarlo 发表于 2026-3-1 17:48

"with picture, video and text-generating functions", 这记者写错了吧,DS不可能做生图/视频的,视频/图输入的多模态倒是有可能。
感觉现在很多人对deepseek有过高的期望,deepseek其实应该算是前沿实验室,和微软的亚洲研究院定位挺像的,都是大公司下面的研究机构。新模型能力有提升当然最好,就怕没想象中秒天秒地有的人会开始自贬一转咩鳖。

Humpy 发表于 2026-3-1 17:49

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...
开源的好处就是真的有生产力需求的人可以根据需求自行配置,具有稳定性,甚至可以受DEEPSEEK发的论文中的思路启发进行自行魔改优化。
SEEDDANCE2现在使用者暴增加上版权方限制的情况下已经没有最开始那么“聪明”、“快捷”了,目前娱乐为主倒没什么,但如果想要稳定生产什么东西可能大家还是更希望有相似性能但表现更稳定的事物出现。

sellboy 发表于 2026-3-1 17:53

Azcarlo 发表于 2026-3-1 17:48
"with picture, video and text-generating functions", 这记者写错了吧,DS不可能做生图/视频的,视频/图 ...

deepseek ocr的论文里提到一嘴
可能可以用于反向生成。

バーチャルS1er 发表于 2026-3-1 17:53

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...

sora2出来三个月后就没太多人玩了,seedance没降智前就是加强版sora2,现在卡版权、卡真人、卡排队、卡审核

ycjiang1337 发表于 2026-3-1 18:02

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...

Agent的商用潜力根本不是AIGC能碰瓷的

—— 来自 HUAWEI SGT-AL50, Android 12, 鹅球 v3.4.97-alpha

小农经济 发表于 2026-3-1 18:10

木谷高明 发表于 2026-3-1 17:36
ds母公司幻方量化,2025年私募收益率56%,管理700亿赚了400亿,所有财经媒体报这个 ...

岂不是有能力的人控制股票,和**一样牛x

sellboy 发表于 2026-3-1 18:21

ycjiang1337 发表于 2026-3-1 18:02
Agent的商用潜力根本不是AIGC能碰瓷的

—— 来自 HUAWEI SGT-AL50, Android 12, 鹅球 v3.4.97-alpha ...

不冲突的,字节的Seed2.0就是一个Agent向的模型。
我现在在想,字节是不是已经有一个“seed2.0模型作为agent,先调用其他自己生成剧本,再调用seedream5.0生成人设图、分镜稿,再调用seedance2.0生成短视频,再自己筛选剪辑完成长篇AI视频”的完整方案了。

overflowal 发表于 2026-3-1 18:55

只要你每周猜一次,总能猜中的

—— 来自 鹅球 v3.4.97

weiduopla 发表于 2026-3-1 19:04

Humpy 发表于 2026-3-1 17:49
开源的好处就是真的有生产力需求的人可以根据需求自行配置,具有稳定性,甚至可以受DEEPSEEK发的论文中的 ...

确实,近期降智太多+排队严重,我的视频计划干脆卡那了。

羊寢 发表于 2026-3-1 19:08

本帖最后由 羊寢 于 2026-3-1 20:14 编辑

脸宽 发表于 2026-3-1 17:29
希望是明天

—— 来自 鹅球 v3.3.96

不是明天就是周四,按去年的发布规矩来说是这样

去类脑看了一眼,应该还是烂炒,不过最近也确实应该要更新了

overflowal 发表于 2026-3-1 19:09

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...

你知不知道seedance也是个大语言模型

—— 来自 鹅球 v3.4.97

villsian 发表于 2026-3-1 19:11

DeepSeek 的Api便宜稳定,本身能力也很强。接下来都传是1M上下文,毕竟网页端已经上线1M上下文了。再加上多模态的传言属实,国产最强,甚至世界最强啊。。。
国内应该没有1M上下文的。国外似乎也只有Gemini能达到1M,Claude的大上下文似乎也不是给普通人用的。
而且DeepSeek还是开源的,你做个产品敢把自己核心的技术开源吗?
绝对的国产之光。

超级大基魔 发表于 2026-3-1 19:18

D指导某方面真的强

竟日孤鸣 发表于 2026-3-1 19:35

脸宽 发表于 2026-3-1 17:29
希望是明天

—— 来自 鹅球 v3.3.96

阿妹你看,this is your future!
https://p.sda1.dev/31/72d92bca0db75be38c7940c8fd4a3d0c/image.jpg

精钢魔像 发表于 2026-3-1 19:52

villsian 发表于 2026-3-1 19:11
DeepSeek 的Api便宜稳定,本身能力也很强。接下来都传是1M上下文,毕竟网页端已经上线1M上下文了。再加上多 ...

1兆上下文非常利好ai游戏崇祯模拟器。

leafS 发表于 2026-3-1 20:01

Evelynn 发表于 2026-3-1 16:51
为什么都那么关注deepseek?感觉这些大语言模型在商用潜力上被seedance2完爆,那个太恐怖了,商业价值已经 ...

垄断公司就喜欢你这种用户了

—— 来自 鹅球 v3.3.96-alpha

a4ac7 发表于 2026-3-1 20:03

https://p.sda1.dev/31/63027316c3bc89abaea327cbf6678308/image.jpg

啊?

—— 来自 HUAWEI PLA-AL10, Android 12, 鹅球 v3.5.99

overflowal 发表于 2026-3-1 20:28

a4ac7 发表于 2026-3-1 20:03
啊?

—— 来自 HUAWEI PLA-AL10, Android 12, 鹅球 v3.5.99

弱智标题党少看

—— 来自 鹅球 v3.4.97

med 发表于 2026-3-1 20:36

最近seedance2出问题,AI智障小短片都变少了

蜇灵 发表于 2026-3-1 20:37

villsian 发表于 2026-3-1 19:11
DeepSeek 的Api便宜稳定,本身能力也很强。接下来都传是1M上下文,毕竟网页端已经上线1M上下文了。再加上多 ...

qwen3.5是1M上下文

drodchang 发表于 2026-3-1 20:45

DS最大的贡献其实是提升了国内ai整体水平,可以看到最近kimi,minimax,智谱,豆包的水平都突飞猛进了。

verniy 发表于 2026-3-1 20:55

生图不指望,原生多模态来识别图还是很期待的
页: [1] 2 3 4 5 6 7 8 9 10
查看完整版本: OPENAI数学氢弹雨来袭 | 大模型讨论专楼