找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] OPENAI数学氢弹雨来袭 | 大模型讨论专楼

 火... [复制链接]
     
发表于 2026-9-23 16:27 | 显示全部楼层
moekyo 发表于 2026-9-23 16:21
luna 默认不是用 max 的吗,而且现在 6-luna 会起 subagent 了,之前我是没看到过的 ...

max有雷霆大思考,时间消耗极其长
回复

使用道具 举报

头像被屏蔽
发表于 2026-9-23 16:43 | 显示全部楼层
提示: 作者被禁止或删除 内容自动屏蔽
回复

使用道具 举报

     
发表于 2026-9-23 16:47 | 显示全部楼层
A/的问题是太依赖toB用户了,toC基本啥都不是,以后收入增长很难了。
回复

使用道具 举报

     
发表于 2026-9-23 16:50 | 显示全部楼层
唠叨 发表于 2026-9-23 15:49
比起deepseek我更期待qwen,代码能力4.1对我完全够用了,现在需要的是干活说人话的模型,比如qwen3.8f ...




人话在哪

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-9-23 16:55 | 显示全部楼层
现在gpt6有什么省事的api渠道吗?
回复

使用道具 举报

     
发表于 2026-9-23 16:56 | 显示全部楼层
hugosol 发表于 2026-9-23 15:34
是的,我也发现GPT同一个模型切思考强度缓存会失效,这鸡贼的infra

因为思考强度是在系统提示词里面的,改了肯定整个前缀都不对了啊

能够更改思考强度不掉缓存的只有DSH+DS4.1能做到,DS4.1不需要完全命中前缀也能复用KV缓存,魔法一样的架构
回复

使用道具 举报

     
发表于 2026-9-23 16:57 来自手机 | 显示全部楼层
现在来看也没便宜多少 对任务有质量要求还是得用 Astra
回复

使用道具 举报

     
发表于 2026-9-23 16:59 | 显示全部楼层
misuzu0723 发表于 2026-9-23 15:53
所以说性能没有提升反而下降了?

luna加思考预算限制了,难一点的内容思考不完就被截断导致变成弱智
回复

使用道具 举报

     
发表于 2026-9-23 17:05 | 显示全部楼层
本帖最后由 zy450 于 2026-9-23 17:20 编辑
唠叨 发表于 2026-9-23 15:49
比起deepseek我更期待qwen,代码能力4.1对我完全够用了,现在需要的是干活说人话的模型,比如qwen3.8f ...

我是直接和ds说“用标准商务普通话”,效果挺好的
回复

使用道具 举报

     
发表于 2026-9-23 17:16 | 显示全部楼层
qwased 发表于 2026-9-23 16:56
因为思考强度是在系统提示词里面的,改了肯定整个前缀都不对了啊

能够更改思考强度不掉缓存的只有DSH+DS4 ...

一般思考强度都是单独参数呀,不会塞到system_prompt里的
https://api-docs.deepseek.com/zh-cn/
  1. curl https://api.deepseek.com/chat/completions \
  2.   -H "Content-Type: application/json" \
  3.   -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  4.   -d '{
  5.         "model": "deepseek-flash",
  6.         "messages": [
  7.           {"role": "system", "content": "You are a helpful assistant."},
  8.           {"role": "user", "content": "Hello!"}
  9.         ],
  10.         "thinking": {"type": "enabled"},
  11.         "reasoning_effort": "high",
  12.         "stream": false
  13.       }'
复制代码

不过我也不知道是不是transformer架构里这玩意改了就要整块重算,可能DS的KV Cache方案优化过这一块之类的
回复

使用道具 举报

发表于 2026-9-23 17:20 来自手机 | 显示全部楼层
workbuddy的软件设计太神秘了,回复中强行跳到最后看他不怎么想给你看思考过程,我想看之前回复的信息都看不到
也没有个fork,就算不在回复也会跳bug弹到最后。神秘产品力。
回复

使用道具 举报

     
发表于 2026-9-23 17:21 | 显示全部楼层
luna比原来还蠢?真的假的?
回复

使用道具 举报

发表于 2026-9-23 17:24 来自手机 | 显示全部楼层
lly778 发表于 2026-9-23 17:21
luna比原来还蠢?真的假的?

真的,虽然便宜了很多
回复

使用道具 举报

     
发表于 2026-9-23 17:27 | 显示全部楼层
nxmonitor 发表于 2026-9-23 16:27
max有雷霆大思考,时间消耗极其长

慢倒是能接受,反正我几个一起跑的,都在挂着跑的,只要质量可以
回复

使用道具 举报

     
发表于 2026-9-23 17:29 来自手机 | 显示全部楼层
moekyo 发表于 2026-9-23 17:27
慢倒是能接受,反正我几个一起跑的,都在挂着跑的,只要质量可以

信不信比原来差?
回复

使用道具 举报

     
发表于 2026-9-23 17:36 | 显示全部楼层
未知伤亡 发表于 2026-9-23 16:43
如果门口是踏实做事呢?

OA 谁没有踏实做事?OA 模型现在不是第一档?国内互联网三巨头我看也一直在做事啊,阿里字节模型也不是完全不行,也就一个腾讯真菜了点还在努力。

—— 来自 S1Fun
回复

使用道具 举报

     
发表于 2026-9-23 17:37 | 显示全部楼层
德尔惠净水器 发表于 2026-9-23 17:24
真的,虽然便宜了很多

那感觉没意义啊,5.6的luna本来就用不完
回复

使用道具 举报

     
发表于 2026-9-23 17:37 | 显示全部楼层
nxmonitor 发表于 2026-9-23 17:29
信不信比原来差?

原来的就没多好,我都不是一下搞完了,我一般最后还会让网页版做个 fresh review,不行继续改的,之前搭配 5.6 sol 折腾得人想吐。。
回复

使用道具 举报

     
发表于 2026-9-23 17:38 | 显示全部楼层
问个略冷门的需求 现在全双工的语音大模型哪家相对不弱智点

豆包说话很顺 但是比较傻还嘴硬
gpt的中文说的一股abc味 而且体感智商也一般
回复

使用道具 举报

头像被屏蔽
发表于 2026-9-23 17:49 | 显示全部楼层
提示: 作者被禁止或删除 内容自动屏蔽
回复

使用道具 举报

     
发表于 2026-9-23 17:49 | 显示全部楼层
hugosol 发表于 2026-9-23 17:16
一般思考强度都是单独参数呀,不会塞到system_prompt里的
https://api-docs.deepseek.com/zh-cn/

但是你要告诉模型怎么思考,这里就一起传进去了啊
DS4.1是0-100的值
Reasoning Effort: {n} (range 1-100, the higher the value, the more thorough
the reasoning)
如提示词所述,现在的思考程度由数值控制
思考默认值是75,映射到high档
目前只有四个档位:
---
无思考
low档 50
high档 75
max档 100



0731和其他国模一样,都是自然语言提示,比如qwen也是从“你不需要思考直接回答”到“进行详细思考,不要遗漏任何方面再回答”

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-9-23 18:17 | 显示全部楼层
qwased 发表于 2026-9-23 17:49
但是你要告诉模型怎么思考,这里就一起传进去了啊
DS4.1是0-100的值
Reasoning Effort: {n} (range 1-100 ...

这是哪一层的代码,能否给个出处看看。。。
回复

使用道具 举报

发表于 2026-9-23 18:19 来自手机 | 显示全部楼层
jonarryn 发表于 2026-9-23 03:16
求问一下 有没有什么现成方案是能让Agent 软件的工作区和会话库同步到两台电脑上用的,我现在用的是 OneDri ...

如果不是公司电脑,建议固定一台开发电脑使用webui远程访问

评分

参与人数 1战斗力 +1 收起 理由
jonarryn + 1 好评加鹅

查看全部评分

回复

使用道具 举报

     
发表于 2026-9-23 18:22 来自手机 | 显示全部楼层
lactone 发表于 2026-9-23 09:59
数学也是一样,oa文章都没发,就有一堆营销号吹

之前hy3搞出来的数学成果都是peer review了的,达摩院前段 ...

手机打口水仗能增加销量,大模型在算力受限的情况下增加宣发除了能让你在网络口水仗里挺起胸膛,还有什么好处?

—— 来自 OPPO PKU110, Android 16, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-9-23 18:23 来自手机 | 显示全部楼层
hugosol 发表于 2026-9-23 18:17
这是哪一层的代码,能否给个出处看看。。。

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/blob/main/encoding/README.md

另外gpt6改成把思考强度附加在对话的最后传入了,改思考强度掉缓存可能也是codex的bug吧
回复

使用道具 举报

     
发表于 2026-9-23 18:30 | 显示全部楼层
本帖最后由 舞以 于 2026-9-23 18:31 编辑

思考强度实际生效是靠在提示最开始的一个关键词啊,这都是老生常谈了。不然你后训练怎么做?大模型本身只看得懂文本。
思考强度之前的做法是做几套后训练,然后压到一起,靠关键词启动不同的推理模式。
df41是在开头引入自然数,来结合奖惩(我记得是超长惩罚根据数值指数衰减),让模型在后训练中学会根据这个自然数来改变推理的模式。
回复

使用道具 举报

     
发表于 2026-9-23 18:30 | 显示全部楼层
qwased 发表于 2026-9-23 18:23
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/blob/main/encoding/README.md

另外gpt6改 ...

草,让agent搜了下找到了
原来思考强度也这么草台,我还一直以为是有逻辑的参数,原来就一段提示词么
回复

使用道具 举报

     
发表于 2026-9-23 18:36 来自手机 | 显示全部楼层
hugosol 发表于 2026-9-23 18:30
草,让agent搜了下找到了
原来思考强度也这么草台,我还一直以为是有逻辑的参数,原来就一段提示词么 ...

但是这玩意还真的非常关键,我最近在折腾本地部署,发现极致量化的情况下,作者以xhigh强度校准尽可能保持智力,就会导致medium变成流口水的傻子
回复

使用道具 举报

     
发表于 2026-9-23 18:39 | 显示全部楼层
靠提示词确实不够优雅,改成数字类型的确实更符合直觉
回复

使用道具 举报

     
发表于 2026-9-23 18:41 来自手机 | 显示全部楼层
未知伤亡 发表于 2026-9-23 17:49
OA踏实做事了啊,国内大厂还差一点

踏实做事在哪
看别人对话记录写小作文的A\
还是偷别人数学的逻辑宣称自己突破的O\
而且和国内大厂对标的不是谷歌微软亚马逊 最大的功绩不是把Jeff Dean干跑路了

— from motorola XT2603-1, Android 16, S1 Next Goose v4.0
回复

使用道具 举报

     
发表于 2026-9-23 18:43 | 显示全部楼层
我试用了gpt 6 sol,还行,和5.6 sol差不多,但是便宜一半,可以了。
回复

使用道具 举报

     
发表于 2026-9-23 18:44 | 显示全部楼层
现在所有的harness不都是提示词,llm模型最根本的东西
回复

使用道具 举报

     
发表于 2026-9-23 18:49 来自手机 | 显示全部楼层
Ds开了个新论文

DSec 这篇论文介绍的是 DeepSeek 为大规模 Agent 训练和评测建设的沙箱基础设施。 它解决的核心问题是:如何让大量 Agent 低成本、稳定地在真实软件环境里操作和试错。

主要有四点:

统一运行环境:通过统一 SDK 支持函数调用、容器、微型虚拟机和完整虚拟机,适配不同任务与隔离需求。

降低环境成本:利用可组合镜像层、3FS 按需加载、内存共享与回收,提高启动速度和部署密度。

配合强化学习:协调沙箱与训练生命周期,在训练被抢占或暂停时保留交互状态,减少重复执行。

控制异常行为:通过隔离和访问控制,缓解 Agent 破坏环境、干扰其他任务及 reward hacking 等问题。

作者报告,单个部署单元约 160 个 CPU 节点,每天服务约 300 万个沙箱实例,峰值并发约 38 万,每秒创建超过 5,000 个实例。
回复

使用道具 举报

     
发表于 2026-9-23 18:56 | 显示全部楼层
fzlong 发表于 2026-9-23 11:11
让翻译入间人间新作gpt和deepseek都不肯干
应该怎么说呢

翻译就用本地模型呗。入间人间太坏了,玩得越来越刺激,ai都接受不了了

评分

参与人数 1战斗力 +1 收起 理由
fzlong + 1 好评加鹅

查看全部评分

回复

使用道具 举报

     
发表于 2026-9-23 19:09 | 显示全部楼层
今天用 ppt master 做 ppt,因为公司只有 workbuddy,再次尝试 ds4.1f 和 kimi 2.8 preview,提纲布局我都提前写好了

就,ds4.1f 视觉真的一坨,我有预先设置好的模版,完全…不照着搞,skill 倒是正常遵从

kimi 是完全不鸟 skill 那些确认,雷霆大思考出活,质量确实不错

对比 credits 一个 150 一个 530…150 那个是完全浪费了不过

评价是都不如 5.6 Sol…可惜公司没有
回复

使用道具 举报

发表于 2026-9-23 19:17 来自手机 | 显示全部楼层
fzlong 发表于 2026-9-23 11:11
让翻译入间人间新作gpt和deepseek都不肯干
应该怎么说呢

那啥部分单独想办法,毕竟是初中生,模型天然排斥,不过日常部分应该不会拒绝翻译吧

评分

参与人数 1战斗力 +1 收起 理由
fzlong + 1 欢乐多

查看全部评分

回复

使用道具 举报

发表于 2026-9-23 19:22 来自手机 | 显示全部楼层
M乔梦 发表于 2026-9-23 18:56
翻译就用本地模型呗。入间人间太坏了,玩得越来越刺激,ai都接受不了了

他哪部作品这么扭曲?
回复

使用道具 举报

     
发表于 2026-9-23 19:27 来自手机 | 显示全部楼层
kiddolck 发表于 2026-9-23 19:09
今天用 ppt master 做 ppt,因为公司只有 workbuddy,再次尝试 ds4.1f 和 kimi 2.8 preview,提纲布局我都 ...

我试过学术ppt,最好的是k3,5.6sol的审美也很一般,astra才大进步
回复

使用道具 举报

发表于 2026-9-23 19:31 来自手机 | 显示全部楼层
来都来了 发表于 2026-9-23 19:22
他哪部作品这么扭曲?

最新那个,人妻和初中生
回复

使用道具 举报

     
发表于 2026-9-23 19:50 | 显示全部楼层
kiddolck 发表于 2026-9-23 19:09
今天用 ppt master 做 ppt,因为公司只有 workbuddy,再次尝试 ds4.1f 和 kimi 2.8 preview,提纲布局我都 ...

DS做HTML演示倒是挺好的,现在没啥特殊需求真不如用html了
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-10-11 15:00 , Processed in 0.150524 second(s), 8 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表