找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] OPENAI数学氢弹雨来袭 | 大模型讨论专楼

 火... [复制链接]
     
发表于 2026-10-8 12:55 | 显示全部楼层
这个月国模能上新吗
回复

使用道具 举报

     
发表于 2026-10-8 12:56 来自手机 | 显示全部楼层
等浑元4王者归来!
回复

使用道具 举报

     
发表于 2026-10-8 13:04 | 显示全部楼层
hy4 preview初期体验一言难尽,改内容把编译头文件都丢了。
回复

使用道具 举报

     
发表于 2026-10-8 13:08 | 显示全部楼层
hugosol 发表于 2026-10-8 11:14
所以还是得模型本身有往那个方向训练才行
现在Astra和Sol-6.1用codemode非常丝滑,不知道DeepSeek自己的 ...

你们用dsh都 不用PTC模式的么?非常好用,用了好几周了
配合 500-600k自动压缩+PTC,效率非常好
回复

使用道具 举报

     
发表于 2026-10-8 13:10 | 显示全部楼层
小道消息这一两周会有三个模型上,看目前情况估计就是K3.1,V4.1Pro和Qwen4了
回复

使用道具 举报

     
发表于 2026-10-8 13:29 来自手机 | 显示全部楼层
Gmlazy 发表于 2026-10-8 12:15
解决办法参考:https://github.com/openai/codex/issues/51590
解决方法的提出者提示这个方法按照官方说 ...

有没有可能是今天更新更新坏了,经常动不动就把沙箱更炸,习惯了

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-8 13:58 | 显示全部楼层
按照中国traditonal来说宁可参数放码错杀一切,也别过拟合
回复

使用道具 举报

     
发表于 2026-10-8 14:09 来自手机 | 显示全部楼层
nxmonitor 发表于 2026-10-8 13:10
小道消息这一两周会有三个模型上,看目前情况估计就是K3.1,V4.1Pro和Qwen4了

k3.1已经是延期过了,评测up签的保密协议过期了都不过也没谁大嘴巴往外说给自己惹麻烦
回复

使用道具 举报

     
发表于 2026-10-8 14:29 来自手机 | 显示全部楼层
请教一下,现在如果想偶尔用用 k3 的话,除了官方 plan 还有啥合适的方案吗
回复

使用道具 举报

发表于 2026-10-8 14:32 | 显示全部楼层
本帖最后由 星汐引力 于 2026-10-8 14:36 编辑

ai审美确实没那么重要了,我用skill写效果就蛮好的,主流模型不至于蠢到连抄都抄不明白
https://www.luochang.ink/adr-kit/
回复

使用道具 举报

     
发表于 2026-10-8 14:48 | 显示全部楼层
周末DS应该不上班,看看明天会不会有大的了,不行就得下周了
回复

使用道具 举报

     
发表于 2026-10-8 14:54 | 显示全部楼层
qwased 发表于 2026-10-8 14:09
k3.1已经是延期过了,评测up签的保密协议过期了都不过也没谁大嘴巴往外说给自己惹麻烦 ...

反正Qwen4就之前测试的看是区了,K3.1延期也不怎么妙可能和Grok一样倒吸,只能看V4.1Pro了
回复

使用道具 举报

     
发表于 2026-10-8 15:25 来自手机 | 显示全部楼层
平昭·南宫司卿 发表于 2026-10-8 14:29
请教一下,现在如果想偶尔用用 k3 的话,除了官方 plan 还有啥合适的方案吗

K的api价格太离谱了,还是捏着鼻子用plan吧

—— 来自 OnePlus PLZ110, Android 17, 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-10-8 15:53 | 显示全部楼层
6.1 这个防御性还是挺 naocan 的,对工程的负面影响大到我需要翻出我的号用 5.5 去验收对冲掉这些永远做不出的东西    Re:Source
回复

使用道具 举报

     
发表于 2026-10-8 16:05 | 显示全部楼层
nxmonitor 发表于 2026-10-8 14:54
反正Qwen4就之前测试的看是区了,K3.1延期也不怎么妙可能和Grok一样倒吸,只能看V4.1Pro了 ...

感觉K3.1是刚准备发然后被A社三连吓回去了,毕竟也是要IPO的
回复

使用道具 举报

     
发表于 2026-10-8 16:13 | 显示全部楼层
startraveller 发表于 2026-10-8 16:05
感觉K3.1是刚准备发然后被A社三连吓回去了,毕竟也是要IPO的

反正Qwen4这个是可以确定的,之前看测试后端算法题做得不如4.1F,token消耗还特别大
回复

使用道具 举报

     
发表于 2026-10-8 16:14 | 显示全部楼层
本帖最后由 nxmonitor 于 2026-10-8 16:16 编辑

按照今天字节的一个文章说DS会发生能力漂移,采用了类似架构的Qwen4可能真踩到这个坑里面也说不定,毕竟V4Pro就很确定是踩中的,4.1就改得七七八八了
回复

使用道具 举报

     
发表于 2026-10-8 16:23 | 显示全部楼层
nxmonitor 发表于 2026-10-8 16:14
按照今天字节的一个文章说DS会发生能力漂移,采用了类似架构的Qwen4可能真踩到这个坑里面也说不定,毕竟V4P ...

其实人话就是压缩tokens 4个一包可能“断错句”,4.1改成了2个一包缓解了出错概率,但是无法根除。

本质就是这个世界没有免费的午餐,没有无损的压缩。
回复

使用道具 举报

发表于 2026-10-8 17:13 | 显示全部楼层
space-bunny我用workbuddy试了下,帮我改错别字,感觉还可以
回复

使用道具 举报

     
发表于 2026-10-8 17:20 | 显示全部楼层
感觉现在有点DeepSeek R1出来前的黑暗感觉。
a/的5.5全系把o/的6系打的找不到北,国模整体梯队的能力和性价比又连o/的astra/6.1 sol的尾气还跟不上。算力荒和涨价潮还越演越烈,整体差距有点绝望了。
回复

使用道具 举报

发表于 2026-10-8 17:23 | 显示全部楼层
bixinhaner 发表于 2026-10-8 17:20
感觉现在有点DeepSeek R1出来前的黑暗感觉。
a/的5.5全系把o/的6系打的找不到北,国模整体梯队的能力和性价 ...

就这点差距,最多几个月的距离,也叫绝望吗,很多行业曾经动不动是10年20年30年的差距,现在看来也不过如此
回复

使用道具 举报

     
发表于 2026-10-8 17:36 来自手机 | 显示全部楼层
qwen4的评价两极分化,有人说前端能打opus5.5,但是跑分还不如4.1f

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-10-8 17:42 | 显示全部楼层
本帖最后由 lly778 于 2026-10-8 17:44 编辑

你楼日常绝望。而且5.5也打不过不降智的astra,o/主要是额度太低了。
回复

使用道具 举报

     
发表于 2026-10-8 17:43 | 显示全部楼层
o畜纯属自作自受
oai的臭毛病就是稍微领先一点就觉得赢了,不务正业了。以前去搞什么sora,购物,pluse

这次去搞dot
模型能力够了, 我们搞personal agent
算力不够就砍老用户
结果A/反手一刀,被干傻了
回复

使用道具 举报

     
发表于 2026-10-8 17:50 来自手机 | 显示全部楼层
lactone 发表于 2026-10-8 17:36
qwen4的评价两极分化,有人说前端能打opus5.5,但是跑分还不如4.1f

—— 来自 vivo V2520A, Android 16,  ...

测前端都是oneshot,后端做两个算法题就鬼打墙了,那么前端能力也不可信了,毕竟还是需要编程能力的…
回复

使用道具 举报

     
发表于 2026-10-8 17:51 来自手机 | 显示全部楼层
千问4已经有测试了吗

—— 来自 鹅球 v3.5.99
回复

使用道具 举报

     
发表于 2026-10-8 18:00 | 显示全部楼层
只要OA打滚就绝望不了一点。
哪天一家独大才可怕,那是真有什么别人拍马也赶不上的秘密武器了。
现在这种能来回打滚的情况就说明只是算力差而已。
回复

使用道具 举报

     
发表于 2026-10-8 20:26 | 显示全部楼层
有啥好绝望的,A家不好说,下一波追个O家还是有希望的
回复

使用道具 举报

     
发表于 2026-10-8 20:34 | 显示全部楼层
malisa 发表于 2026-10-8 17:43
o畜纯属自作自受
oai的臭毛病就是稍微领先一点就觉得赢了,不务正业了。以前去搞什么sora,购物,pluse

dots体验还不如grokbot 尼妹产品经理纯菜的 还不如阿三
回复

使用道具 举报

     
发表于 2026-10-8 20:45 | 显示全部楼层
dots我用下来,就算是抱着对初期产品最大的善意,我也觉得有几个硬伤
第一个是,背后是不是astra不知道,但是astra的懒癌是有的,有时候不干活,硬等用户催促。
第二个是奇怪的授权,一件事情要用户反复授权,特别是一些可回退操作。结合第一个是灾难级的

最后是gpt生态看着打通了,但又没打通


隔壁老马准备上opus5.5 suno和Midjourney了
回复

使用道具 举报

     
发表于 2026-10-8 21:03 | 显示全部楼层
星汐引力 发表于 2026-10-8 14:32
ai审美确实没那么重要了,我用skill写效果就蛮好的,主流模型不至于蠢到连抄都抄不明白
https://www.luocha ...

是说DS4.1F用skill做的这个网页?
回复

使用道具 举报

发表于 2026-10-8 22:07 | 显示全部楼层
UncleDracula 发表于 2026-10-8 21:03
是说DS4.1F用skill做的这个网页?

做这个网页的时候,DS 4.1 flash 还没发,应该是用 glm 5.3 做的
主要还是skill强,这个skill是烧了不少token做的,我没舍得开源
回复

使用道具 举报

     
发表于 2026-10-9 00:13 | 显示全部楼层
近期有个开发项目要做,想开个能力比较强的模型的plan
本来想开个GPT pro的,但是看到很多用户喷过度保守没法决策 容易钻牛角尖浪费token又犹豫了,这些问题太致命没法干活
目前工作能力最强最稳定的模型还是Claude?但是A/封号太多了,问用过的网友九成都被封过,目前有办法稳定使用Claude吗?比如增加点成本再开个美国服务器跑这种
回复

使用道具 举报

     
发表于 2026-10-9 00:49 | 显示全部楼层
这个有人要试吗,无敌奇美拉

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×

评分

参与人数 1战斗力 +1 收起 理由
黄泉川此方 + 1 欢乐多

查看全部评分

回复

使用道具 举报

     
发表于 2026-10-9 01:15 | 显示全部楼层
我也很绝望啊 发表于 2026-10-9 00:13
近期有个开发项目要做,想开个能力比较强的模型的plan
本来想开个GPT pro的,但是看到很多用户喷过度保守没 ...

哪有那么讲究的,模型只能是锦上添花的部分,最核心的能力还是人类本身(还有合适的工作流以及开发工具)
反正现在这些前沿模型能力差距也没那么大,要关心的问题是 能有多少token让你挥霍

评分

参与人数 1战斗力 +1 收起 理由
我也很绝望啊 + 1 自觉能力不如模型(

查看全部评分

回复

使用道具 举报

     
发表于 2026-10-9 02:26 | 显示全部楼层
我也很绝望啊 发表于 2026-10-9 00:13
近期有个开发项目要做,想开个能力比较强的模型的plan
本来想开个GPT pro的,但是看到很多用户喷过度保守没 ...

harness要正常工作必须授予本机的各种权限,然后Claude Code会从你系统里各种蛛丝马迹里寻找你是中国人的线索,例如系统时区,常用工作语言等……光开**没有用,只要你人在国内用官方套餐就不可能逃过封号,被封只是早晚问题。剩下的个人途径只有中转站,不过我个人是觉得中转站服务没有任何办法保证模型质量,要不要用看你个人定夺吧

至于GPT,我不太懂你说的过度保守没法决策是啥意思。我现在的审核和计划模型就是Astra,个人觉得能力是很强的
回复

使用道具 举报

     
发表于 2026-10-9 02:42 | 显示全部楼层
andychen 发表于 2026-10-9 02:26
harness要正常工作必须授予本机的各种权限,然后Claude Code会从你系统里各种蛛丝马迹里寻找你是中国人的 ...

Claude封号没法避免那只能彻底排除了,到时先开个GPT试试水
有不少喷GPT6的视频,下面一堆受害者现身说法给我看怕了,比如这个
GPT 6 Astra:一个平庸、沉闷、没有品味的模型
https://www.bilibili.com/video/BV1ReaJ6YEZA/
回复

使用道具 举报

     
发表于 2026-10-9 03:08 | 显示全部楼层
我也很绝望啊 发表于 2026-10-9 02:42
Claude封号没法避免那只能彻底排除了,到时先开个GPT试试水
有不少喷GPT6的视频,下面一堆受害者现身说法 ...

astra后端依然是最强的  不碰A\要做前端的话可以试试KIMI
回复

使用道具 举报

     
发表于 2026-10-9 04:18 | 显示全部楼层
我也很绝望啊 发表于 2026-10-9 02:42
Claude封号没法避免那只能彻底排除了,到时先开个GPT试试水
有不少喷GPT6的视频,下面一堆受害者现身说法 ...

首先模型的泛化能力和通用能力直接和规模挂钩,所以能和Astra对比的只有Fable,K3勉强可以算。其他规模差一档的没有对比的必要

在这个范围内单说创意性规划,我觉得Fable的主动性更强,更擅长自己去发散。而Astra相对更需要引导,用户去指明一个方向让它去探索,在过程中不容易擅自偏离方向

我觉得只要掌握了特点,按自己的需求去使用模型,Fable和Astra都能交付令人满意的成果。个人认为Astra的世界知识和泛化能力比Fable还要强一些。另外Anthropic的安全政策限制真的很蛋疼,和生物学与网络安全扯上一点边就没法用Fable了
回复

使用道具 举报

     
发表于 2026-10-9 05:07 来自手机 | 显示全部楼层
moekyo 发表于 2026-10-9 00:49
这个有人要试吗,无敌奇美拉

BV16VHm6sEYB
其实是混元员工的业余爱好,正儿八经的后训练个人用下来比swift强多了,是真能用的
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-10-11 07:25 , Processed in 0.199178 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表