找回密码
 立即注册
搜索
楼主: 绕指流光

[科技] OPENAI数学氢弹雨来袭 | 大模型讨论专楼

 火... [复制链接]
发表于 2026-10-7 22:19 | 显示全部楼层
heemoon 发表于 2026-10-7 22:04
多谢,我去学习学习。

刚才让大肥鱼试着复刻一个视频,换个主题和内容,结果不出所料是一坨,不过没想象 ...

大肥鱼不是没有多模态吗,还能复刻视频?
回复

使用道具 举报

发表于 2026-10-7 22:20 | 显示全部楼层
十来天前的风向还是,奥特曼被 Astra 吓怕了,拿不出有真东西的模型了,A 处要完蛋了。这两天楼里突然风向就变成了O 处打不过 A 处,tibo 急了没招了。虽然我理解大家都喜欢斗兽,但是好歹也有一点耐心嘛
回复

使用道具 举报

     
发表于 2026-10-7 22:44 来自手机 | 显示全部楼层
飞剪号 发表于 2026-10-7 22:19
大肥鱼不是没有多模态吗,还能复刻视频?

Bro从一个月前穿越过来的吗

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-7 22:45 来自手机 | 显示全部楼层
本来现在就是,能保持 SOTA 两周就不错了

—— 来自 Xiaomi M332BF, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-7 22:49 来自手机 | 显示全部楼层
讲道理,个人开发可以先根据产品形态让ai出design tokens
这也是某种分层,交互设计与功能实现分离后,对大模型本身能力要求就降低了
回复

使用道具 举报

     
发表于 2026-10-7 22:50 来自手机 | 显示全部楼层
本帖最后由 lactone 于 2026-10-7 22:52 编辑

明天会有国模发布吗?

现在美国欧洲的开源模型算是追到glm5.2了

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
回复

使用道具 举报

     
发表于 2026-10-7 22:56 | 显示全部楼层
讲道理,现在模型的前端审美已经没有太大意义了,因为有很多开源仓库连审美都打包到文档里了,让agent直接套上来用就是了
比如这个:
https://github.com/chaos-xxl/zelda-hyrule-ui
想微调就让它读项目文档,然后跟它说“我要五彩斑斓的黑”之类的
回复

使用道具 举报

     
发表于 2026-10-7 22:59 来自手机 | 显示全部楼层
有哪家不花钱的网页版ai擅长做设计和计划的

——来自 2410DPN6CC 上的 S1er 客户端
回复

使用道具 举报

     
发表于 2026-10-7 23:33 | 显示全部楼层
国庆都完了,gemini 呢
回复

使用道具 举报

     
发表于 2026-10-7 23:35 | 显示全部楼层
国庆七天从早到晚一直在AI
回复

使用道具 举报

     
发表于 2026-10-8 02:13 | 显示全部楼层
本帖最后由 Quelaan 于 2026-10-8 02:15 编辑
奈落的孤火花 发表于 2026-10-7 23:35
国庆七天从早到晚一直在AI

我也差不多,感想就是astra不如opus5.5一根毛
回复

使用道具 举报

     
发表于 2026-10-8 02:22 | 显示全部楼层
haiku 5.5发布
不过感觉sonnet 5.5 max就已经开始雷霆起来了,haiku真的能用好用吗
回复

使用道具 举报

     
发表于 2026-10-8 02:36 | 显示全部楼层
openai感觉没活硬整了啊

haiku好歹还够便宜,你这啥UI是什么鬼
回复

使用道具 举报

     
发表于 2026-10-8 03:20 | 显示全部楼层
codemode有点强啊,GPT系好像有专门训练过这方面的能力,上下文一下子变得极其耐用了
回复

使用道具 举报

     
发表于 2026-10-8 03:43 | 显示全部楼层
Quelaan 发表于 2026-10-8 02:13
我也差不多,感想就是astra不如opus5.5一根毛

不太同意,gpt系列的优势和劣势是双刃剑,一体两面的。

就是因为GPT系列如此的严谨、谨慎、胆小、周全、防御,所以才搞出来那么多数学定理,它就是非常死板严谨,没办法。
opus5.5看着沟通起来很自然流畅,审美也挺不错,写代码也不错。但是沟通的时候,时不时就有口误、想当然,为了把话说的好听、说的好看,擅自改变一些事实,说话不从事实去核查,直接随口给一个结论当做猜测之类的。


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-10-8 03:51 | 显示全部楼层
我现在有一个项目负责人,一个前端一个后端,一个QA,一个设计师。跑ai像是看一堆ai社畜在打工,救命
回复

使用道具 举报

     
发表于 2026-10-8 03:53 | 显示全部楼层
奈落的孤火花 发表于 2026-10-8 03:43
不太同意,gpt系列的优势和劣势是双刃剑,一体两面的。

就是因为GPT系列如此的严谨、谨慎、胆小、周全、 ...

因为我国庆这几天折腾的就是强审美相关的项目,不管是UI还是分镜设计,astra的表现甚至比不上gemini
回复

使用道具 举报

     
发表于 2026-10-8 03:58 | 显示全部楼层
Quelaan 发表于 2026-10-7 13:53
因为我国庆这几天折腾的就是强审美相关的项目,不管是UI还是分镜设计,astra的表现甚至比不上gemini ...

gpt可以调用google那个ui生成工具,不过效果也就那样
回复

使用道具 举报

     
发表于 2026-10-8 04:07 | 显示全部楼层
Quelaan 发表于 2026-10-8 03:53
因为我国庆这几天折腾的就是强审美相关的项目,不管是UI还是分镜设计,astra的表现甚至比不上gemini ...

这方面astra一坨。确实
回复

使用道具 举报

     
发表于 2026-10-8 08:27 来自手机 | 显示全部楼层
一觉醒来,又是重置。还好是重置卡,应该能留给下代模型。
回复

使用道具 举报

     
发表于 2026-10-8 08:33 来自手机 | 显示全部楼层
最好每天都重置,这样我就能开fast了

—— 来自 samsung SM-S9480, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-8 08:35 | 显示全部楼层
hugosol 发表于 2026-10-7 13:09
我也没用过codegraph,当时一大堆同类产品做了一下调研就一直在用这个了
这里有个对比的文章
https://zhu ...

codebase memory mcp感觉大肥鱼根本不会主动使用啊
每次看他在那疯狂grep我就让他用mcp试试,他会主动用一下然后说确实不错有帮助,然后让他总结经验改skill和agents.md,下次还是不主动用
回复

使用道具 举报

     
发表于 2026-10-8 08:38 来自手机 | 显示全部楼层
qwased 发表于 2026-10-8 08:35
codebase memory mcp感觉大肥鱼根本不会主动使用啊
每次看他在那疯狂grep我就让他用mcp试试,他会主动用 ...

昨天exo free会主动用 这也是我觉得这是o\模型的主因

国产模型没见过自主调用
还要占用大量硬盘 有点想删掉了

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-10-8 09:15 | 显示全部楼层
本帖最后由 hugosol 于 2026-10-8 09:24 编辑
qwased 发表于 2026-10-8 08:35
codebase memory mcp感觉大肥鱼根本不会主动使用啊
每次看他在那疯狂grep我就让他用mcp试试,他会主动用 ...

我搓了个extension,打开之后每轮对话都注入这两句话,模型就会自己判断要不要用了
  1. 调用grep或search搜索代码前,考虑是否使用codebase-memory-mcp中的工具更合适。
  2. 调用read阅读超过100行的源代码前,请先用 codebase-memory-mcp 查看声明大纲或符号片段。
复制代码

思路是用工具调用这种具体行为作为条件触发,基本涵盖了我想它自动用codebase-memory-mcp的所有场景了,你可以看你的agent具体会用哪些tool call,换成对应工具名字就行,我这是给oh-my-pi用的
grep的时候会用search_graph/trace_path之类的,read的时候则是用get_code_snippet等代替
而且根本不需要提到mcp具体工具名,让模型自己考虑用什么工具,它自己就会根据tool description组合这些工具做多轮查询达到自己的目的,注入的提示词也非常精简

评分

参与人数 1战斗力 +2 收起 理由
qwased + 2 好评加鹅

查看全部评分

回复

使用道具 举报

     
发表于 2026-10-8 09:34 | 显示全部楼层
6.1 sol用了6轮把视频复刻的七七八八了,换了主题,加了些新的表现形式,还算满意。

做的过程中越做就越觉得opus 5.5牛逼,有些细节和巧思我看了好多遍才发现
回复

使用道具 举报

     
发表于 2026-10-8 09:34 | 显示全部楼层
说起来codemode这个东西才真的是核弹爆炸,能把上下文省下来之后用Sol-6.1和Astra这个级别的模型在极短的上下文里干大量的事情,272K用起来体感跟DeepSeek 400多K似的
不过这玩意好像需要模型针对训练才好使,如果以后DeepSeek的pro模型能往这个方向走那就无敌了
回复

使用道具 举报

     
发表于 2026-10-8 09:49 | 显示全部楼层
独立研究机构 New Constructs 认为,Anthropic 拟以约 2 万亿美元估值上市,但公司持续亏损,并承担约 5180 亿美元云计算、算力和基础设施合同义务,IPO 更像为早期投资者提供退出流动性,而非筹资扩张。称其为“2026 年最荒唐的 IPO”,并认为公司没有可行的商业模式。

文章援引泄露招股书称,Anthropic 2025 年收入约 46 亿美元、经营亏损约 80 亿美元;其模型测算,若增长放缓,股票下行空间可能超过 40%,极端情形超过 90%。

回复

使用道具 举报

     
发表于 2026-10-8 10:24 来自手机 | 显示全部楼层
hugosol 发表于 2026-10-8 09:34
说起来codemode这个东西才真的是核弹爆炸,能把上下文省下来之后用Sol-6.1和Astra这个级别的模型在极短的上 ...

dsh的ptc模式是和pi的codemode类似的东西,都是用js/ts组装命令调用工具然后统一输出结果
回复

使用道具 举报

发表于 2026-10-8 10:51 | 显示全部楼层
今天好像大肥鱼思考链死循环的问题没有那么严重了,是我的错觉吗?
回复

使用道具 举报

     
发表于 2026-10-8 11:00 | 显示全部楼层
本帖最后由 SmterC 于 2026-10-8 11:05 编辑

如果用dsh的PTC模式,类似codemode的那个
可以装一个插件,dsh-ptc-plus
能宽容模型的很多错误调用,比方说原本PTC模式下不允许直接read edit的,但小模型还是会想当然地调用read edit工具,这个插件会直接给你映射过去,避免冷冰冰的提示让模型反复碰壁浪费上下文。如果模型写的工具调用代码有问题,还允许出错后直接编辑代码重新运行,还能保留过去代码的状态继续运算
算是极大降低了使用codemode的门槛,让很多小模型也能用好,规避了codemode容易一损俱损的缺点    Re:Source
回复

使用道具 举报

     
发表于 2026-10-8 11:02 | 显示全部楼层
反正做数学,做推理,gpt还是独一档,前端审美和工程实现,claude确实很强,但是我又用不到,所有还是只能用gpt。
回复

使用道具 举报

     
发表于 2026-10-8 11:14 | 显示全部楼层
SmterC 发表于 2026-10-8 11:00
如果用dsh的PTC模式,类似codemode的那个
可以装一个插件,dsh-ptc-plus
能宽容模型的很多错误调用,比方说 ...

所以还是得模型本身有往那个方向训练才行
现在Astra和Sol-6.1用codemode非常丝滑,不知道DeepSeek自己的模型用PTC有没有这么好的效果,不过我想大概用提示词约束一下也能改善
回复

使用道具 举报

     
发表于 2026-10-8 11:32 | 显示全部楼层
hugosol 发表于 2026-10-8 11:14
所以还是得模型本身有往那个方向训练才行
现在Astra和Sol-6.1用codemode非常丝滑,不知道DeepSeek自己的 ...

如果不装这个插件,执行效果是比较一般的
模型经常会因为幻觉觉得自己有read edit工具,调用了又被harness拒绝,要求必须run_code里面运行
模型变笨后,run_code经常报错,模型就又磨磨蹭蹭小修小补执行一遍,经常这么来回好几次,节省的上下文又被这样浪费了
甚至dsh有段时间PTC模式一直有一个随机触发的,工具调用没接收到description参数的bug,好久才修复,感觉现在他们对PTC模式还是不够上心
也因此需要这个插件补全    Re:Source
回复

使用道具 举报

     
发表于 2026-10-8 11:35 来自手机 | 显示全部楼层
hugosol 发表于 2026-10-8 11:14
所以还是得模型本身有往那个方向训练才行
现在Astra和Sol-6.1用codemode非常丝滑,不知道DeepSeek自己的 ...

用ds4.1f试过dsh的ptc和pi的codemode。
很搞的是ds自己用自家专武的ptc老是出毛病,用新出还没专训过的codemode反而用的挺好
回复

使用道具 举报

发表于 2026-10-8 11:51 | 显示全部楼层
现阶段模型,至少glm与deepseek对于静态工具,迁移状态分析与动态dap的训练内化水平还不够,必须依赖注入让其读清单。否则索引表过期,dap调试测试时总是会有遗漏


但反过来说如果注入及时,跨文件的项目能力是可以显著提升的


回复

使用道具 举报

发表于 2026-10-8 11:52 | 显示全部楼层
SmterC 发表于 2026-10-8 11:00
如果用dsh的PTC模式,类似codemode的那个
可以装一个插件,dsh-ptc-plus
能宽容模型的很多错误调用,比方说 ...

对于deepseek,和glm这种的对抗性的禁止prompt效果一般,不如写个插件让其在必要时读清单
回复

使用道具 举报

     
发表于 2026-10-8 11:53 | 显示全部楼层
codex启动报错,说明node_repl.exe 在沙箱检查访问权限时触发 Windows 错误 32。
这咋办啊...Codex自己还解决不了。
回复

使用道具 举报

发表于 2026-10-8 12:02 | 显示全部楼层
本帖最后由 mitzvah 于 2026-10-8 13:29 编辑
qwased 发表于 2026-10-8 08:35
codebase memory mcp感觉大肥鱼根本不会主动使用啊
每次看他在那疯狂grep我就让他用mcp试试,他会主动用 ...

你要尝试固化流程,对于已有的代码,第一步就是静态工具建索,然后让其建立计划文档 包括修改目标,达成目标所需要的修改的准代写在文档里码,然后让其对这些准代码进行列清单式的逐一静态工具排查,评估方案的可行性与风险,闭环迭代到风险评估与可行性的最优,然后开始前转态迁移矩阵分析,实施代码修改,构建动态dap后状态迁移调试测试,交付给用户人力测试——这么个流程走完,并且要在每次流程走完后强制进行重新静态工具建索

用列清单式的方法尽量把这个流程固化,不敢说一定能按照程序执行,但是总能大幅度提高能力的

评分

参与人数 1战斗力 +2 收起 理由
qwased + 2 好评加鹅

查看全部评分

回复

使用道具 举报

     
发表于 2026-10-8 12:15 | 显示全部楼层
Gmlazy 发表于 2026-10-8 11:53
codex启动报错,说明node_repl.exe 在沙箱检查访问权限时触发 Windows 错误 32。
这咋办啊...Codex自己还解 ...

解决办法参考:https://github.com/openai/codex/issues/51590
解决方法的提出者提示这个方法按照官方说明隔离性会比较弱,尚且不知会发生什么问题。

这个问题我看提交了好几次,大家伙没有遇到的吗?看来是我把什么设置搞砸了。
回复

使用道具 举报

     
发表于 2026-10-8 12:29 | 显示全部楼层
让dsh把配置改unelevated然后等更新修复吧
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-10-11 07:25 , Processed in 0.175121 second(s), 8 queries , Gzip On, Redis On.

Powered by Discuz! X3.5 Licensed

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表