hugosol 发表于 2026-8-22 14:52

本帖最后由 hugosol 于 2026-8-22 14:54 编辑

LeoDT 发表于 2026-8-22 14:23
刚才梁文谷又找回前阵子跟flash pair programming的感觉了,快速迭代反复验证太爽了。sol/luna试用的这一 ...
是的,习惯了deepseek这种工作流就发现业界主流那种越来越慢越来越贵的方向完全是开倒车,难怪A/在吹loop engineering
但是这些大公司以外真的前沿搞harness这帮人都清楚肯定要人类介入的,从原则上来说就是反馈越快越方便人类介入
反正我从pro previw那时候就觉得这模型已经够用了,现在的pro反而是用不起的,太难受了

ArthurDent 发表于 2026-8-22 14:54

我发现之前没agent的时候跟我合开网页plus的人现在都还不用agent只用网页,爽蹬40块plus

—— 来自 Xiaomi 2112123AC, Android 13, 鹅球 v4.0-alpha

scikirbypoke 发表于 2026-8-22 15:00

qwased 发表于 2026-8-22 11:07
另外这几天蹬了gemini 3.7flash差不多30%的周限额,感觉哈基米用来许愿编程还是比flash0731笨很多,一个启 ...

不过快是真的快,超高速迭代两三天就差不多把周限用完了

goranger 发表于 2026-8-22 15:06

LeoDT 发表于 2026-8-22 14:23
刚才梁文谷又找回前阵子跟flash pair programming的感觉了,快速迭代反复验证太爽了。sol/luna试用的这一 ...

同感,luna开fast模式勉强摸到flash一点边,但是太钻牛角尖了

论坛助手,iPhone

江月下 发表于 2026-8-22 15:09

请问一下楼u,dsh更新之后标准模式的预设会更好用吗,现在还有let me和we need的区分吗

唠叨 发表于 2026-8-22 15:38

国算员工在监控这贴,我国算额度突然刷新了,掉了30%

黑夜中的冥想 发表于 2026-8-22 16:18

没注意文峰时间,吐血,等文谷

C0s4qmLH9eF9P3w 发表于 2026-8-22 16:22

ai好像什么都没带来 只是在浪费钱

lactone 发表于 2026-8-22 16:29

谷歌好像暗示ox alpha是gemini

那我就不懂了,这个水平是新的gemini pro那就真拉完了https://p.sda1.dev/34/8e3e59f779a4e26b13cb93f160953d1f/image.jpg

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

neptunehs 发表于 2026-8-22 16:35

lactone 发表于 2026-8-22 16:29
谷歌好像暗示ox alpha是gemini

那我就不懂了,这个水平是新的gemini pro那就真拉完了

现在也有很多人推测glm根本没钱搞测试 所以应该是以glm为基底的composer3
但composer不是kimi基底吗
说到底xai不是有了自己的muse了 干嘛还要搞glm基底的composer

反正有不少人不想承认ox是国产的样子
我就想说这个卡的不能动的模型有什么好不承认是不是国产的(

—— 来自 vivo V2561A, Android 16, 鹅球 v4.0

nxmonitor 发表于 2026-8-22 16:41

大概率就是GLM的,小概率是GLM为基模后训练,但是这个东西已经被狙击了,除非价格大幅降低(不太可能),不然很难有声音

tillnight 发表于 2026-8-22 16:43

neptunehs 发表于 2026-8-22 16:35
现在也有很多人推测glm根本没钱搞测试 所以应该是以glm为基底的composer3
但composer不是kimi基底吗
说到 ...

因为一开始被营销成了一个可能登顶的模型。虽然基本可以确定是一个小于glm5.3的flash模型。另外muse不是xai的。

NONORIRI 发表于 2026-8-22 16:46

hugosol 发表于 2026-8-22 14:52
是的,习惯了deepseek这种工作流就发现业界主流那种越来越慢越来越贵的方向完全是开倒车,难怪A/在吹loop...

因为业界主流(或者说资本画大饼方向)是往RSI式的AI for science 方向走的,宣传的突破数学猜想或者其他科学问题都是更需要深度思考而不是快速迭代,也就是说最终目的是没有人类介入。既然都没有人类介入了自然速度不是首要目标了。

qwased 发表于 2026-8-22 16:49

我无语了,让哈基米给我出主意把他安装到WSL上,连着给出三轮错误指令

奈落的孤火花 发表于 2026-8-22 16:54

LeoDT 发表于 2026-8-22 14:23
刚才梁文谷又找回前阵子跟flash pair programming的感觉了,快速迭代反复验证太爽了。sol/luna试用的这一 ...

现在gpt订阅可以设置1m上下文了,只不过上下文大的时候价格翻倍,我已经用了几天了,还挺爽的,除了5.6系列反复走死胡同、撞南墙的问题很严重之外。

goranger 发表于 2026-8-22 16:59

本帖最后由 goranger 于 2026-8-22 17:05 编辑

ox模型世界知识应该比flash好,对同样现象的判断要比flash更准
比如让它测ipv6到cf边缘节点的速度,之前flash测出来13mb,得出的结论是全面不如ipv4,不值得配置v6.用ox看这组数据,得出的结论是6个节点速度高度一致,可能是运营商出口限速。
论坛助手,iPhone

未知伤亡 发表于 2026-8-22 17:01

NONORIRI 发表于 2026-8-22 16:46
因为业界主流(或者说资本画大饼方向)是往RSI式的AI for science 方向走的,宣传的突破数学猜想或者其他 ...

怎么有一种⏰️肉体强化VS🦅机械飞升的既视感

厍无春 发表于 2026-8-22 17:03

qwased 发表于 2026-8-22 16:49
我无语了,让哈基米给我出主意把他安装到WSL上,连着给出三轮错误指令

直接把它接到 Agent 上,让它帮你装,不就得了。

NONORIRI 发表于 2026-8-22 17:08

本帖最后由 NONORIRI 于 2026-8-22 17:10 编辑

未知伤亡 发表于 2026-8-22 17:01
怎么有一种⏰️肉体强化VS🦅机械飞升的既视感

比起机械飞升,更像是跟他们信仰的宗教差不多,期待弥赛亚或者耶稣再临,之后就演绎圣经剧本由带着大能力跟荣耀降临的在世神毁灭审判敌人并给自己的信徒创造永恒新天地不再有痛苦跟死亡。
所以说A\一类公司里有邪教徒肯定没毛病。

中国人 发表于 2026-8-22 17:09

这视觉能力挺一般的,和豆包一样弱智

hugosol 发表于 2026-8-22 17:10

NONORIRI 发表于 2026-8-22 16:46
因为业界主流(或者说资本画大饼方向)是往RSI式的AI for science 方向走的,宣传的突破数学猜想或者其他 ...

其实数学证明更要人类介入吧,这玩意比写程序更容易走偏
我感觉资本方向其实是一些更基础的任务,当模型足够强大,这些任务全自动完成也不会出错时,就可以放心全部交给AI了,但代价就是模型越强思考越久反馈越慢
我并不是反感自动化,我的代码工作流是把自动化的部分全部集中在中间,但是头尾还是需要人类和AI快速沟通迭代,所以速度太慢我是没法忍受的
现在新模型出来就只会吹跑分,实际用下来各种429,或者跑一个小时出结果,这就太欺诈了

NONORIRI 发表于 2026-8-22 17:16

本帖最后由 NONORIRI 于 2026-8-22 17:18 编辑

hugosol 发表于 2026-8-22 17:10
其实数学证明更要人类介入吧,这玩意比写程序更容易走偏
我感觉资本方向其实是一些更基础的任务,当模型 ...

数学证明现在争取用Lean 形式化证明全自动化。当然数学证明只是其一用来证明能力,最终医药、制造业、军事科技等各方面都是试图去实现全自动化探索的。最近把Moderna 的新成果吹成生成式AI的成果(实际你去看报告就会发现基本只是传统机器学习算法的应用)可以看出其意图,Jeff dean 等人从谷歌辞职去搞的新公司也是目标自动化ai for science 。当然是否真的实际我不讨论,我只是说现在美国资本喜欢的大饼是这个路径的。

LeoDT 发表于 2026-8-22 17:18

NONORIRI 发表于 2026-8-22 17:08
比起机械飞升,更像是跟他们信仰的宗教差不多,期待弥赛亚或者耶稣再临,之后就演绎圣经剧本由带着大能力 ...

说起邪教徒,前两年OpenAI内部闹事的时候传的很广的LessWrong不知道现在是什么情况了,按理说搞AI的人这两年应该多了不少,这种哈利波特同人小说“邪教”应该是越来越少人信了吧。

来都来了 发表于 2026-8-22 17:24

中国人 发表于 2026-8-22 17:09
这视觉能力挺一般的,和豆包一样弱智

我看批站有人测过,只是解决了有没有眼睛的问题,实际的能力不高,在17个模型里排第16。

qwased 发表于 2026-8-22 17:27

现在才发现DSH这种webui真的好方便啊……这WSL里面的GUI跑在win里面毛病好多

hugosol 发表于 2026-8-22 17:31

NONORIRI 发表于 2026-8-22 17:16
数学证明现在争取用Lean 形式化证明全自动化。当然数学证明只是其一用来证明能力,最终医药、制造业、军 ...
也对,反正现在对写代码的来说AI的能力是溢出了,但是科研还要追求更高的上限
说起Jeff Dean出走其实我感觉有可能是因为谷歌想把重心转向TPU跟老黄抢生意了,自家模型训练就不给那么多资源了,gemini完全一副放弃挣扎的姿态

NONORIRI 发表于 2026-8-22 17:31

本帖最后由 NONORIRI 于 2026-8-22 17:32 编辑

LeoDT 发表于 2026-8-22 17:18
说起邪教徒,前两年OpenAI内部闹事的时候传的很广的LessWrong不知道现在是什么情况了,按理说搞AI的人这 ...

没太关注,但之前看到过应该还活着且成了调侃硅谷码农的梗之一


qwased 发表于 2026-8-22 17:41

厍无春 发表于 2026-8-22 17:03
直接把它接到 Agent 上,让它帮你装,不就得了。





哈基米的智力真不如DS flash吧,让写个方便使用的脚本他直接把文件炸了,然后搜了半天硬盘没找到安装文件,摆烂了

舞以 发表于 2026-8-22 17:42

哈基米别的不说,快是真的快

论坛助手,iPhone

木水风铃 发表于 2026-8-22 17:58

lactone 发表于 2026-8-22 16:29
谷歌好像暗示ox alpha是gemini

那我就不懂了,这个水平是新的gemini pro那就真拉完了

friends,说不定是之前从谷歌离职那批人搞的?

—— 来自 鹅球 v3.3.96

厍无春 发表于 2026-8-22 17:58

qwased 发表于 2026-8-22 17:41
哈基米的智力真不如DS flash吧,让写个方便使用的脚本他直接把文件炸了,然后搜了半天硬盘没找到安装 ...

哈哈哈,这你别管,你就说快不快吧

tk553521 发表于 2026-8-22 18:01

那么哈基米3.7写文什么水平?

—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha

半江瑟瑟半江红 发表于 2026-8-22 18:03

tk553521 发表于 2026-8-22 18:01
那么哈基米3.7写文什么水平?

—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha ...

狗屎水平,极其极其

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

龙骑士尹志平 发表于 2026-8-22 18:04

tk553521 发表于 2026-8-22 18:01
那么哈基米3.7写文什么水平?

—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha ...

类脑大学生鹿客说大概是最好的那档。也是哈基米传统强项。不玩酒馆,不太清楚。

tk553521 发表于 2026-8-22 18:06

得到了完全相反的回答,算了自己去试一试好了

—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha

秦南心 发表于 2026-8-22 18:10

本帖最后由 秦南心 于 2026-8-22 18:13 编辑

写文能力太主观,鹿客更是纯靠下半身思考的就没必要参考,

就现在AI的能力来说,写文对于看的下去番茄的受众来说有用,

不写文,拿来做资料收集和大纲辅助还是可以的

半江瑟瑟半江红 发表于 2026-8-22 18:11

tk553521 发表于 2026-8-22 18:06
得到了完全相反的回答,算了自己去试一试好了

—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha ...

我是从如果让它做一个长期的工程化的小说续写的角度来评价的。
它的指令遵循能力、上下文记忆力、注意力都非常差。而且非常喜欢用它自己的理解覆盖用户指令
所以拿它写文的话,它就会遵循不住你要求的文风以及大纲和设定

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

qwased 发表于 2026-8-22 18:12

tk553521 发表于 2026-8-22 18:06
得到了完全相反的回答,算了自己去试一试好了

—— 来自 nubia NX809J, Android 16, 鹅球 v3.5.99-alpha ...

文字粗看还可以,内容一坨,可能适合写无脑黄文

来都来了 发表于 2026-8-22 18:13

以前用哈基米玩RPG把我气到了。我:前进,哈基米:前进。我:继续前进,哈基米:继续前进(文字有相应润色,但就这个意思)。我问队友一个问题,哈基米:队友听了我的问题,开始认真地进行思考。(下面没了)

而Deepseek的风格是,我:前进,Deepseek:你们继续往前走,看到了怎样怎样的场景,有着怎样怎样的环境。我问队友一个问题,队友听了后开始根据情况回答我。

qwased 发表于 2026-8-22 18:14

半江瑟瑟半江红 发表于 2026-8-22 18:11
我是从如果让它做一个长期的工程化的小说续写的角度来评价的。
它的指令遵循能力、上下文记忆力、注意力 ...

我拿来提取术语表的时候发现他好像不理解什么叫术语表,备注里面会写得特别详细,DS FLASH就只会写重点
页: 258 259 260 261 262 263 264 265 266 267 [268] 269 270 271 272 273 274 275 276 277
查看完整版本: Ox Alpha被认领,GLM-5.3-Flash上线|大模型讨论专楼