nxmonitor 发表于 2026-7-9 20:03

https://www.bilibili.com/video/BV1n7MH6SEeA
还有个后室和恐怖游戏

nxmonitor 发表于 2026-7-9 20:04

本帖最后由 nxmonitor 于 2026-7-9 20:08 编辑

下面的评论已经开始怀疑用了Fable5,确实我也有点奇怪……但是A÷的模型不可能不联网搜索的,不叫它联网都偷偷联网搜索,DS的模型确实是没原生联网搜索。

chenyedgg 发表于 2026-7-9 20:09

“灰度”到的这个人就是DS自己人吧




nxmonitor 发表于 2026-7-9 20:10

chenyedgg 发表于 2026-7-9 20:09
“灰度”到的这个人就是DS自己人吧

我比较怀疑是草台导致手机填错了……

Promeus 发表于 2026-7-9 20:21

nxmonitor 发表于 2026-7-9 20:04
下面的评论已经开始怀疑用了Fable5,确实我也有点奇怪……但是A÷的模型不可能不联网搜索的,不叫它联网都 ...

而且fable5是多模态,审美比ds强很多

nxmonitor 发表于 2026-7-9 20:32

本帖最后由 nxmonitor 于 2026-7-9 20:41 编辑

Promeus 发表于 2026-7-9 20:21
而且fable5是多模态,审美比ds强很多
对的,多模态模型能自己看一下到底好不好,这种像素风格确实表明没多模态,至于GLM5.2呢看之前的例子也差一些

nxmonitor 发表于 2026-7-9 20:36

本帖最后由 nxmonitor 于 2026-7-9 20:39 编辑

这几个例子里最厉害的还是那个CSGO,这个模型里不知道炼丹前收集药材的人到底多喜欢CS……

noneoneone 发表于 2026-7-9 20:45

不是,我以为群星,魔兽什么的还是在说文风呢。
结果是一句话生成游戏?我都没敢往那边想。

Promeus 发表于 2026-7-9 20:58

noneoneone 发表于 2026-7-9 20:45
不是,我以为群星,魔兽什么的还是在说文风呢。
结果是一句话生成游戏?我都没敢往那边想。 ...

因为太明显了,预览版mc直接进不去或者一片黑,疑似正式版直接整出来跟4.8掰手腕的了

秦南心 发表于 2026-7-9 21:02

Promeus 发表于 2026-7-9 20:21
而且fable5是多模态,审美比ds强很多

还好吧,我感觉后室那个移动和摄像头做的就很好

nxmonitor 发表于 2026-7-9 21:12

本帖最后由 nxmonitor 于 2026-7-9 21:15 编辑

从那个马里奥赛车第38秒的的opencode页面看,怎么都像是DeepSeek,计费也只有几美分,opencode这个页面能改到什么程度?

无尽的牙刷 发表于 2026-7-9 21:26

显然deepseek不可能掏出一个出的比glm5.2晚却还不如glm5.2的模型,这次难得早早定了发布时间,也说明性能已经达到了预期

Promeus 发表于 2026-7-9 21:35

另一种可能就是把一个还没发布的4.1误给到up了

Lorraine_Kinney 发表于 2026-7-9 21:35

单靠fable也只是堆几何图形
这是我上次用fable+image2,一句话做的文字冒险小游戏
https://replay2023-hc8k.vercel.app/

nxmonitor 发表于 2026-7-9 21:52

试试看把pro的思考强度调整成high,或许能灰度到新模型上

chenyedgg 发表于 2026-7-9 21:55

看时间qwen 3.8应该也快了,月中感觉会ds正式版 VS gemini 3.5 pro VS qwen 3.8

舞以 发表于 2026-7-9 21:56

我现在对一切“模型特别本质带来的特别能力”都感到怀疑
gpt5.5同样是多模态,前端的“审美”也一直被吐槽不如claude。
我觉得更像是claude在这方面专门做了训练,然后包装成“claude更懂美”来给社区灌认知。

nxmonitor 发表于 2026-7-9 22:02

https://www.bilibili.com/video/BV14WMn6dE3y
这个roll出来的后室更夸张了,比前面的例子都夸张……

Promeus 发表于 2026-7-9 22:09

nxmonitor 发表于 2026-7-9 22:02
https://www.bilibili.com/video/BV14WMn6dE3y
这个roll出来的后室更夸张了,比前面的例子都夸张…… ...

这……

nxmonitor 发表于 2026-7-9 22:12

Promeus 发表于 2026-7-9 22:09
这……
up开始看到原up的后室视频,觉得有问题自己roll了一个比原来还夸张……

舞以 发表于 2026-7-9 22:23

梁圣(看起来可以维持这个称号了)啥时候正式放出原子弹,让大伙都瘫坐在椅子上?

半江瑟瑟半江红 发表于 2026-7-9 22:24

opencode go这个月怎么这么不耐用,用D指导pro单纯接入rikkahub,每次对话都得1美元额度,上个月还挺耐用的啊,计费标准改了?

—— 来自 HUAWEI SGU-AL10, Android 12, 鹅球 v3.5.99

Promeus 发表于 2026-7-9 22:24

舞以 发表于 2026-7-9 22:23
梁圣(看起来可以维持这个称号了)啥时候正式放出原子弹,让大伙都瘫坐在椅子上? ...

坊间传闻下周一

德尔惠净水器 发表于 2026-7-9 22:37

已经迫不急待等待正式版了

scikirbypoke 发表于 2026-7-9 22:41

半江瑟瑟半江红 发表于 2026-7-9 22:24
opencode go这个月怎么这么不耐用,用D指导pro单纯接入rikkahub,每次对话都得1美元额度,上个月还挺耐用的 ...

我在opencode已经用不动了,thinking就是不弹出来
已经断了续费用中转站去了

keamedes 发表于 2026-7-9 22:47

舞以 发表于 2026-7-9 21:56
我现在对一切“模型特别本质带来的特别能力”都感到怀疑
gpt5.5同样是多模态,前端的“审美”也一直被吐槽 ...

本来就是啊,预训练无非堆参数规模和数据量,普通人的任务根本压不到当前 top-tier 模型的本质智能上限的;现在不同模型给人的体感的区别都是后训练/RL 的不同取向,所以迭代可以这么快,而且每次都有人吐槽不如上一个版本

keamedes 发表于 2026-7-9 22:48

所以别看 glm 5.2 写代码这么溜,其实非常偏科(跟它讨论哲学问题特别明显),因为基座是上一代模型,只是 rl 特化做得特别好

Promeus 发表于 2026-7-9 23:00

up的神力好像被梁圣回收了

舞以 发表于 2026-7-9 23:12

keamedes 发表于 2026-7-9 22:48
所以别看 glm 5.2 写代码这么溜,其实非常偏科(跟它讨论哲学问题特别明显),因为基座是上一代模型,只是...

你看我在这个楼的发言记录就知道我的看法了
之前对llm乃至llm为基础的agi的幻想是一个智慧的哲人,现在的期望已经劣化成一个个超大号自动补全了。
每次版本更新就是不服跑个分,塞进各种coding harness里面一通测试。

→熙← 发表于 2026-7-9 23:29

恶意拉高期待,正式版什么时候发布

杀人鲸 发表于 2026-7-9 23:39

→熙← 发表于 2026-7-9 23:29
恶意拉高期待,正式版什么时候发布

最多还有十一天,慢慢等吧!

绝地潜兵 发表于 2026-7-9 23:41

AGI变成了代码补全助手,LLM这条路也是快走到头了

GJRstone 发表于 2026-7-9 23:52

现在有没有蒸馏自己自然人知识形成知识库的应用,我现在工作很不开心,想把自己已有的技能和岗位的知识蒸馏成一套知识库提交给同事调用,自己再去学点东西。

类似grill-me的skill可以让我不断对话定义场景打字输出,再由AI把上下文总结出来方法论也行。看看AI怎么组织这个文档,看看这些AI产出对我自己有没有启发性的影响。

chenyedgg 发表于 2026-7-9 23:53

绝地潜兵 发表于 2026-7-9 23:41
AGI变成了代码补全助手,LLM这条路也是快走到头了
不管什么东西都要条件or结构足够了才能产生,LLM够不到AGI一直都有大佬在说的,

只不过老马奥特曼A/一直在烂炒而已




IIIIIlllllIIIII 发表于 2026-7-10 00:14


最简单的 7年前的alpha star现在还是sc2最高的山
算力进步了7倍吧
drl+mml才是正道 神谕机不可能


— from motorola XT2603-1, Android 16, S1 Next Goose v3.5.99

lowezack 发表于 2026-7-10 07:40

代码能力是大部分行业的基础,各种办公自动化都建立在会写代码的基础上。

操作专业软件也要会写代码的,代码能力一坨这模型就废了

小川彩 发表于 2026-7-10 08:30

【国产之光再进化!DeepSeek V4正式版简测,附带横评Gemini3.5 Pro / Grok4.5等-哔哩哔哩】 https://b23.tv/oQXMLkN

真有明确的灰测资格吗….

论坛助手,iPhone

舞以 发表于 2026-7-10 10:06

试了下奥特曼仙贝最新的5.6,用codex coding最大的感觉是限额消耗更高了
app聊天的时候进步感觉还是有的,5.6sol和5.5之间算是稳定进步。
就看梁圣的原子弹啥时候炸了,opencode的glm和codex的限额都有点不够用的感觉

论坛助手,iPhone

nxmonitor 发表于 2026-7-10 10:28

要是真的确实是原子弹,漏油要是有智普和minimax股票的先避一下比较合适

很久就在那边l 发表于 2026-7-10 10:43

希望是虚晃一枪上线再打折吧,api忙时价格翻倍后即使有gpt5.5的性能也很难竞争过openai的套餐,5.6的中间档就有5.5的水平还比5.5便宜的多
页: 45 46 47 48 49 50 51 52 53 54 [55] 56 57 58 59 60 61 62 63 64
查看完整版本: DeepSeek V4-Flash-Vision-Exp 上线!多模态来啦|大模型讨论专楼