overflowal 发表于 2026-7-13 23:24

Promeus 发表于 2026-7-13 23:15
有人测了下deepswe说是只来得及做了19题,86%得分率,不知道横向对比如何

做完才有意义。    Re:Source

御坂MKII 发表于 2026-7-13 23:25

Promeus 发表于 2026-7-13 23:15
有人测了下deepswe说是只来得及做了19题,86%得分率,不知道横向对比如何

这个结果肯定没法用,因为现状是这样:总数 113 tasks

ycjiang1337 发表于 2026-7-14 01:31

本帖最后由 ycjiang1337 于 2026-7-14 01:43 编辑

一般市民 发表于 2026-7-13 18:54
不会背上政治包袱加上很厉害的安全对齐吧?

冷知识。安全对齐损害模型性能现在是业界共识,国家战略的目标是追上美国,在模型性能仍然落后的前提下不可能允许监管拖后腿。换句话说过度安全对齐反而是政治不正确

—— 来自 HUAWEI SGT-AL50, Android 12, 鹅球 v3.4.97-alpha

ycjiang1337 发表于 2026-7-14 01:32

nxmonitor 发表于 2026-7-13 19:52
不知道前几天那个路透社独家说限制国外访问会不会是真的,不过这个和token出海的想法是完全不一致的吧? ...

那个新闻的源头是最高法院的一场纯司法研讨会,其它的部分都是路透社自己编的。AI领域路透社跟三流小报没区别

—— 来自 HUAWEI SGT-AL50, Android 12, 鹅球 v3.4.97-alpha

不见不散 发表于 2026-7-14 08:46

onezer0618 发表于 2026-7-14 09:25

多模态有说啥时候有不?现在用Hermes,识图还接的qwen3.7

酱油拌饭s 发表于 2026-7-14 10:21

半江瑟瑟半江红 发表于 2026-7-9 16:10
给llm约束太多它就是会往最不会出错的方向生成,也就是人味儿淡了,反正cherrystudio自带claw,上文风ski ...

大佬求问,cherrystudio的智能体跟知识库不能同时使用啊,咋才能一边用skill一边调用知识库
另外求问大佬有什么推荐的skill嘛

半江瑟瑟半江红 发表于 2026-7-14 10:58

不见不散 发表于 2026-7-14 08:46
rikkahub就是个纯聊天软件吗?我看它里面居然还有工作区、SKILL、MCP这些设置,看上去好像是一个工作软件 ...

一开始就是个纯聊天的客户端,后来越加功能越多
不过我homo next,设置了工作区安装了rootfs也不能用

—— 来自 HUAWEI SGU-AL10, Android 12, 鹅球 v3.5.99

半江瑟瑟半江红 发表于 2026-7-14 11:04

酱油拌饭s 发表于 2026-7-14 10:21
大佬求问,cherrystudio的智能体跟知识库不能同时使用啊,咋才能一边用skill一边调用知识库
另外求问大佬 ...

cherrystudio那个知识库也就是给你跳转个知识库网站设置mcp链接,所以直接自己注册一个Dify,然后在智能体里加一个mcp就行了,Dify免费也可以用,就是每分钟请求数量和单次上传数量都受限

—— 来自 HUAWEI SGU-AL10, Android 12, 鹅球 v3.5.99

chenyedgg 发表于 2026-7-14 11:09

nxmonitor 发表于 2026-7-13 19:53
https://www.bilibili.com/video/BV1ofNy6TEkD/?share_source=copy_web&vd_source=ecdb3f81e5dd2b1c9f6b4ec ...



感觉挺微妙的,节选点:

喉结(并没有喉结)
不是,那是
眼神纯净的像是在欣赏艺术品











拯救节操希灵宅 发表于 2026-7-14 11:18

最近几天v4flash都开始流口水了,再不发正式版评级就要下降到牢梁了

ymm1030 发表于 2026-7-14 11:26

本帖最后由 ymm1030 于 2026-7-14 11:33 编辑

chenyedgg 发表于 2026-7-14 11:09
感觉挺微妙的,节选点:

喉结(并没有喉结)

这不还是区嘛
哦B站的,那用的还是现在的API,B站说的灰测当放屁就行了。。。。我还以为是上面说的aigc传说中的匿名模型。

不见不散 发表于 2026-7-14 12:05

不见不散 发表于 2026-7-14 12:07

绝地潜兵 发表于 2026-7-14 12:29

不见不散 发表于 2026-7-14 12:07
Cherry是可以把本地的文库进行向量化的,我之前搞过。想不花钱的话,可以申请一个硅基流动的API,专门用 ...

cherry的agent不能直接调用向量知识库吧,没看到有这个选项,助手才有,我用的是白山智算的嵌入模型

半江瑟瑟半江红 发表于 2026-7-14 12:34

不见不散 发表于 2026-7-14 12:07
Cherry是可以把本地的文库进行向量化的,我之前搞过。想不花钱的话,可以申请一个硅基流动的API,专门用 ...

是可以。但cherry自己搞的知识库在它自己claw里调不了

风速前进mo 发表于 2026-7-14 12:34

DeepSeek现在真的是区,用pi跑实验,经常没理解我意思就去改代码,指令只听一半,上下文没到1m就注意力涣散,希望正式版能好点吧

论坛助手,iPhone

不见不散 发表于 2026-7-14 12:45

不见不散 发表于 2026-7-14 12:47

风速前进mo 发表于 2026-7-14 12:55

不见不散 发表于 2026-7-14 12:47
你用的什么Agent?有的Agent可以敲定计划细节,然后再让它再写代码,不会刚说了两句话就开始急吼吼地写, ...

就用的pi,之前有用grill-me,最近这台设备没装这个skill,但就算不装对比之前还是有明显降智

论坛助手,iPhone

Promeus 发表于 2026-7-14 13:03

问了一个疑似有灰测的哥们用鬼佬测4.8和fable的提示词测了下,答复是同提示词略强于4.8(画面丰富一点,运行没有本质区别),不如fable

hugosol 发表于 2026-7-14 13:33

风速前进mo 发表于 2026-7-14 12:55
就用的pi,之前有用grill-me,最近这台设备没装这个skill,但就算不装对比之前还是有明显降智

论坛助手, ...

pi起手先做个plan模式呀,如果不跟模型说先做计划,它就是会不跟你确认直接上手改的,这个就跟一句话编程没啥区别了

mitzvah 发表于 2026-7-14 13:41

Promeus 发表于 2026-7-14 13:03
问了一个疑似有灰测的哥们用鬼佬测4.8和fable的提示词测了下,答复是同提示词略强于4.8(画面丰富一点,运行 ...

又不是多模态模型不如3d不如太正常了,看网络安全之类的测试才能见真章

当光停止 发表于 2026-7-14 13:49

Promeus 发表于 2026-7-14 13:03
问了一个疑似有灰测的哥们用鬼佬测4.8和fable的提示词测了下,答复是同提示词略强于4.8(画面丰富一点,运行 ...

有人算成本,24小时跑fable得11万刀了。
pro要真4.8水平,就算翻倍也才几个钱。(虽然我觉得4.8在写文、编程分别不如a/自己的4.6和4.7)

Promeus 发表于 2026-7-14 14:00

mitzvah 发表于 2026-7-14 13:41
又不是多模态模型不如3d不如太正常了,看网络安全之类的测试才能见真章

倒不是模型,是和4.8一样只能生成不能操作的成品

mitzvah 发表于 2026-7-14 14:05

Promeus 发表于 2026-7-14 14:00
倒不是模型,是和4.8一样只能生成不能操作的成品

这种一句话的许愿机生产出来的不都是玩具代码,我用glm5.2测试一句话仿造一个openra指明让它去查官方项目仓库,它去查了,结果把数据文件读了一遍回来告诉我已经看完代码了,框框写了个建立在类继承的玩意


这测试下来我就明白了,没有足够约束,这些llm当许愿机使只能做大粪,fable也不会好到哪里去

overflowal 发表于 2026-7-14 14:08

Promeus 发表于 2026-7-14 13:03
问了一个疑似有灰测的哥们用鬼佬测4.8和fable的提示词测了下,答复是同提示词略强于4.8(画面丰富一点,运行 ...

这些测试都没啥太多意义。。跑些benchmark比较实在

c月光咖啡 发表于 2026-7-14 14:08

风速前进mo 发表于 2026-7-14 12:34
DeepSeek现在真的是区,用pi跑实验,经常没理解我意思就去改代码,指令只听一半,上下文没到1m就注意力涣散 ...

你可以用plan模式确认细节后再build

—— 来自 HONOR MAA-AN10, Android 16, 鹅球 v3.5.99-debug

半江瑟瑟半江红 发表于 2026-7-14 16:34

今天点开codex又送了一次重置额度,有点不好意思骂奥特曼了

—— 来自 HUAWEI SGU-AL10, Android 12, 鹅球 v3.5.99

御坂MKII 发表于 2026-7-14 17:07

Promeus 发表于 2026-7-14 13:03
问了一个疑似有灰测的哥们用鬼佬测4.8和fable的提示词测了下,答复是同提示词略强于4.8(画面丰富一点,运行 ...

这些东西就图一乐啊,gpt 前端一直是一坨也不影响实际能力

水風船 发表于 2026-7-14 22:13

本帖最后由 水風船 于 2026-7-14 22:48 编辑

问问你们ai写文都用什么skill啊,正常向不是18x的,还是直接用聊天写

舞以 发表于 2026-7-14 22:48

codex这无限续杯的,要是能把额度蹬完,真比ds api便宜吧

冤枉呐 发表于 2026-7-15 00:36

酱油拌饭s 发表于 2026-7-14 10:21
大佬求问,cherrystudio的智能体跟知识库不能同时使用啊,咋才能一边用skill一边调用知识库
另外求问大佬 ...

mcp服务调skill就行了

—— 来自 HUAWEI ALN-AL10, Android 12, 鹅球 v3.5.99

冤枉呐 发表于 2026-7-15 00:41

水風船 发表于 2026-7-14 22:13
问问你们ai写文都用什么skill啊,正常向不是18x的,还是直接用聊天写

nuwa抓想看的作家文风
不过我现在就用英文写,同一个提示词英文能去味,中文版本提示词就不行了

—— 来自 HUAWEI ALN-AL10, Android 12, 鹅球 v3.5.99

lactone 发表于 2026-7-15 01:52

【疑似deepseekv4正式版灰度   我的世界+无人深空(调小声音)-哔哩哔哩】 https://b23.tv/2bHrbrP

如果正式版有这个水平,我只能说大的要来了

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

Rai.Z 发表于 2026-7-15 01:57

api能多模态就谢天谢地了

舞以 发表于 2026-7-15 02:40

多模态不可能的啦,v5看能不能搞个原生多模态的d老师了

舞以 发表于 2026-7-15 04:50

刚刚跑了30%的周限额,codex又重置了
tibo也是北美太阳了

tonyunreal 发表于 2026-7-15 05:02

lactone 发表于 2026-7-15 01:52
【疑似deepseekv4正式版灰度   我的世界+无人深空(调小声音)-哔哩哔哩】 https://b23.tv/2bHrbrP

如果正 ...


这对吗,这不对吧

—— 来自 Xiaomi 25060RK16C, Android 16, 鹅球 v3.5.99

wandeeees 发表于 2026-7-15 05:10

lactone 发表于 2026-7-15 01:52
【疑似deepseekv4正式版灰度   我的世界+无人深空(调小声音)-哔哩哔哩】 https://b23.tv/2bHrbrP

如果正 ...

这个效果太变态了这就是为什么工作时间价格翻倍吗?不行我得先充点钱进去,别到时候直接把充值停了

—— 来自 Xiaomi 2602BRT18C, Android 16上的 S1Next-鹅版 v2.1.2
页: 49 50 51 52 53 54 55 56 57 58 [59] 60 61 62 63 64 65 66 67 68
查看完整版本: DeepSeek V4-Flash-Vision-Exp 上线!多模态来啦|大模型讨论专楼