omnitoken 发表于 2026-8-1 11:16
感觉写文能力很一般,丢了5万字的小说进去让他按照指定人设改写前两章大概5000字,很快就出错了(提前跳到 ...
知识库,剧情卡,角色卡,系统提示词
结合起来就行啦
—— 来自 HUAWEI ALN-AL10, Android 12, 鹅球 v3.5.99
绝地潜兵 发表于 2026-8-1 11:19
写作没办法,参数太小了,激活不了什么丰富的语料
只是黑丝变白丝,加上戴眼镜的设定他也做不到逐字逐句改写。。。
—— 来自 鹅球 v3.3.96
omnitoken 发表于 2026-8-1 11:22
只是黑丝变白丝,加上戴眼镜的设定他也做不到逐字逐句改写。。。
写作还比不上GLM4.7,后者遵循指令超强,这次还是编程特别优化
绝地潜兵 发表于 2026-8-1 11:23
写作还比不上GLM4.7,后者遵循指令超强,这次还是编程特别优化
编程也需要指令遵循吧
neptunehs 发表于 2026-8-1 10:36
我用的oc+trellis 换pi他明显不认我的trellis的之前的内容 怎么办比较好
—— 来自 OnePlus PJX110, And ...
感觉trellis对pi的支持不太好 Re:Source
官方不是说了,要用codex吗
nxmonitor 发表于 2026-8-1 10:13
竞技场盲测代码现在是这个位置的,至于性价比就不说了,还看到两个DGX本地部署比API强的说法,测下来实际 ...
看神烦老狗的评测,high跟max的差距还是蛮大的
这次主要优化的是agent能力,别忘了
论坛助手,iPhone
我感觉没有多模态的模型不适合写前端 测了也没啥意义
实战了一轮复杂任务, 自动触发了superpower
真正写代码也就1/4的时间, 后面大部分时间都是在审查和测试,一轮接一轮的, 看得都惊了
token消耗5000w+, 2.68r, 全任务56min, 自动提交了18个comit, 结果挺好,问题确实解决了
感觉有点浪费token了
GLM4.7有32B激活呢
V4F只有13B,不是一个量级的,
小模型经过累积的训练后减少走错误路径的可能,增加对正确规律的掌握,但是大参数模型本身的优势不会变
→熙← 发表于 2026-8-1 11:56
实战了一轮复杂任务, 自动触发了superpower
真正写代码也就1/4的时间, 后面大部分时间都是在审查和测试,一 ...
oc+trellis也是 一轮接一轮check 还特别长 不过效果还行
—— 来自 OnePlus PJX110, Android 14, 鹅球 v3.5.99
→熙← 发表于 2026-8-1 11:56
实战了一轮复杂任务, 自动触发了superpower
真正写代码也就1/4的时间, 后面大部分时间都是在审查和测试,一 ...
superpowers用啥模型都浪费token
你们怎么都说写文有问题,我昨天和他对话社会科学问题,感觉比pro强得多
—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99
Rowen233 发表于 2026-8-1 11:53
我感觉没有多模态的模型不适合写前端 测了也没啥意义
怎么可能,写代码根本不需要多模态,前端代码的语料又不是多模态的
无非是自动调试麻烦点,但也可以用playwright来解决
多模态目前来看唯一显著的好处就是你可以直接截图给它
不用自己复制或者转文字,就这点好处,可能还有部分前端工作可以让它截图验证?
但不是所有项目都可以。
论坛助手,iPhone
pro快来吧, flash反复调试消耗的token很多
很可能反而更贵了
lactone 发表于 2026-8-1 12:36
你们怎么都说写文有问题,我昨天和他对话社会科学问题,感觉比pro强得多
—— 来自 HONOR AAK-AN00, Andro ...
自然对话是自然对话,写作是写作
—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
有没有一点可能梁圣的水货N卡到位,这次pro能联网了
不可能不可能,pro灰测这水平的给开联网和上传文件,全世界都要嫖死梁子
八月初和八月上旬区别挺大的吧 Re:Source
本帖最后由 nxmonitor 于 2026-8-1 14:00 编辑
先把harness拿出来吧,现在flash在哪个里面都膈应,codex和opencode有时候会一团糟,PI的skill又太简单了
本帖最后由 lowezack 于 2026-8-1 14:10 编辑
舞以 发表于 2026-8-1 00:33
reasonix的这个界面看着真的解压
这种缓存命中率不是正常的工作流程啊,要不然就是工具调用效率太低,不是啥好事,也未必省钱。
WebSearch是个正经agent都有的tool(好吧Pi没有要自己扩展),不要纠结网页版联不联网啦
我感觉这个最强的地方是debug能力
—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha
lowezack 发表于 2026-8-1 14:07
这种缓存命中率不是正常的工作流程啊,要不然就是工具调用效率太低,不是啥好事,也未必省钱。
...
这是reasonix的正常效果
论坛助手,iPhone
舞以 发表于 2026-8-1 14:52
这是reasonix的正常效果
论坛助手,iPhone
有兴趣可以让ai自己分析下,这么高的缓存命中率是有问题的
lowezack 发表于 2026-8-1 14:58
有兴趣可以让ai自己分析下,这么高的缓存命中率是有问题的
你说得对
论坛助手,iPhone
一个任务跑了4个小时,思维链语气都暴躁了
綺々羅々ヴィヴ 发表于 2026-8-1 13:47
有没有一点可能梁圣的水货N卡到位,这次pro能联网了
水货N卡还要拿来训练,怎么可能给你白嫖
搞点昇腾和老n卡卖api差不多了,也合规。
水货卡肯定是拿去训练了
綺々羅々ヴィヴ 发表于 2026-8-1 13:47
有没有一点可能梁圣的水货N卡到位,这次pro能联网了
接api不是一直可以吗
本帖最后由 舞以 于 2026-8-1 15:38 编辑
网页版pro不给联网搜索估计是为了防止中转站反代奇技淫巧的吧
之前都在吹梁圣虽然不重视c端,但是app和网页版也免费给最强模型用,而且不限量。
但是这次flash更新也是打破了惯例
nxmonitor 发表于 2026-8-1 13:57
先把harness拿出来吧,现在flash在哪个里面都膈应,codex和opencode有时候会一团糟,PI的skill又太简单了 ...
flash在codex下会有什么问题,可以具体说说吗?
舞以 发表于 2026-8-1 01:29
cherrystudio
我隐约记得版区里好像过去有坛友提到过CherryStudio接DS的一个问题
大意是使用CherryStudio的话需要自己写一些其他常见工具默认提供的底层提示词
不知道现在CherryStudio是否还有这类问题?
网页端估计会更新,但是现在应该是忙的飞起,连pro具体上线时间都不敢保证
pure_liquid 发表于 2026-8-1 15:55
我隐约记得版区里好像过去有坛友提到过CherryStudio接DS的一个问题
大意是使用CherryStudio的话需要自己 ...
不知道了漏油,我好久没用过了,我的感觉是桌面端的几个壳都不太行,CherryStudio是矮子里拔高个
论坛助手,iPhone
太爽了,之前用pro办公让它自己执行要么出错陷进死胡同出不来,要么误删代码还没备份,而且上下文一长就降智必须新开窗口,这两天换正式版flash,终于能正常完成任务,遇到问题会自己解决,最多提点几句,最后都能解决,而且上下文拉到1m都不降智。终于不用每天上班和ai吵架了
论坛助手,iPhone
还一种可能是现在pro没更新,快速模式比专家模式更聪明的话挺难绷的
论坛助手,iPhone
舞以 发表于 2026-8-1 15:35
网页版pro不给联网搜索估计是为了防止中转站反代奇技淫巧的吧
之前都在吹梁圣虽然不重视c端,但是app和网 ...
不接api跑agent应该无差别吧