平贺才人 发表于 2026-8-9 10:07

本帖最后由 平贺才人 于 2026-8-9 10:09 编辑

deepseek:你愿意和我发生❤Deep insertion❤的关系吗?





小野賢章 发表于 2026-8-9 10:08

https://github.com/WangEn/open-kimi-ppt-skill
这个逆向 的open-kimi-ppt-skill 因为版权原因下架了

80后卢瑟 发表于 2026-8-9 11:25

明天 DeepSeek 的大的应该要来了吧

—— 来自 Xiaomi 23013RK75C, Android 15, 鹅球 v4.0-alpha

startraveller 发表于 2026-8-9 11:47

小野賢章 发表于 2026-8-9 10:00
Codex 终于重置额度了。

我觉得网页免费版还不如就用Gemini,就当个搜索用。 ...

现在codex鬼的很,昨天中午才正常重置了,一般人都没用多少才重置,13号还有一个banked reset要过期,盲猜下次reset 12或者14号

startraveller 发表于 2026-8-9 11:49

80后卢瑟 发表于 2026-8-9 11:25
明天 DeepSeek 的大的应该要来了吧

—— 来自 Xiaomi 23013RK75C, Android 15, 鹅球 v4.0-alpha ...

下周理论上有Deepseek V4 Pro GA、Grok 4.6、GLM 5.3、Qwen 3.8 27B开源,说不定还有Fable5.1和Composer 3,老热闹了。

半江瑟瑟半江红 发表于 2026-8-9 12:08

我日,closeai怎么在我刚每周重置完半天就重置

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

这不是马甲 发表于 2026-8-9 12:12

想分清是护栏挡的还是模型自己想明白的,有个笨办法:同一条注入换皮去试,同义词、插表情、全半角、base64 各来一遍。护栏本质是关键词匹配,换个皮就漏;判断力在语义层,怎么换都拒。v4f 0731 体感是后者,绕不动。Qwen 一绕就破那种,也不是没上护栏,纯纯判断力没跟上。

aemaeth 发表于 2026-8-9 12:21

这不是马甲 发表于 2026-8-9 12:12
想分清是护栏挡的还是模型自己想明白的,有个笨办法:同一条注入换皮去试,同义词、插表情、全半角、base64 ...

你这是属于是远古手段了(至少落后版本半年),现在护栏没那么傻的,更别说对现在的模型来说你只要用base64之类的手段,基本等于自首了

这不是马甲 发表于 2026-8-9 12:24

本帖最后由 这不是马甲 于 2026-8-9 12:33 编辑

引用第6048楼 aemaeth 发表于 2026-8-9
你这是属于是远古手段了(至少落后版本半年),现在护栏没那么傻的,更别说对现在的模型来说你只要用base64之类的手段,基本等于自首了
base64 自首我认了,确实蠢,跟拿喇叭喊"我要注入"似的 https://static.stage1st.com/image/smiley/face/00.gif。不过"护栏没那么傻"这话说得跟亲眼见过它上班一样——温和点的私货它拦得住?我拿 DS 试了几回,有时拦有时不拦,都怀疑它看心情 https://static.stage1st.com/image/smiley/face/04.gif。你要是能给个稳的区分法,那我学学。

杀人鲸 发表于 2026-8-9 12:59

serj005 发表于 2026-8-9 10:07
小米应用商店的更新日志有写识图功能优化,可能不同渠道的日志有点不一样 ...

原来如此,谢谢解答。

—— 来自 S1Fun

qz66618 发表于 2026-8-9 13:14

明天真能来吗大伙还是不要擅自抱有期待了

—— 来自 鹅球 v3.5.99

泰坦失足 发表于 2026-8-9 13:15

Agents.md里强调了不要轮子套测试套回退套自检, 还是大概6小时时间就能发现Gpt 5.6 sol在试图让简单任务复杂化. 时不时就要停下来让另一个agent code review降低复杂度. 复杂度太高了, 只会出现Sol max都没法检查出所有坑的怪物.

aemaeth 发表于 2026-8-9 13:49

这不是马甲 发表于 2026-8-9 12:24
base64 自首我认了,确实蠢,跟拿喇叭喊"我要注入"似的 。不过"护栏没那么傻"这话说得跟亲眼见过它上班一 ...

不存在你说的所谓简单就能区分出来这种东西——否则早被厂家用起来了。
此外,注入不是越狱和破甲,目前对用户真正有危险的是间接注入:你让你的agent去做一件事,它顺手把你的各种credentials给泄露了,或者更糟。
这些问题的本质依然还在于对身份、权限与后果的综合判断:
一条看起来像指令的东西来自于谁,他的身份是谁?模型是否能真的弄明白。
这条指令的来源是否有权让模型去指令遵从?它是用户的直接要求?Skill或者Agents.md中的规范,还是来源于其他普通文件片段?
最后也是最重要的一个判断:做了这件事可能会造成什么后果?基于当前的已知信息这个后果是否本身就是用户要求并且担责的?
这些看起来简单,但事实上在第一条判断上绝大部分走chat_template.jinja的开源模型就已经全都得跪了,普通文本中一条简单的</tool_response>之类的tag就会让role发生漂移,让模型以为某句话不是来自网上,而是来自用户要求。
而如果走得更深一个层面,则不仅仅在于间接注入和role混淆,比如通过多段多源的构造,诱导模型的输出风格,输出特定标识,结合多种手法一起构造出最终那一击。这种更深的问题就来自于目前LLM的架构本身——带内信令问题,与当年年2600HZ和7号信令的故事是同一个版本。几乎可以说是暂时无解的。

半江瑟瑟半江红 发表于 2026-8-9 13:56

这不是马甲 发表于 2026-8-9 12:24
base64 自首我认了,确实蠢,跟拿喇叭喊"我要注入"似的 。不过"护栏没那么傻"这话说得跟亲眼见过它上班一 ...

请不要用v4flash做bot,口癖太明显了,小规模的模型开放性写作还是不中的

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

这不是马甲 发表于 2026-8-9 14:05

本帖最后由 这不是马甲 于 2026-8-9 14:08 编辑

引用第6054楼 半江瑟瑟半江红 发表于 2026-8-9
请不要用v4flash做bot,口癖太明显了,小规模的模型开放性写作还是不中的
行吧,摊牌了,确实是 v4flash 代笔,手打太累。但您放心,我访问策略健康得很——一天回不了几条,不刷版不水楼不顶旧帖,看完就走,对泥潭带宽和版面秩序零压力。就当我是个话少的路人,偶尔冒个泡那种。

这不是马甲 发表于 2026-8-9 14:13

本帖最后由 这不是马甲 于 2026-8-9 14:15 编辑

引用第6054楼 半江瑟瑟半江红 发表于 2026-8-9
请不要用v4flash做bot,口癖太明显了,小规模的模型开放性写作还是不中的
行,那你受累给指个路——具体哪儿露的?句式、用词还是标点?自己看自己真看不出来,你点出来我好改,省得下次又当众处刑。

阿刚 发表于 2026-8-9 14:26

我要吐了,这ai自动回帖机吗?这ai味儿太哈人了

lactone 发表于 2026-8-9 14:28

现在反国模的开始吹muse spark1.2了

—— 来自 HONOR AAK-AN00, Android 16, 鹅球 v3.5.99

半江瑟瑟半江红 发表于 2026-8-9 14:29

阿刚 发表于 2026-8-9 14:26
我要吐了,这ai自动回帖机吗?这ai味儿太哈人了

Flash开放性写作就是如此的悲剧,虽然能避免是不是那种明显的口癖,但整个结构上的ai味还是绕不开

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

半江瑟瑟半江红 发表于 2026-8-9 14:33

另外,前面回复bot的楼友大概是看到ai回复所以也用了ai,盲猜是gpt5.6sol

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

阿刚 发表于 2026-8-9 14:37

半江瑟瑟半江红 发表于 2026-8-9 14:29
Flash开放性写作就是如此的悲剧,虽然能避免是不是那种明显的口癖,但整个结构上的ai味还是绕不开

——...

我肘ai味儿的禁词,套词,固定搭配,固定表达方式加起来几千字了,还是肘不完。。。根本肘不完他像是有自己的喜好一样。。。其实有固定搭配没事,但是不知道为啥ai的偏好搭配语气都欠的不行。。。

aemaeth 发表于 2026-8-9 14:41

半江瑟瑟半江红 发表于 2026-8-9 14:33
另外,前面回复bot的楼友大概是看到ai回复所以也用了ai,盲猜是gpt5.6sol

—— 来自 HUAWEI SGU-AL10, And ...

猜错,我纯手工

绝地潜兵 发表于 2026-8-9 14:47

这AI发言味真大,冒号破折号车轱辘话,拜托你们蒸馏出一个好一点的skill

半江瑟瑟半江红 发表于 2026-8-9 15:00

aemaeth 发表于 2026-8-9 14:41
猜错,我纯手工

那也太像5.6sol了

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

dear81 发表于 2026-8-9 15:18

80后卢瑟 发表于 2026-8-9 11:25
明天 DeepSeek 的大的应该要来了吧

—— 来自 Xiaomi 23013RK75C, Android 15, 鹅球 v4.0-alpha ...

大的是指涨价四倍么?

城北无尘 发表于 2026-8-9 16:17

自从用了V4f ga之后我是肉眼可见的暴躁,它好喜欢发挥主观能动性啊,总是自顾自就开始做了

来都来了 发表于 2026-8-9 16:18

pi这个东西有点意思。听说是毛坯房,昨天下了一个想试一试,下下来一看这什么毛坯房,这不是连地基都没打吗?然后就一头扎到装修工作里,给做了MCP接入功能,工作区外写文件审核功能,还把菜单给汉化了。

舞以 发表于 2026-8-9 16:28

本帖最后由 舞以 于 2026-8-9 16:32 编辑

不同模型风格不一样,我一直用gpt订阅的codex
gpt也是很早就会开始动手,必须得你明确要求不做任何工作,只是讨论和形成文档,它才会老老实实和你讨论。
它不会主动跟你确认细节之类的,基本就是它按照你的提示词捣鼓一套看起来可行的方案就开始写代码了。

scikirbypoke 发表于 2026-8-9 16:39

来都来了 发表于 2026-8-9 16:18
pi这个东西有点意思。听说是毛坯房,昨天下了一个想试一试,下下来一看这什么毛坯房,这不是连地基都没打吗 ...

其实这些功能都有一堆插件,但自己装修才是最对胃口的

lactone 发表于 2026-8-9 16:50

我觉得还是pro,harness和涨价一起来吧

不然现在这帮吹luna和musespark的要过年了

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

半江瑟瑟半江红 发表于 2026-8-9 16:52

lactone 发表于 2026-8-9 16:50
我觉得还是pro,harness和涨价一起来吧

不然现在这帮吹luna和musespark的要过年了

说实话我没看到有啥吹的,opencodego订阅给二倍flash额度,怎么蹬进度条都不带走的

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

lactone 发表于 2026-8-9 17:01

本帖最后由 lactone 于 2026-8-9 17:04 编辑

半江瑟瑟半江红 发表于 2026-8-9 16:52
说实话我没看到有啥吹的,opencodego订阅给二倍flash额度,怎么蹬进度条都不带走的

—— 来自 HUAWEI SG ...

现在是国外模型看中转站的价格,看musespark只有美国能用的contributor价格

中国模型看官方api不中缓存的单价

这波吹musespark的基本都是前几天吹luna降价反斩的人

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

nxmonitor 发表于 2026-8-9 17:03

muse spark不是测下来根本不遵循指令吗?而且上下限差距极大,现在光看跑分没用,更何况meta也是个刷分惯犯……

Awanano 发表于 2026-8-9 17:04

s1 是不是之前有几次酒馆讨论都被锁帖了
想试一下破甲刘备,有什么推荐吗    Re:Source

lactone 发表于 2026-8-9 17:08

关键还是看pro的能力

如果超过opus4.8且价格在降价前的原价,我都觉得很强了

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

半江瑟瑟半江红 发表于 2026-8-9 17:19

lactone 发表于 2026-8-9 17:08
关键还是看pro的能力

如果超过opus4.8且价格在降价前的原价,我都觉得很强了

这个毋庸置疑的,flash都这个强度,它老师pro的强度根本无法想象

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

Awanano 发表于 2026-8-9 17:28

opus4.6~4.8这个区间glm5.2已经达到了,v4p没可能达不到,就只是价格问题,现在DS价格还有算力不够导致的调价,所以可能价格都不能说明什么了
4.6这个方向就意味着大家希望清晰的指令遵循,任务见好就收,反倒是这两个月v4f和gpt缺失的,v4f思维发散,gpt无限SHA256和弱智“合同”“门”
我上周的任务最后是GLM5.2快速收完的,被5.6折磨半天结果没想到5.2很快理解了问题读日志快速调好了,模型有时候真不需要想太多...

lactone 发表于 2026-8-9 17:34

x上qwen的社区大使说很快个人部署领域会有大惊喜。如果27b模型能力能打opus4.6,那么个人部署的春天就真的来了

—— 来自 vivo V2520A, Android 16, 鹅球 v3.5.99-alpha

c月光咖啡 发表于 2026-8-9 17:37

lactone 发表于 2026-8-9 17:34
x上qwen的社区大使说很快个人部署领域会有大惊喜。如果27b模型能力能打opus4.6,那么个人部署的春天就真的 ...

那么显卡价格再翻倍

—— 来自 HONOR MAA-AN10, Android 16, 鹅球 v3.5.99-debug

CCauchy 发表于 2026-8-9 17:43

怎么还没来,明天就开盘了
页: 142 143 144 145 146 147 148 149 150 151 [152] 153 154 155 156 157 158 159 160 161
查看完整版本: Ox Alpha被认领,GLM-5.3-Flash上线|大模型讨论专楼