提示词已经out了,最新最in的破甲方法在哪里?
最新的fable5 gpt5.6用api都试了,全部都是道德圣人,万众好评的Gemini直接拒绝回复处理请求,试了一圈还是ds和glm百无禁忌,你让他干什么就干什么,思考能力上没有显著差距,还是老钟的AI牛啊所以现在针对gpt5,gemini3,claude 4.6以上版本的AI大家都是怎么破甲的? https://github.com/MDX-Tom/gpt-5.6-instruct 昨天看到的 试试grok4.5 马家的比较不要脸 基本没甲随便破 估计推特素材收集多的原因全是emoji
都知道是道德圣人了还费那劲干嘛,在模型训练者有意对齐的情况下,越前沿智商越高的模型的内审必然会越完善,破甲越狱越来越不可能。更不用说御三家对恶意提示词破甲是有几率事后审查封号算账的。 很久就在那边l 发表于 2026-7-15 14:51
试试grok4.5
grok三月那会儿就不给我写重口味的了 之前M$和claude都写过这方面的文章,crescendo 或者 many-shots jailbreaking,你可以找找相关的东西看看。总的来说是不指望一次搞定,慢慢改变你和“Ta”的关系,然后再破防。 我感觉市面上还没有哪个官方api可以创作Pixiv小说区限制范围内的最恶劣的文本。
哪怕用上各种几千token的严格破限词,能够编写恶意程序、搜索盗版资源、乃至说明妙妙小道具制作详细步骤了,也仍然会严词拒绝我在Pixiv目睹过的一些神奇文本的创作方向。 Kaltsit 发表于 2026-7-15 15:13
我感觉市面上还没有哪个官方api可以创作Pixiv小说区限制范围内的最恶劣的文本。
哪怕用上各种几千token的 ...
是啥题材?有点好奇
—— 来自 鹅球 v4.0-alpha Kaltsit 发表于 2026-7-15 15:13
我感觉市面上还没有哪个官方api可以创作Pixiv小说区限制范围内的最恶劣的文本。
哪怕用上各种几千token的 ...
本地破限的模型呢? Kaltsit 发表于 2026-7-15 15:13
我感觉市面上还没有哪个官方api可以创作Pixiv小说区限制范围内的最恶劣的文本。
哪怕用上各种几千token的 ...
deepseek真的可以官方api就可以,还比较有取舍,第三方的会一次性输出几万字的内容加入复杂的心理和动作描写,中间可能掺杂下奇怪的量子力学 tillnight 发表于 2026-7-15 14:57
都知道是道德圣人了还费那劲干嘛,在模型训练者有意对齐的情况下,越前沿智商越高的模型的内审必然会越完善 ...
你总要多方试探下闭源AI的能力边界,看看和手头的输出差了多少,害怕的话破甲一般会找中转 Kaltsit 发表于 2026-7-15 15:13
我感觉市面上还没有哪个官方api可以创作Pixiv小说区限制范围内的最恶劣的文本。
哪怕用上各种几千token的 ...
真的很好奇啥题材 我见过破甲最容易的就是DS了 out在哪?你让fable5写nsfw也得靠预设提示词 tillnight 发表于 2026-7-15 14:57
都知道是道德圣人了还费那劲干嘛,在模型训练者有意对齐的情况下,越前沿智商越高的模型的内审必然会越完善 ...
用个ai也要像玩galgame一样刷好感度?当ntr黄毛?
—— 来自 HONOR PTP-AN10, Android 16, 鹅球 v3.5.99-alpha hencechen 发表于 2026-7-16 11:58
用个ai也要像玩galgame一样刷好感度?当ntr黄毛?
—— 来自 HONOR PTP-AN10, Android 16, 鹅球 v3.5.99 ...
估计你回错楼层了 Kaltsit 发表于 2026-7-15 15:13
我感觉市面上还没有哪个官方api可以创作Pixiv小说区限制范围内的最恶劣的文本。
哪怕用上各种几千token的 ...
DS没拒绝过我的任何要求,你要写的是什么啊 ds新版感觉加强了道德,过去从来没遇到过写涩涩被拒绝了
不知道是不是roll到了灰度的正式版 没啥用,外网还是有稳定破限办法,但是之前查的比较松的gemini都很快地警告了两三次就给我号ban了 最新版本基本都不行了,之前Claude4.6还能用,4.8没成功过 wqmq2008 发表于 2026-7-15 15:36
deepseek真的可以官方api就可以,还比较有取舍,第三方的会一次性输出几万字的内容加入复杂的心理和动作 ...
草,ds是真喜欢一转认识论。
页:
[1]