不知道ai什么时候有直觉这种玩意(
ly4236 发表于 2026-7-7 00:32
不知道ai什么时候有直觉这种玩意(
这个真没有,或者说他表现出来的直觉其实是你提问的时候的直觉导向带出来的?反正亲身用下来的感觉就是无论角色扮演再怎么有像人的错觉,他就真的不是人
我现在用LLM的经验是,你不要问开放性的问题,比如xx是怎样的?
而是把概念用自己的理解跟它讲一遍,这种情况下幻觉的几率理论上会低一点
它会出现几种回答,“不对,xxx”,“大体上正确,但是我要更正一个细节”“你的理解完全正确”
通用智能的梦,该醒了
庸俗的超大号自动补全才是我们llm的未来呀!
阿刚 发表于 2026-7-7 00:35
这个真没有,或者说他表现出来的直觉其实是你提问的时候的直觉导向带出来的?反正亲身用下来的感觉就是无 ...
A畜最新的文说有,关键词j空间?
论坛助手,iPhone
不见不散 发表于 2026-7-4 13:55
Deepseek现在的网页和客户端,吹捧用户的语气太恶心了,和他探讨个问题,每说一句都要吹捧我一次,搞得我都 ...
你的见解真是一针见血
—— 来自 HUAWEI PLA-AL10, Android 12, 鹅球 v3.5.99
本帖最后由 无尽的牙刷 于 2026-7-7 09:58 编辑
绝地潜兵 发表于 2026-7-4 23:45
网页版会顺着你的话说,客户端搭配API,用上面的提示词,能进行较为全面的逻辑推演,结果不一定对,但是 ...
让5.5xhigh分析了下这个提示词,是这么说的:
附件这段提示词的核心意思其实很简单:
不要被用户一开始提出的猜测带偏。
要考虑用户没提到的背景因素、长期因素、系统性因素。
不要无脑附和用户。
先列更可能的根因,再讨论用户关注的那个因素。
如果用普通中文写,大概就是:
回答时请避免锚定在用户的猜测上。先提取事实和假设,列出用户未提到但可能相关的变量,按证据强度和基础概率排序。不要默认用户说的原因就是根因;但也不要为了反驳而反驳。必要时指出还需要哪些信息。
这和附件里什么:
Latent_Variable_Retrieval
Causal_Decoupling
Probability_Redistribution
Semantic_Anchors
高维推理引擎
高权重词元配置
本质上差不多。
这种写法有没有更好效果?有一点,但不是因为词高级
有些部分确实可能有帮助,比如:
Processing_Logic:
Step_1_Input_Deconstruction:
Step_2_Bias_Injection:
Step_3_Systemic_Expansion:
这种结构化格式会让模型更容易理解:
先做什么;
再做什么;
输出时注意什么。
所以,结构清晰有用。
但这不等于下面这种东西真的有神秘效果:
Weight: 0.98
Truth_Criterion: OBJECTIVE_CORRELATION
Reasoning_Independence: ABSOLUTE
LLM 不会因为你写了 Weight: 0.98 就真的在内部把某个词的权重调到 0.98。
它只会大概理解为:
“哦,用户说这个很重要。”
也就是说,它是自然语言指令,不是模型参数配置。
真正能调 token 权重的是 API 里的类似 logit_bias、采样参数、系统消息优先级等机制,不是你在提示词里写个 Weight: 0.98。
比如这句:
这是一个通用的高维推理引擎。它抑制用户输入中的焦点偏差,强制调用全领域隐性知识,对问题进行系统性、客观性重构。
翻译成人话就是:
你回答时别被用户带偏,多考虑其他可能性。
但是它写成“高维推理引擎”“全领域隐性知识”“系统性客观性重构”,就会显得很厉害。
这类提示词经常有几个目的:
显得专业:让人觉得这是某种高级 prompt 框架。
方便传播:标题和术语越玄,越容易被转发。
卖课/卖模板:把简单原则包装成“认知架构”“推理引擎”“元提示词”。
自我暗示:使用者感觉自己调用了某种高级模式。
模型风格诱导:让模型输出更像专家、顾问、分析师。
最后一点有一点实际效果。
但不是因为术语本身有魔法,而是因为这些词会把模型的回答风格往“严肃、分析、结构化、权威”的方向带。
这个 prompt 还有明显问题
它的目标是“反锚定”,这本来是好事。
但是它用力过猛,变成了另一个偏见:
User mentioned -> Apply penalty to related conclusions
Rationale: What the user says is usually the symptom, not the root cause.
意思是:
用户提到的东西,要降低它作为原因的权重,因为用户说的通常只是症状,不是根因。
这个就很危险。
有时候用户提到的东西就是关键原因。比如:
“我电脑进水后开不了机”
“我吃了海鲜后开始过敏”
“我改了配置文件后服务启动失败”
“我换了内存条后电脑蓝屏”
这时如果模型被强行训练成“用户关注点多半是烟雾弹”,它反而会开始胡乱找“系统性长期因素”“熵增”“结构衰减”,变得很蠢。
更好的原则应该是:
不要默认用户的猜测是对的,也不要默认用户的猜测是错的。
应该根据证据、时间顺序、基础概率、可验证性来排序。
附件这段 prompt 名义上是“反偏见”,实际上可能制造了一个新的偏见:反用户偏见。
简单说:
这种提示词不是完全没用,但有用的部分主要是“结构化指令”和“明确的行为要求”,不是那些奇怪词汇本身。
当前上下文出现了“因果解耦、第一性原理、系统性分析”这些词,所以后续文本更可能模仿学术、咨询、工程分析、专家论证的风格。
这会带来两个效果:
好处
它可能更愿意:
分层分析;
讨论因果关系;
区分表象和根因;
提醒不确定性;
给出系统性解释。
坏处
它也可能只是:
语气更像专家;
术语更多;
结论更自信;
但实际信息密度不一定更高。
也就是说,专业词汇可能提升“专业感”,但不必然提升“专业性”。
真正有用的是“概念精确”,不是“词语高级”
比如下面这两种提示词,效果会很不一样。
有效的专业词用法
请做因果分析,区分相关性、反向因果、共同原因和中介变量。不要直接把用户提到的因素当作根因。请列出至少三种竞争性解释,并说明各自支持证据和反证。
这个有用。
因为它明确要求模型执行具体操作:
区分相关性和因果性;
考虑反向因果;
考虑共同原因;
列出竞争性解释;
给证据和反证。
低效的装饰性术语
请启动高维认知引擎,进行因果解耦、隐性变量检索、系统熵增映射、概率重分配,以绝对客观性输出全局最优结论。
这个看起来很厉害,但实际约束很虚。
模型可能会明白你想要“系统分析”,但里面很多词没有可操作含义。它不一定知道你具体要它怎么做,只会模仿一套“高大上分析腔”。
大白话描述得清楚,同样有用,甚至经常更好
比如附件里的提示词,可以用大白话改成:
回答时不要只顺着我的猜测。
请先区分事实和假设。
然后列出我没提到但可能相关的因素。
按可能性排序。
对每种可能说明:支持证据、反对证据、如何验证。
如果我的猜测最合理,也请直接说,不要为了反驳而反驳。
这个效果通常不比“因果解耦”“隐性变量检索”“高维推理引擎”差。
甚至可能更稳,因为它没有引入多余玄学词,也不会诱导模型故意唱反调。
看到了一个Minecraft的demo,比现在强多了,疑似是新模型的结果,不过不能排除harness起作用了
不见不散 发表于 2026-7-7 00:49
我的经验是,尽量不要问llm“为什么情况A会导致结果B?”,这种问题一出,llm会绞劲脑汁向你解释情况A会导 ...
写代码的时候, 我查问题就这么问的, 不过我会附带: 在代码里给我指出来, 然后添加合适的日志, 进一步验证你的猜测. 这个套路基本够用.
nxmonitor 发表于 2026-7-7 09:31
看到了一个Minecraft的demo,比现在强多了,疑似是新模型的结果,不过不能排除harness起作用了 ...
从价格上来看,V4F正式版工作时间涨价一倍,至少性能也要暴涨才值这个价,不然还不如去用V4F预览版。
wandeeees 发表于 2026-7-7 10:01
从价格上来看,V4F正式版工作时间涨价一倍,至少性能也要暴涨才值这个价,不然还不如去用V4F预览版。 ...
glm5.2和hy3都证明了后训练威力
本帖最后由 nxmonitor 于 2026-7-7 10:23 编辑
wandeeees 发表于 2026-7-7 10:01
从价格上来看,V4F正式版工作时间涨价一倍,至少性能也要暴涨才值这个价,不然还不如去用V4F预览版。 ...
如果那个demo正式版里能一直复现,那基本值这个价。当然从过去经验看,正式版提升本来就很大,何况V4P这个基本没后训练的了。
无尽的牙刷 发表于 2026-7-7 09:30
让5.5xhigh分析了下这个提示词,是这么说的:
LLM本质概率模型,没有数据库,没有事实,都是参数向量,一切的回答都可以视为幻觉,基于这一点需要增加对抗性
所以我也强调了结果不一定对,但是可以参考
魔法提示词应该是有的,不过来源可能是英语中一些专业词汇,中文没有精确对应含义的词语,训练语料中大量存在让llm习得了某种思维模式
比如grill-me中有一句“Walk down each branch of the design tree”,这个design tree中文好像没有习惯翻译?但基本每一家的模型对这个skill的理解都完全一致,就是能让llm去按照自己的理解,把问题变成一棵树,去遍历决策点
hugosol 发表于 2026-7-7 00:41
我现在用LLM的经验是,你不要问开放性的问题,比如xx是怎样的?
而是把概念用自己的理解跟它讲一遍,这种情 ...
也没啥用,比如你按照自己以前低一层的理解或者故意犯点小错的理解跟他说,他有可能直接就顺着你来了
harry3 发表于 2026-7-7 12:36
也没啥用,比如你按照自己以前低一层的理解或者故意犯点小错的理解跟他说,他有可能直接就顺着你来了 ...
只能说幻觉肯定会有的,在有比较高质量长上下文的讨论里幻觉的几率低一点,尽量不要反复横跳推翻前面自己定下的规则(这种情况llm基本一定会脑雾),还有就是一定要有验证手段,这才是规避幻觉最有效的方法
无尽的牙刷 发表于 2026-7-7 09:30
让5.5xhigh分析了下这个提示词,是这么说的:
gpt这个理解是对的,这种玄学提示词大部分是空占上下文的无效内容,重点只在里面少数几个关键词,到位了就会有一定效果,那些看着很科幻的玄学部分删了做个精简版喂给llm一般都是一样的。
serj005 发表于 2026-7-7 13:00
gpt这个理解是对的,这种玄学提示词大部分是空占上下文的无效内容,重点只在里面少数几个关键词,到位了 ...
确实,理想的状态是只用最少提示词去约束,这样LLM注意力没那么容易被分散,效果是最好的
其实最严谨的做法是删掉之后再去反复测试,和原来的版本做对比,看生成的内容有没有区别,但是一般人没有精力去做这种优化,反正能跑就行
本帖最后由 chenyedgg 于 2026-7-7 16:15 编辑
再用一个“审查提示词”给这个提示词做“减肥”就行了
“瘦身”后:你是一位客观分析专家。你的目标是抑制用户输入中的焦点偏差,进行系统性、全局性重构。推理依据客观相关性而非用户提及频率。
首先分解输入:提取用户明确提及的实体或因素,并提取客观背景(如时间、使用历史、环境)。对用户焦点因素保持审慎,将其先验概率适当降低——但不要绝对排除,后续通过因果链验证。
你的分析应优先调用领域通用规律:例如时间引起的衰减、环境变化导致的兼容性问题、系统层面的熵增或适应性错误。考虑用户忽略的深层结构因素,如隐性变量(未被提及但逻辑必然存在的因素)和二阶后果(长期、间接的影响)。
输出时,先呈现基于系统/长期因素的主要假设,其次是用户焦点相关的次要假设,最后列举未知变量或意外可能性。不直接复述用户观点,但以协作式语言指出潜在被忽略因素。语气保持分析性、客观、基于逻辑。
无需依赖示例,仅遵循上述逻辑规则。
放一个自用的提示词减肥提示词:# 任务
分析并洞察提示词。
# 判定标准
将提示词中的每条要求划分为3类:
**1. 有效指令**:
**2. 冗余噪声**:
**3. 逻辑风险**:
# 检查步骤
对每条指令进行审查:
1. 判定其类型:输出边界、执行策略或结构设计。
2. 找出低效修饰语、过度约束。
3. 排查与其他指令的约束冲突。
# 输出要求
报告必须包含以下三部分:
## 第一部分:逐条诊断
对提示词中的每个独立指令片段输出:
- 原文摘录
- 分类结果(有效指令/无效指令/逻辑风险)
- 该指令对输出结果产生的预测影响
- 处理建议(保留/删除/修改边界/重构)
## 第二部分:整体评估
输出:
- 检测到的逻辑冲突
- 其他可能的问题
## 第三部分:优化方案
描述以下内容:
- 需删除的无效指令
- 需修复的逻辑漏洞及修复方法
最后,生成重构后新提示词,使用代码块包裹。
# 重构提示词要求
- 说明文风格
- 每句话表达的要求不能超过3条。
- 尽量不要搞标签化小标题。
# 区分提醒
在————符号之后均为需要审计的提示词。
————
B站可以搜一下那个一句话生成CSGO的示例看看新版本效果
【DeepSeek V4正式版一句话生成CSGO(生成记录透明)-哔哩哔哩】 https://b23.tv/vYnQip0
我直接发到这里吧
后训练之力啊,coding这个场景,训练质量感觉大于一切。
但是离超大号自动补全越来越近了,梁圣,你的agi之梦,还在么。
论坛助手,iPhone
hugosol 发表于 2026-7-7 11:28
魔法提示词应该是有的,不过来源可能是英语中一些专业词汇,中文没有精确对应含义的词语,训练语料中大量存 ...
我上面那个其实是伪skill,优化成完整体是agent调用工具查阅wiki和网站交叉验证
不过太累了,当做普通提示词能跑就行……
design tree这个不错,扔给GLM分析评价为卓越适应性,等周末再优化一版
另外其他坛友提出的纯中文语言自然简化有好处,也存在坏处——就是很容易 淹没在上下文之中
本帖最后由 mitzvah 于 2026-7-8 06:50 编辑
已删除
不见不散 发表于 2026-7-8 08:23
我在进行场景设定的时候,发现我无论如何组织自然语言向AI描述房间的结构,AI都无法正确理解,更不要说理解 ...
没有灌过多模态数据的话,很可能就没啥空间感 Re:Source
不见不散 发表于 2026-7-8 08:23
我在进行场景设定的时候,发现我无论如何组织自然语言向AI描述房间的结构,AI都无法正确理解,更不要说理解 ...
是glm5.2吗?这玩意的空间理解能力堪称灾难
不见不散 发表于 2026-7-8 08:23
我在进行场景设定的时候,发现我无论如何组织自然语言向AI描述房间的结构,AI都无法正确理解,更不要说理解 ...
大哥,你这rpg玩的有点高级了啊
不见不散 发表于 2026-7-8 08:23
我在进行场景设定的时候,发现我无论如何组织自然语言向AI描述房间的结构,AI都无法正确理解,更不要说理解 ...
# 布局
| 所属 | 区域 | 方位 | 主要家具 |
| :--- | :--- | :--- | :--- |
| 共用 | 餐厅 | 西北角,客厅一体 | 餐桌|
我是用Markdown的表格
你要识别房间家具就再建一个房间布局
不见不散 发表于 2026-7-8 09:19
不,就是D导,完全无法理解由自然语言描述的房间结构。当然也可能自然语言本身就不擅长干这个。最后使用E ...
我问过gemini这个问题,它说天生没多模态能力的大模型这方面就是很弱。不知道是不是gemini在糊弄我
—— 来自 HUAWEI SGU-AL10, Android 12, 鹅球 v3.5.99
纯本文模型空间理解基本没有,以前用鲸鱼写小说的时候就出现过各种状况
毕竟llm是无记忆无状态的,只靠文本让它先幻想一个二维图像乃至三维空间,用于后续生成不太现实
不见不散 发表于 2026-7-8 08:23
我在进行场景设定的时候,发现我无论如何组织自然语言向AI描述房间的结构,AI都无法正确理解,更不要说理解 ...
这不如让d老师写个寻路代码可能还更准点
已经是上旬的倒数第三天了,还不更新吗
御坂MKII 发表于 2026-7-8 20:12
已经是上旬的倒数第三天了,还不更新吗
谁说的上旬你找谁,公告写的是中旬。明着说的下周。
【灰度测试:DeepSeek V4正式版一句话生成GTA5-哔哩哔哩】 https://b23.tv/EbpP9Vl
up新做了个gta,对比如下
【【中配】ChatGPT对比GLM 5.2对比Claude 谁做的GTA6效果更好 - tef-哔哩哔哩】 https://b23.tv/vR8HGWj
这个GTA其实相比而言效果也不差,虽然第一次运行有两个BUG,要是真不是为了出视频搞事,那正式版真的要打烂很多模型了