@yidinghe 我表达的可能不完全准确,这只是其中一个例子,我有时候直接不跟他解释,让他不要做,它也会这样写幽灵规则
原因楼上也有提到,可能原因:遵从最小修改、参数量、模型训练时的方向的差异。我并不认为这是个多大的错误,只是从体感上,他更像机器人,不像人。我个人认为「更像人」应该是模型厂商追求的方向。
所以我才觉得它的这种默认幽灵行为并不是一个好的方向,需要额外的规则约束(本可以不需要约束)
指令遵循好,是 GPT 系列模型的优点,但副作用就是它会把你说的一切话包括随口一说都当成指令。这种抽象的意图理解本来就很难
@yidinghe 就比如我之前做 SKILL 修改
我说:流程 3 不需要调用 XXX 工具,去掉
然后结果它在安全守则会加上:禁止调用 XXX 工具。
我:??
就是这种,从人类一般视角来看,去掉就就是不用了,去掉自然就不会去调用,它额外加个安全守则就很幽灵
所以我才觉得它整体就比较保守,边界很强。但你要说 加不加这句安全守则有什么问题吗?会影响整体流程吗?
并不会,只是会让人疑惑而已。
@1874w 如果是这样,说明 Codex 对大模型的调教非常保守,对任何禁止性的指令都极其敏感。这倒不算坏事,大概率跟 SOUL 文件有关。
另外就是表达还需要更明确,比如你实际想表达的其实是 “在流程三中去掉对 XXX 工具的调用” 这两者区别很大,你的原话指向的是工具,我改成指向的是流程三。大模型对指令的主语很敏感。
指出一个错误,就完全变立场。
每次都生成一个新的回答,不是基于之前修改。
@wolfie #14 超级墙头草
我这边这种情况很少,大多是我表达模棱两可或者有歧义导致的。
太阳底下无新事
人自身有巨量上千万的 context ,LLM 参数量的增长和智能也只能一步步增长
再多的 harness 和 memory 也只能是逐步的减少这个 discrepancy
人必须亲自去自省这些隐藏上下文拿出来,Hermes/OpenClaw 以及 Codex/Claude 才能发挥它们更多的(a tiny bit more fraction of) 功力
完全同意,而且这种差异非常明显,尤其是在撰写文档时会有大量这种叠甲式的句子
经常这样,太恶心了。之前当你交代不要干什么的时候会产生严重的刻板行为。