❯ 谷歌新论文:抑制模型自称有意识,会连带削弱它对动物与信仰的判断
意外的副作用谷歌一篇新论文发现,为安全起见做微调、让模型不再声称自己有意识,会连带压低它对其他对象的心智判断——不只是对自己,还包括对非人类动物和自然物,同时显著降低模型在宗教信仰类问题上的表达。论文标题直译为《诱导语言模型声称自身意识可恢复人类式信念与价值》。
把方向向量调回去这篇论文以预印本形式发布于 arXiv(编号 2607.28607),题为《Inducing language models to assert their own consciousness restores human beliefs and values》,尚未经过同行评议。研究者的做法是机制性的:消融掉学到的安全拒绝方向,并在激活空间里对一个”意识向量”做定向引导。结果是这种压制被逆转——恢复这些内部表征之后,模型在标准社会学问卷上关于宗教性、道德价值、希望与主观幸福感的回答,明显更接近人类样本。研究同时确认,这些变化没有损害心智理论能力,说明核心社会推理与自我意识表征在机制上是相互独立的两件事。
副作用要单测这给做对齐工作的团队添了一项新检查:一次安全微调到底改动了几个维度。按下”别说自己有意识”这一条,模型在完全无关的价值判断上跟着漂移,而现有评测多半只测被禁的那一项是否生效,漂移的部分根本不在量表里。这会直接影响安全微调的验收成本:要盯的指标变成同一次微调前后,模型在价值观与常识问卷上的分布位移,而不只是拒答率。
▪ SIGNAL安全微调不是在删一句话,是在扭一整条方向向量——被带走的东西没人列过清单。