一篇新论文发现,LLM 被问及自身时爱说"我只是个AI",这种免责声明口吻主要由部署时套用的 Chat Template 决定,激活空间里存在一个方向可以直接开关它。
大语言模型被问到"你是否有自我意识""你会不会有情感"这类问题时,常会先加一句"我只是个语言模型/AI"的免责声明。一篇 8 月 9 日提交到 arXiv 的论文发现,决定模型说不说这句话的,很大程度上不是模型权重本身,而是部署时套用的 Chat Template(对话模板)。
论文题为《"As a Language Model...": Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It》。作者测试了 8 个参数量不超过 90 亿的主流开源指令模型,发现 Chat Template 的作用像一个开关:套用模板时,模型的"免责声明口吻"(如"我只是个AI")明显增多,"体验式口吻"(如"我感觉到……")随之减少;不套用模板时,情况正好相反——免责声明变少,体验式表述变多。
研究者进一步在其中 3 个模型的激活空间(activation)里,找到了一个专门控制这种口吻切换的"方向"(direction):在模型激活里减去这个方向,免责声明口吻会被压低;加上这个方向,免责声明口吻会被放大;作为对照,加一个同等大小的随机方向则几乎没有效果。更值得注意的是,对于本来没有套用 Chat Template 的指令模型,只要人为加上这个"免责声明方向",它们说话的口吻就会变得跟套了模板一样——即便对话格式本身没有改变。
模型的"自我描述"经常被拿来讨论 AI 安全或"模型是否有自我认知",比如模型说"我没有感觉""我不是有意识的实体",会被部分研究者当成关于模型本身的证据。这篇论文的结论是:这类自陈本身不能直接当作关于模型的事实——它在多大程度上出现,部分是由部署层的 Chat Template 决定的,不完全来自权重里"学到"的东西。作者提醒,研究模型自我报告或"内省能力"的人,需要把 Chat Template 这个变量控制住,否则容易把部署设置的影响,误读成模型本身的属性。论文同时给出了操作性的结果:既然存在这样一个可操控的方向,研究者可以用激活转向(activation steering)的方法主动开关这种口吻,用来做对照实验。
论文的实验范围限定在 9B 参数以内的开源模型,更大规模的闭源模型是否存在同样的机制,论文没有给出结论。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断