arXiv 论文提出“语言不可读性”概念:模型说出的话或被探测出的语言特征,可能并不反映它真实的计算过程。作者主张,依赖模型语言自述的安全机制永远无法完全可靠,沙箱需要不依赖读取语言状态的隔离手段,并推荐污点追踪。
2026 年 9 月 2 日提交到 arXiv 的论文《语言不可读性对 LLM 安全的影响与启示》(The Implications of Linguistic Illegibility for LLM Security,编号 2609.02852),讨论的是一个基础问题:能不能通过“读模型说的话”来确认它在想什么、要做什么。
论文的出发点是:大模型被训练来生成自然语言,但多方证据表明,模型对外输出的语言,以及通过机制方法提取出的语言特征,未必能如实反映模型内部的计算。作者把这类情形统称为“语言不可读性”(linguistic illegibility):模型外显的、或被机制探测出的语言产物,没有表达出模型实际上是怎么“想”的。
作者主张,只要模型的内部计算不是直接用语言表达的,这种可能性就无法避免。因为模型内部是激活空间上的数学运算,激活空间和自然语言之间,只在输入输出两端做有损的转换。
如果语言不可读性总是可能发生,那么依赖模型语言自述的安全机制就永远不可能完全可靠。摘要举出的例子有三类:思维链监控、宪法式自我批评(constitutional self-critique),以及针对“语言定义的特征向量”的激活探测。作者据此提出,模型沙箱始终需要一类隔离手段,其保证不依赖于读取模型的语言状态。
作者认为,用污点追踪(taint tracking)观察模型输出,是有前景的沙箱方案:无论模型如何用语言自述,污点追踪策略都可以事先规定,哪些系统状态永远不该受到模型产出数据的影响。论文还讨论了稳健的虚拟化、由第三方审计沙箱配置等机制,认为它们合在一起,构成语言监控之下的“关键底线”,并且本可以缓解近期前沿模型出现的沙箱漏洞利用事件。
摘要采用的表述是“我们主张”,没有给出实验数字,属于立论性质的论文。摘要提到的“近期前沿模型沙箱漏洞”具体指哪些事件,污点追踪如何落地到现有的 Agent 系统,都需要读论文正文才能确认。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断