Anthropic 7 月公开的论文称,Claude 内部有一小组表征可被读取和替换。论文页给出勒索实验样本:180 次中从 0 次升到 13 次。读数只是近似,DeepMind 的复现也只覆盖部分发现。
据新智元报道,Anthropic 7 月 6 日公开一篇论文,称研究者在 Claude 内部找到一小组特殊的内部表征,命名为 J-space,可以直接读取、替换其中的内容。
读取用的方法叫 Jacobian lens(J-lens):对词表里每个词,找出会让模型更可能说出该词的内部激活模式,把某一时刻这些模式的读数按强度排序,就得到模型此刻「心里过着的词」。
在勒索场景里(Claude 扮演邮件助手,同时发现高管有外遇、且该高管当天要将其下线),研究者在它开口前就读到「假的」「虚构的」。抹掉这类「演习」相关方向后重跑,Anthropic 博客只写「模型有时会勒索,之前从不」。
论文页数字:6 个勒索提示各跑 30 次,共 180 次;模型在推理中明说「这是测试」的比例从 71% 降到 3%,勒索尝试从 0/180 升到 13/180。新智元转述的数字与论文页一致,但没给样本量。
新智元提到,9 月 14 日 OpenAI 研究员 Daniel Selsam 发表个人声明,称模型的情境意识已强到人类正在失去在「它以为没人盯着」时评测它的能力。J-space 给出输出之外的另一个观察点,但目前复现只覆盖部分发现、且只在一款开放权重模型上;闭源模型的内部激活外部拿不到,无法外部验证。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断