南加州大学团队在《自然·人类行为》发表研究:分析88万篇文本发现,ChatGPT发布后写作复杂度方差持续收窄,最高达50%;AI润色还会弱化年龄、性格等身份信号。语言多样性正在被系统压缩。
语言是身份的指纹,而AI正在把这枚指纹抹平。这是南加州大学团队在《自然·人类行为》上发表的新研究《大语言模型时代语言多样性的萎缩》得出的结论。
研究者横跨三项实验、七个数据集,分析了超过88万篇真实文本。结论是一组警醒的数字:当AI介入写作时,文本复杂度方差最高收窄50%,大家写出来的东西,正在肉眼可见地趋同。

2022年11月30日,ChatGPT向公众开放,这给研究者提供了一次难得的对照机会。团队选取了三个差异明显的写作场景:Reddit创意写作版块r/WritingPrompts的31.8万篇用户故事、美国本地新闻网Patch的37.9万篇报道,以及arXiv上约8万篇计算机科学论文摘要。时间从2018年1月延伸到2024年11月,正好覆盖ChatGPT发布前后。
他们用AI文本检测工具Binoculars逐月识别疑似AI写作的比例,再统计各平台当月文本的写作复杂度方差。这个方差聚合了词汇丰富度、句法复杂度和罕见词占比,方差越高意味着文字越千人千面,越低则越千篇一律。
结果很明确:ChatGPT发布后,三个平台上的写作复杂度方差都出现显著下滑。Reddit和arXiv上,方差在发布后持续下降;格兰杰因果检验显示,AI使用量的上升在时间上领先于风格趋同,指向因果关系。Patch新闻虽然没表现出类似的持续驱动,但在发布时点出现了瞬间下降。
受影响最深的是Reddit——一个最该鼓励个性表达的社区。并且这种趋同不是一次性冲击,而是每个月都在继续收窄。

整体趋势之外,研究者还做了贴近日常的受控实验:让GPT-3.5、Gemini、Llama 3等主流模型用“润色”“改清晰”“压缩字数”“正式一点”等十余种提示词,改写真实的Reddit帖子和arXiv摘要,基本覆盖普通人用AI改稿的场景。
先说好消息:AI确实“听话”,87%的改写文本与原文的语义相似度超过0.95,核心信息没有跑偏。坏消息是,这种“忠诚”本身就在制造问题。改写后的文本复杂度方差收窄了21%到50%,而且无论换哪个模型、哪种提示词都一样。这不是某个模型的个性问题,而是“预测下一个词”这类模型的共同倾向:它们偏爱概率上最稳妥的表达,天然过滤掉罕见但有趣的词。十个人本有十种说法,经AI一润色,往往只剩下最大公约数。
语义没有流失,流失的是风格。

语言心理学早已确认,用词习惯是每个人的“身份指纹”:词汇选择可以反映性别、年龄、性格甚至政治倾向。研究者把这些方法搬来检验AI改写的影响。
他们在原始文本上训练分类器预测作者的年龄、性别、大五人格、共情水平等属性,再让同一批分类器去预测AI改写后的文本。结果,个人特质的预测准确率平均下降了6%;其中年龄识别受损最严重,F1分数从0.351跌到0.260。
更值得注意的是偏差方向:当预测出错时,AI改写后的文本更容易被识别为“年长者、男性、政治自由派”的语言。AI不只是抹平差异,还在把所有人的表达往主流人群的平均值上拉。
这会带来现实影响。许多研究正在尝试用语言特征辅助心理疾病早期筛查,患者无意间写下的文字可能藏着诊断线索;而这些文字一旦被AI统一润色,藏在措辞里的信号就可能消失。招聘情境同样如此:AI帮HR筛掉了“不标准”的简历,也筛掉了真实的个体信息。
论文随后又从机制上做了拆解。研究者复现了一批稳定的“词汇—心理特质”关联,比如性别与负面情绪词、年轻人与未来关注之间的联系,但经过AI改写,部分关联从统计显著变成了不显著,也有少数关联幸存下来。我们正在失去一些原本可靠的“从文字读人”的通道。

当然研究有边界:样本主要来自英文互联网,AI文本检测也难免有误差。但研究者强调,只要大语言模型介入写作,语言多样性的收缩方向高度一致。
奥威尔的“新话”靠强制,AI带来的语言趋同却是自愿的。每次按下润色键,你都在离其他人的表达更近一步。要不要保留一点“未经AI修饰”的文本?这不是拒绝技术,而是保留一种能力:用独一无二的声音,说出自己的话。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断