社交网络上每一次图像AI爆火,几乎都始于虚拟美女。这不仅源于半个世纪前计算机图像测试图Lena的历史惯性,更由生成模型学习「平均脸」的数学本质,以及用户互动与审美打分器的反馈循环共同决定。
一段5秒钟的韩国职业棒球联赛转播视频在X上获得了超过1500万次播放。镜头掠过看台,一位穿着白上衣和牛仔裤的女性翘着腿叹气,神情生动。然而,眼尖的球迷很快发现破绽:比分牌上的击球手曹仁成早在2017年就已退役,横幅标语存在明显的机翻错误,赛事解说更是带着突兀的美式口音。

这名女性完全由AI生成。被拆穿后,视频非但没有遇冷,反而迅速演化成社交模板,大量网民将自己的脸合成到同款转播画面中。

每一次图像生成模型的迭代,几乎都遵循着相似的传播路径:先是一个不存在的虚拟美女引发广泛关注,随后衍生为大众参与的爆款玩法。美女并非偶尔出现的配角,而是AI图像领域的默认选项。这一现象的历史,甚至比现代AI早了半个多世纪。
1972年,瑞典模特Lena Soderberg为《花花公子》杂志拍摄了插页。1973年,南加州大学信号与图像处理研究所的研究人员急需一张全新的测试图像,有人顺手撕下那期杂志插页顶部的一角塞进了扫描仪。

这张包含帽子、裸肩与侧脸的图像,自此成为数字图像处理领域的行业标准测试图。IEEE图像处理汇刊前主编David Munson曾直言原因:一方面,该图兼具高频细节、平坦区域、阴影与复杂纹理,极适合检验压缩算法;另一方面,在一个长期以男性为主的研究圈子里,具有吸引力的女性面孔天然更容易被选中。
随着伦理与版权争议的增加,Lena本人也在纪录片中呼吁停止使用该图像。直到2024年4月1日,IEEE计算机协会才正式宣布不再接收包含该测试图的学术论文,距那次偶然扫描已过去51年。

如果说Lena的流行带有历史偶然,现代生成式AI对女性形象的偏好则有着扎实的数学基础。
AI绘制红酒杯往往无法完全倒满,画时钟指针总是停在10:10,这源于互联网训练数据的分布偏置。而在面孔生成上,数据的统计特性恰好击中了人类的审美机制。

早在1990年,心理学家Judith Langlois与Lori Roggman的研究《有吸引力的脸只是平均的》便表明:通过数学方法将多张人脸取平均值后,合成脸的吸引力评分往往高于绝大多数单张真人脸,合成样本越多,评分越高。
生成式模型的本质是从训练数据的分布中心附近采样。模型天然倾向于生成「平均脸」,而人类在感知上恰好认为高度平均的面部特征最具吸引力。此外,平均化计算抹平了皮肤上的细微瑕疵,这一统计学特征演变为如今AI生成面孔典型的过度光滑质感。
除了底层算法特性,用户反馈与商业调优进一步放大了这种偏向。
2022年底,头像应用Lensa因自动为女性生成衣着暴露、姿态性感的肖像而引发争议。背后的核心逻辑在于:公开网络数据中充斥着大量物化女性的图片,模型将其视为了默认权重。统计显示,在开源模型社区Civitai中,NSFW内容的比例曾在两年间从41%飙升至80%。

为了让生成效果更具吸引力,模型团队通常会引入审美打分器(Aesthetic Scorer)或奖励模型(Reward Model)进行微调。例如广泛使用的PickScore,其训练依据即为真实用户在两张生成图中的二选一偏好。即便提示词本身与擦边内容无关,经过该类打分模型微调后的系统,也会在隐式引导下倾向于输出更具视觉刺激的女性画面。

动物行为学家Niko Tinbergen曾发现,鸟类更愿意孵化比真蛋更大、颜色更鲜艳的石膏假蛋,并将这种现象称为「超常刺激」。认知研究同样证实,将高颜值特征在平均脸的基础上进一步夸张强化,受试者给出的喜爱度评分还会继续上升。
算法的数学特性、人类对典型面孔的进化本能,加上点击量和商业变现构成的正反馈回路,共同将AI塑造成了最热衷消费人群的审美投射。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断