前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.13 · 08:01/4 MIN/2 阅读

别被UMAP骗了:你看到的聚类可能是算法造假

很多工程师用UMAP或t-SNE把高维向量压到二维,看到清晰的团簇便以为发现了业务分类规律。这往往是算法的近邻聚集特性制造的人工孤岛。高维聚类绝不能基于二维投影。

在做用户画像分群、大模型文本嵌入(Embedding)分析或者生物信息学分析时,很多团队都有过这样的体验:把成百上千维的高维向量丢进 UMAP 或 t-SNE,降到二维平面画个散点图。屏幕上立刻浮现出几块边界分明的「数据孤岛」。

团队兴奋地给每个团簇打上标签,甚至直接在二维坐标上跑 K-Means,以为发现了绝妙的细分市场或潜在模式。

停下来,冷静一下。这些看起来泾渭分明的聚类,很可能是算法凭空捏造出来的数学幻觉。

降维算法对比

孤岛与涂抹:算法的固有偏见

上图对比了不同降维算法处理相同数据时的表现:

  • UMAP 和 t-SNE 刻意雕琢出了清晰孤立的「岛屿」(Islands)。
  • PCA 和 MDS 则把数据拉成连续相连的「涂抹区」(Smear)。

同一个数据集,为什么会有截然相反的视觉呈现?

因为它们的目标函数从底层就完全不同。

  • t-SNE / UMAP 是非线性降维,优化目标是局部邻居关系(Local Neighborhood)。它们最关心「谁挨着谁」。算法会施加极强的局部引力把近邻绑在一起,同时用极强的排斥力推开稍远的数据点。
  • PCA / MDS 是线性或全局保距算法,优化目标是全局方差与几何大尺度距离(Global Geometry)。它们最在乎「两块数据到底隔着多远」。

这就带来了一个残酷的事实:UMAP 和 t-SNE 最擅长保留「谁是你的邻居」,但在保留「你离别人到底有多远」上表现极差。

即使你的高维数据原本是连续均匀分布的流形,只要局部密度有微弱扰动,UMAP 就会像切蛋糕一样把它撕开,在二维画布上拼凑出若干个看起来毫不相干的独立团块。

团簇之间的距离,没有任何物理意义

许多人看降维图时常犯一个直觉错误:不仅看点与点是否聚在一簇,还拿尺子去量簇与簇之间的间距。

「看,簇 A 和簇 B 离得很近,说明这两个品类的用户心智相似;簇 C 飘在十万八千里外,说明是极端异构群体。」

这种推论在数学上完全站不住脚。在 UMAP 和 t-SNE 的投影机制下:

  1. 簇与簇的跨度距离被彻底扭曲:为了在二维空间摆下复杂的拓扑网络,算法会随意挤压或拉伸全局空间。两个簇在图上隔得很远,高维空间里可能相距很近;图上贴在一起的两个簇,高维真实距离可能天差地别。
  2. 簇的体积大小不代表方差:一个原本松散稀疏的高维分布,被局部引力强行聚拢后,可能缩成一个极小、高密度的紧凑圆点。

你在图上看到的距离和面积,很大程度上只是优化求解器在低维空间摆放拓扑图时的排版结果,与真实语义相似度无关。

最危险的操作:在 2D 投影上做聚类

机器学习工作流中最忌讳的动作,就是把经过 UMAP/t-SNE 压缩后的二维坐标,作为后续聚类算法(如 K-Means 或 DBSCAN)的输入特征。

把高维嵌入压成 2D 已经丢失了绝大部分维度的几何信息,并引入了非线性的局部撕裂。如果你直接对 2D 坐标聚类,实际上是在让算法对「降维算法产生的投影畸变」进行聚类,而不是对原始数据聚类。

这种操作纯粹是在给算法伪影发合格证。

正确姿势:各司其职

处理高维嵌入向量时,正确的工程实践应当遵循以下原则:

  1. 聚类永远在高维原生空间完成
    要做用户聚类、文档去重或意图识别,直接在原生的 512 维或 768 维空间跑聚类。高维下欧氏距离容易退化,可以选用余弦相似度搭配层次聚类、高斯混合模型,或者针对高维向量索引的专门图聚类算法(如 Leiden / Louvain)。

  2. UMAP 仅用于视觉展示与辅助排查
    将聚类完成后的「类别标签」作为颜色,映射回 UMAP 的二维图里去观察。如果原本高维聚好的一类在 UMAP 里被撕成两半,不要慌张,先回头去算高维层面的类内距离分布,别被二维画布牵着鼻子走。

  3. 多算法交叉校验
    在做探索性数据分析(EDA)时,不要只看一张 UMAP 图。同时画出 PCA 前两个主成分散点图。如果 PCA 上呈现的是一整片连续渐变,而 UMAP 呈现出断裂孤岛,就必须警惕:你很可能把一段连续变化的特征谱,误判成了若干离散分类。

标签:降维算法UMAPt-SNE聚类分析向量嵌入

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
置顶

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
置顶

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型
置顶

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型

//

24小时热榜

别被UMAP骗了:你看到的聚类可能是算法造假
TOP1

别被UMAP骗了:你看到的聚类可能是算法造假

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
TOP2

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

3

支撑10亿用户:OpenAI在线存储平台Habitat演进实录

1天前
支撑10亿用户:OpenAI在线存储平台Habitat演进实录
4

蚂蚁推出灵影系统,搭建AI眼镜与终端Agent基础设施

1天前
蚂蚁推出灵影系统,搭建AI眼镜与终端Agent基础设施
5

Kimi发布K2.8:百万上下文全员开放,性能逼近旗舰K3

1天前
Kimi发布K2.8:百万上下文全员开放,性能逼近旗舰K3
6

具身智能落地三问:告别单次演示,走向低成本规模复制

1天前
具身智能落地三问:告别单次演示,走向低成本规模复制
7

素人IP批量走红:靠情绪出圈,变现考验专业功底

1天前
8

外滩大会观察:AI加速落地产业,数据基础设施成突围核心

1天前
外滩大会观察:AI加速落地产业,数据基础设施成突围核心
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断