无监督聚类分析

关注
义项:机器学习方法

无监督聚类分析(Cluster Analysis)是机器学习中一类在样本没有类别标签时,依据样本之间的相似性把数据划分为若干组的方法,划分得到的组通常称为簇。它的目标是让同一簇内的样本尽量接近,而不同簇的样本彼此差异较大。作为无监督学习的主要任务之一,聚类分析被用于客户分群、图像分割、文档归类与异常检测等场景,其思想可追溯到19世纪末生物学与人类学中对样品分类的研究。[1]

百科 图文
目录
  1. 定义
  2. 背景
  3. 内容
  4. 影响与争议
  5. 参见

定义

聚类与监督学习的差别在于是否使用标签:监督学习需要带类别标记的训练样本,而聚类只拿到一组未标记数据,目的是找出其中自然形成的分组。[2][1] 形式化地说,给定样本集合 $X=\{x_1,\dots,x_n\}$,算法要把它分成 $k$ 个互不相交的子集 $C_1,\dots,C_k$,使同一子集内样本相似度高、不同子集间相似度低。[2]

以划分式方法为例,常见目标是最小化簇内平方和 $J=\sum_{i=1}^{k}\sum_{x\in C_i}\lVert x-\mu_i\rVert^2$,其中 $\mu_i$ 表示簇 $C_i$ 的中心。[3] 由于「自然分组」本身较为抽象、不同人可能有不同理解,聚类问题很难给出统一而严格的界定。[2]

背景

用数值方法对样品分类的做法较早出现在分类学、人类学与心理学等领域。有研究把卡尔·皮尔逊在1894年的工作视为聚类分析中最早的系统性研究。 「聚类分析」这一名称与心理学家泰伦(Tryon)有关,他在1939年出版的同名著作推动了该术语的传播。[4]

在缺少类别标签、或标注成本很高时,人工分组往往难以处理规模大、维度高的数据,自动聚类因此成为探索数据结构的手段。[1] 20世纪30年代起,人们提出了一系列自动聚类算法,最初多为基于对象间相似度矩阵的启发式做法。[5]

内容

在划分式方法中,K-均值聚类(k-means)应用最广。k-means这一名称由麦奎因(MacQueen)在1967年提出,标准算法则由劳埃德(Lloyd)于1957年为脉冲编码调制设计,直到1982年才在贝尔实验室之外发表;福吉(Forgy)在1965年也给出过基本相同的方案,故有时称劳埃德-福吉算法。[3][6] 算法先设定簇数 $k$ 与初始中心,然后交替进行「把每个样本归到最近中心」与「用簇内均值更新中心」两步,直到划分不再改变;该过程使簇内平方和单调不增,但一般只能得到局部最优,且 $k$ 需人为给定。[7]

层次聚类不预先指定簇数,而是通过逐步合并或分裂构造嵌套的簇树,结果可用树状图展示。自底向上的凝聚式方法让每个样本先各自成簇,再反复合并最接近的两个簇;自顶向下则从一个整体簇不断拆分。簇间距离的链接方式(如单链、全链、平均链与Ward法)会明显影响最终结果。[8]

基于密度的DBSCAN由埃斯特(Ester)等人在1996年提出,它按点的局部密度聚类,能识别任意形状的簇,并把密度过低的点判为噪声,需要设定邻域半径和最小点数两个参数。[9][10]

另一类做法用概率模型描述数据。有限混合模型假定每个簇对应一个概率分布,连续数据常采用多元正态分布的混合,这一思路的早期研究可追溯到20世纪60年代初;模型参数通常用期望最大化(EM)算法估计,而该算法在1977年由登普斯特(Dempster)等人加以系统阐述。[5][11]

多数算法依赖相似度或距离度量,如欧氏距离与余弦相似度,度量方式的选择会显著改变聚类结果。[8] 因为没有真实标签,结果通常用内部指标评价,例如轮廓系数、Calinski-Harabasz指数和Davies-Bouldin指数;轮廓系数取值在-1到1之间,数值越大一般表示簇内越紧密、簇间越分离。若掌握部分已知标签,还可用兰德指数等外部指标衡量。[12]

影响与争议

聚类在发展过程中也受到过质疑。1971年,统计学家科马克(Cormack)发表了对聚类的批评性综述,认为大量分类技术的应用浪费了宝贵的科研时间,这在一段时间内削弱了统计学界应用聚类的热情。 同期,剑桥的贾丁(Jardine)与西布森(Sibson)试图为聚类建立形式化框架,主张单链聚类是唯一在数学上可取的方法,但因单链在实际数据上表现不佳,这一主张被多数使用者拒绝,其工作影响有限。

此后,研究重心转向为聚类寻找统计模型,有限混合分布日益受到重视。 20世纪90年代末以来,聚类被纳入数据挖掘范畴,并在基因表达数据分析等领域得到应用。

聚类的输出并不唯一,它受初始化和参数影响:以k均值等算法为例,结果依赖初始中心的选择和簇数的设定,不同设置可能给出不同划分,且对离群点较为敏感。[7][6] 不同学科在相对隔绝的状态下各自发展聚类方法,造成方法的重复出现与条块分割;有评论指出,聚类方法之多几乎与聚类分析的使用者一样多。

参见

  • K-均值聚类 —— 一种应用广泛的划分式聚类算法。

  • DBSCAN —— 基于密度的聚类算法,可发现任意形状的簇并识别噪声。

  • 层次聚类 —— 通过合并或分裂构造簇树的聚类方法。

  • 无监督学习 —— 聚类分析所属的机器学习范式。

  • 期望最大化算法 —— 常用于估计混合模型参数的迭代算法。

参考资料

  1. 什么是聚类? | Machine Learning | Google for Developers . closed.social [引用日期2026-09-27]
  2. 第八章 非监督学习方法 . pku.edu.cn [引用日期2026-09-27]
  3. **CSC 721 Algorithms Fall 2017** . wfu.edu [引用日期2026-09-27]
  4. 第12章 聚类分析 . cnki.net [引用日期2026-09-27]
  5. CAMBRIDGE . cambridge.org [引用日期2026-09-27]
  6. K-means算法原理K值确定方法与优化变种详解-开发者社区-阿里云 - 机器学习:K-means算法基本原理及其变种 . aliyun.com [引用日期2026-09-27]
  7. CHAPTER 12 . mit.edu [引用日期2026-09-27]
  8. Baron3 . caltech.edu [引用日期2026-09-27]
  9. literatumonline.com 上的网页 . literatumonline.com [引用日期2026-09-27]
  10. epfl.ch 上的网页 . epfl.ch [引用日期2026-09-27]
  11. lect13(PDF) . duke.edu [引用日期2026-09-27]
  12. 十分钟掌握聚类算法的评估指标 . aliyun.com [引用日期2026-09-27]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-27T14:09:43Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
监督学习 卡尔·皮尔逊 K-均值聚类 层次聚类 DBSCAN 数据挖掘 K-均值聚类 DBSCAN 层次聚类 无监督学习 期望最大化算法
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。