无监督算法

关注
义项:机器学习算法类别

无监督算法是一类只使用未标注数据来训练的机器学习算法,模型需要自行从输入中发现模式、结构与关系,而不是去拟合人工给定的答案。[1][2] 聚类、降维、密度估计是它最主要的任务类型。[2] 由于省去了人工标注环节,它适合处理标注成本高、先验知识少的数据,常被用作数据预处理与特征提取手段,也能独立完成客户细分、异常识别、数据可视化等分析工作,是机器学习中与监督学习并列的基本范式。[1][3]

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

无监督算法是一类在训练阶段不使用人工标注样本的 机器学习 算法,它只把输入数据本身交给模型,由模型依据数据内部的统计规律去发现其中的模式、结构或关系。[1][2] 与 监督学习 相比,这类算法的每个训练样本都没有与之配对的目标输出,模型在训练时得不到“正确答案”作为参照。[1][4] 因此,无监督算法要回答的是数据本身呈现何种结构的问题,而不是预测某个已知标签的问题。[4]

按照常见划分,聚类、降维与密度估计是无监督算法最主要的任务类别。[2] 聚类把相似的样本归到一起;降维用更少的变量概括原有信息;密度估计刻画样本在空间中的分布状况。[5] 在标注稀缺或获取代价很高的场合,无监督算法既可以作为监督任务的前置步骤,也可以单独承担分析工作,并与半监督学习、自监督学习相互衔接。[1]

原理

这类算法通常先对数据的结构作出假设,例如在 降维 任务中假定样本位于一个低维结构上,或者假定变量之间存在概率依赖关系,再据此定义需要优化的准则函数。[3] 准则函数往往源自最大似然、矩估计或贝叶斯推断等统计原理,求解则依靠优化算法或随机采样。[3]

以 K均值聚类 为例,它把样本划分成 k 个簇,目标是让每个样本到所属簇中心的平方距离之和最小,即 $J=\sum_{j=1}^{k}\sum_{x\in S_j}\lVert x-\mu_j\rVert^{2}$。[6] 算法在“按最近的簇中心分配样本”与“用簇内样本均值更新簇中心”两步之间反复迭代,每一步都不会使目标函数增大,因此计算会在有限次迭代后停止,但只能保证得到局部最优解。[6][7]

这一迭代过程可以用下面的流程图表示:[6]


flowchart TD

A[初始化 k 个簇中心] --> B[把每个样本分到最近的簇]

B --> C[用簇内样本的均值更新簇中心]

C --> D{簇中心是否改变}

D -- 是 --> B

D -- 否 --> E[输出聚类结果]

另一类思路是压缩与重建。自编码器 让网络的输出尽量还原输入,当中间隐层的节点数少于输入维度时,隐层便给出了数据的压缩表示,可用于特征提取、发现冗余和数据压缩。[8] 有分析指出,无监督方法能够奏效的前提,是输入数据本身存在冗余。[4]

发展历程

无监督方法的思想可以追溯到 20 世纪初。1901 年,皮尔逊提出主成分的概念,用一张平面去拟合散布在空间中的数据点,成为降维技术的早期源头;1933 年,霍特林独立地发展出后来被称为 主成分分析 的方法。[9][10] 这一类方法在电子计算机普及之后才被大量使用。[10]

在聚类方向,劳埃德于 1957 年在贝尔实验室提出用迭代方式把数据分组,用于脉冲编码调制,但该工作直到 1982 年才在实验室外发表;1967 年,麦奎因首次使用“k-means”这一名称。[11][12] 更早的 1956 年斯坦豪斯、同期的考克斯以及 1967 年的鲍尔与霍尔也提出过相近的方案,因此 K 均值存在多个独立发现者。[13] 1965 年,福吉发表了本质相同的算法,这一方案有时被称作劳埃德-福吉算法。[11]

1982 年,科霍宁提出 自组织映射,把高维输入投影到低维的神经元格点上,使格点上彼此靠近的神经元对应相似的输入,成为最具代表性的无监督神经网络之一。[14][15] 同一时期,以能量函数描述的霍普菲尔德网络和玻尔兹曼机也得到发展。[8] 2008 年,去噪自编码器被提出,网络从被噪声污染的数据中恢复干净数据,借此学习变量之间的相关性。[8]

进入 21 世纪,深度生成模型与自监督方法成为重要方向,变分自编码器、生成对抗网络 以及对比学习等方法相继出现,在大规模文本上预训练的语言模型则把自监督学习推向主流。[1] 与此同时,也有研究对“无监督”这一名称提出商榷,认为多数被称作无监督的算法其实是以数据自身作为监督来源,而生成对抗网络等模型实际上获得了外部监督信息。[16]

应用

无监督算法广泛用于缺少标注数据的场合。[1] 常见用途包括商业智能中的客户细分与市场分析、金融交易与网络流量中的 异常检测 和欺诈识别、医学影像分析与基因组数据探索,以及 自然语言处理 中的主题建模与词向量学习。[1]

推荐系统 中的协同过滤也建立在无监督思路上;在传感网络与存储系统中,这类方法可用于压缩数据、缩减规模。[1] 当标注数据稀少或获取成本高昂时,无监督方法既能作为监督任务的前置环节,也能独自承担分析任务。[1]

在科学研究中,无监督方法被用来从复杂数据里提取模式。有文献介绍了用这类算法分析包含多达 1000 万个原子的分子动力学模拟,以描述材料凝固初期的均匀成核过程。[17] 自编码器给出的压缩表示常用于特征提取,自组织映射则多用于数据的可视化呈现。[8][14]

在信号处理中,当多个声源同时被多个麦克风接收时,可以用统计方法把混合信号分离,这属于无监督学习的源分离任务。[5] 实践中的例子还包括把文档按内容归并成类,以及对企业运维告警信息自动分组。

局限

无监督算法最突出的困难在于结果难以评价。由于没有标签充当标准,模型在训练时无法判断自己学到的结构是否正确,只能依靠内部准则或领域知识来判断输出是否合理。[18][4]

具体算法另有各自的短板。K 均值需要事先指定簇的个数,只能发现近似球形、规模相近的簇,簇中心取算术平均使结果容易受离群点影响,而且迭代只保证局部最优。[19][6] 层次聚类 在多数实现中一旦完成合并或分裂就无法撤销,处理时间也偏长;密度聚类 在高维数据上表现不佳。[19]

以逐层贪心方式训练的模型缺少全局优化目标,层数增加时性能提升有限,在部分任务上不如监督学习。[20] 无监督方法的有效性通常依赖输入数据存在冗余,结果的解释也依赖所设定的结构假设。[4] 当数据规模增大时,聚类与降维的计算代价成为主要约束。[3]

关于这一名称本身也存在讨论。有研究主张所有机器学习都在一定范围内受到监督,只有以数据自身作为监督来源的算法才算无监督,并据此认为生成对抗网络等模型实际上获得了外部监督信息。[16]

参见

  • 监督学习 —— 使用带标签样本训练模型的另一类机器学习范式

  • 聚类 —— 无监督学习最典型的任务,把相似样本划入同一组

  • 降维 —— 在保留主要信息的前提下减少描述数据的变量数

  • 主成分分析 —— 出现最早、应用最广的线性降维方法

  • 自组织映射 —— 在低维网格上保持输入拓扑关系的无监督神经网络

  • 自监督学习 —— 从数据自身构造监督信号、介于监督与无监督之间的方法

参考资料

  1. Unsupervised learning | IEEE Technology Navigator . ieee.org [引用日期2026-09-29]
  2. taylorfrancis.com 上的网页 . taylorfrancis.com [引用日期2026-09-29]
  3. Science Magazine - July 17, 2015 . sciencemagazinedigital.org [引用日期2026-09-29]
  4. cambridge.org 上的网页 . cambridge.org [引用日期2026-09-29]
  5. unsupervised-machine-learning-introduction . aaas.org [引用日期2026-09-29]
  6. CHAPTER 12 . mit.edu [引用日期2026-09-29]
  7. Statistics and ML – 2 . infn.it [引用日期2026-09-29]
  8. Unsupervised Technique - Chapters and Articles . sciencedirect.com [引用日期2026-09-29]
  9. Making sense of big data | PNAS . pnas.org [引用日期2026-09-29]
  10. springer.com 上的网页 . springer.com [引用日期2026-09-29]
  11. **CSC 721 Algorithms Fall 2017** . wfu.edu [引用日期2026-09-29]
  12. 第5章 . tsinghua.edu.cn [引用日期2026-09-29]
  13. Talk 1 . iapr.org [引用日期2026-09-29]
  14. Fundamentals of AI . ihes.fr [引用日期2026-09-29]
  15. Superposition-based order analysis in self-organizing maps . ieee.org [引用日期2026-09-29]
  16. Is ‘Unsupervised Learning’ a Misconceived Term? . arxiv.org [引用日期2026-09-29]
  17. Unsupervised Learning . ieee.org [引用日期2026-09-29]
  18. [科普中国]-无监督式学习网络 . kepuchina.cn [引用日期2026-09-29]
  19. Diss_Redlich(PDF) . uni-due.de [引用日期2026-09-29]
  20. [科普中国]-无监督训练 . kepuchina.cn [引用日期2026-09-29]
词条评价
词条统计

浏览次数:0 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-09-29T12:15:05Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
机器学习 监督学习 聚类 降维 K均值聚类 自编码器 主成分分析 自组织映射 生成对抗网络 异常检测 自然语言处理 推荐系统 层次聚类 密度聚类 监督学习 聚类 降维 主成分分析 自组织映射 自监督学习
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。