无监督学习

关注
义项:机器学习范式

无监督学习是机器学习的一种范式,指算法在没有任何人工标注标签的数据上发现数据内部的结构、模式或分布规律。它与监督学习、强化学习并列为机器学习的三大范式,主要任务包括聚类、降维、关联规则挖掘与密度估计等。由于互联网上大量数据本身没有标签,无监督学习被视为降低标注成本、支撑大规模数据分析的重要途径,但也因缺乏明确的评价标准而成为机器学习中理论难度较高的分支。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

无监督学习是一类机器学习方法,其训练数据只包含输入样本,而不附带任何人工给定的标签或目标输出。算法需要在没有外部指导的条件下,自行推断出数据点之间共同具有的自然结构[1]。与之相对,监督学习在带标签的输入输出数据上训练模型,而无监督学习算法不使用这类标签[2]。

在机器学习的分类框架中,无监督学习通常与监督学习、强化学习并列为三种基本范式。从训练信息的角度看,强化学习提供的信息介于两者之间:它不直接给出每个输入的正确答案,只提示某个动作是否正确[3]。微软的学习平台也把监督学习、无监督学习和强化学习概括为自动机器学习的三种范式。

中文语境中,这一概念也常被译为「非监督学习」或「无监督训练」。科普中国在介绍相关方法时提到,无监督训练事先没有任何训练样本,需要直接对数据进行建模[4]。

原理

无监督学习的共同思路,是在无标签数据上作出某种关于数据结构的假设,并据此构造准则函数,再用优化或采样算法求解。常见的假设包括数据分布在低维流形上、样本可以划分为若干相似子集等[3]。由于没有标签告诉网络是否学对了,算法只能依靠预先设定的学习规则组织输入数据,这通常要求输入本身具有冗余性[5]。

以聚类中的 k 均值算法为例,目标是把数据划分为 k 个簇。算法先用欧氏距离衡量样本与各簇中心的远近,把样本分配给最近的簇,再以簇内样本的均值更新簇中心,反复迭代直到样本不再改变归属[6]。其优化目标可以写为最小化簇内平方和:$\sum_{i=1}^{k}\sum_{x\in C_i}\lVert x-\mu_i\rVert^2$,其中 $C_i$ 为第 $i$ 个簇、$\mu_i$ 为该簇中心。

另一类方法是竞胜学习,网络中的神经元相互竞争,激活程度最高的神经元胜出,只有胜出神经元及其邻域更新权重,更新量形如 $\Delta w_{ij}=\alpha(x_i-w_{ij})$[7]。在此基础上加入拓扑组织便得到自组织映射,簇会按一定顺序排列[8]。


flowchart LR

A[无标签数据] --> B[假设数据结构]

B --> C[构造准则函数]

C --> D[优化或采样求解]

D --> E[簇划分 / 低维表示 / 密度模型]

发展历程

无监督学习的早期思想来自人工神经网络与模式识别。1949 年提出的赫布学习规则属于这一类:当一条连接两端的神经元同时处于非零激活状态时,该连接的权重会被调整[9]。1982 年,科霍宁提出自组织映射的学习方法,采用竞胜学习机制,被看作随后四十年无监督机器学习的重要起点之一[10][9]。

在经典统计方法阶段,代表性的算法包括 k 均值聚类、期望最大化与主成分分析。主成分分析最早可追溯到 1901 年皮尔逊的工作与 1933 年霍特林的工作,k 均值则由劳埃德和麦奎因在 20 世纪 50 至 60 年代提出[6]。有学者把近四十年常用的方法概括为线性隐含变量模型与聚类两大类,前者包括主成分分析、独立成分分析和非负矩阵分解,都可以用单层神经网络或浅层自编码器实现[8]。

进入深度学习阶段后,无监督方法扩展到自编码器家族、变分自编码器和生成对抗网络等模型[6]。2013 年出现变分自编码器,2018 年前后又出现 UMAP 等流形降维方法,随后基于大规模预训练的对比学习与掩码建模进一步推动表示学习的发展[6]。

近年来,由于数据规模持续增长,而无监督方法不需要昂贵的标注成本,其在互联网数据上的大规模应用优势逐渐显现[6]。有研究者指出,现实中并不存在完全未知的数据集,因此部分研究转向兼顾两者的自监督与半监督方法[11]。

应用

聚类是无监督学习最基础的应用方向。它根据样本之间的相似性或差异把无标签数据分成若干组,常用于市场细分、图像压缩等场景;k 均值聚类中,k 值决定分组的规模与粒度[2]。在机器学习实践中,聚类既可以作为分析的最终结果,也可以作为后续任务的中间步骤,例如把用户按兴趣分组后用于营销或商品推荐。

关联规则挖掘是另一类常见用途,它通过规则寻找数据集内变量之间的关系,在市场篮分析和推荐系统中应用较多[2]。降维则用于特征数量过多的数据集,在保持数据完整性的同时把输入规模压缩到可处理的水平,通常出现在数据预处理阶段,例如用自编码器去除视觉数据中的噪声以改善画质[2]。

除此之外,无监督学习还适用于异常检测、客户画像和医学成像等任务[2]。在科学领域,天文学较早使用这类方法处理光谱分类和恒星分类等问题,随后扩展到数据挖掘、知识发现、源分类、离群点发现与形态分割等方向[11]。在天文数据处理中,主成分分析、自编码器、自组织映射、k 均值与 HDBSCAN 等方法都被用于组织数据信息、识别相似对象群组[11]。

局限

无监督学习最突出的困难在于评价标准不直接。由于没有标签作为参照,算法只能自行判断数据中哪些内容不同或值得关注,除非有人工介入验证输出变量,其结果可能出现较大偏差[2]。例如模型可以识别出线上购物者常常同时购买若干商品,但某一组合是否合理仍需数据分析人员判断[2]。

在性能与计算代价方面,监督学习模型通常比无监督学习模型更准确,但需要前期人工标注,且标注输入输出变量需要专业知识[2]。无监督学习模型则计算复杂度较高,需要较大的训练集才能产生预期结果,同时数据如何被聚类缺乏透明度,结果不准确的风险也更高[2]。

具体算法的适用范围也受到限制。以 k 均值聚类为例,它对初始中心较为敏感,容易陷入局部最优,并且只能发现球形簇[6]。主成分分析作为线性方法,对非线性结构的表达能力有限,而 t 分布随机邻域嵌入等方法虽然适合可视化,计算复杂度却较高[6]。

此外,这一术语本身也受到讨论。有研究提出可以引入监督范围的概念,认为算法无法学习超出其监督范围的内容,在只有数据自身作为监督来源时,学习结果仅限于数据的内在特征[12]。也有观点认为,无监督学习常被形容为「没有教师的学习」,但无监督网络通常仍按预先确定的学习规则运行,因此这一说法并不准确[5]。

参见

  • 监督学习 —— 使用带标签数据训练模型的机器学习范式,与无监督学习相对。

  • 强化学习 —— 三种机器学习范式之一,通过奖励信号学习行动策略。

  • 聚类分析 —— 无监督学习中最基础的任务类型,将相似样本归为一组。

  • 主成分分析 —— 经典的线性降维方法,常用于无监督数据处理。

  • 自编码器 —— 通过重构输入学习低维表示的神经网络模型。

  • 自组织映射 —— 采用竞胜学习并具有拓扑组织结构的无监督神经网络。

参考资料

  1. Db2 for Linux, UNIX and Windows - Focus sentinel . ibm.com [引用日期2026-10-04]
  2. 监督学习与无监督学习:有何区别? | IBM . ibm.com [引用日期2026-10-04]
  3. Science Magazine - July 17, 2015 . sciencemagazinedigital.org [引用日期2026-10-04]
  4. [科普中国]-无监督训练 . kepuchina.cn [引用日期2026-10-04]
  5. cambridge.org 上的网页 . cambridge.org [引用日期2026-10-04]
  6. 无监督学习 . baai.ac.cn [引用日期2026-10-04]
  7. edu.iq 上的 PDF 文件 . edu.iq [引用日期2026-10-04]
  8. erkki-oja-ieee-frank-rosenblatt-award-lecture . aalto.fi [引用日期2026-10-04]
  9. Dissertation(PDF) . uni-hamburg.de [引用日期2026-10-04]
  10. NOVA . ulisboa.pt [引用日期2026-10-04]
  11. S2213133724000660 . sciencedirect.com [引用日期2026-10-04]
  12. Is ‘Unsupervised Learning’ a Misconceived Term? . arxiv.org [引用日期2026-10-04]
词条评价
词条统计

浏览次数:1 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-10-03T17:47:41Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
监督学习 强化学习 聚类分析 主成分分析 自编码器 自组织映射
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。