决策树模型是机器学习和决策分析中一种基于树形结构的预测模型,它通过一系列条件判断把样本逐步划分到不同的子集,最终在叶节点给出分类结果或数值预测。该模型把决策规则以流程图式的形式呈现,推理路径清晰,是少数具有较强可解释性的算法之一。ID3、C4.5 与 CART 是其中影响最广的几种算法,而以决策树为基学习器的随机森林、梯度提升树等集成方法进一步提升了预测精度。
定义
决策树模型是一种以树形结构表示决策规则的监督学习模型,由节点和有向边组成,节点分为内部节点与叶节点两类[1]。内部节点表示对某个特征的测试,每个分支对应该特征的一个取值,叶节点则给出类别标记或数值结果[2]。
从数据挖掘的角度看,决策树是常用分析技术之一,通过树状图示化的决策规则把目标群体划分为若干子集,用于分类、评分和预测等任务[3]。当因变量为离散类别时,模型执行分类;为连续数值时,模型执行回归,此类算法因此常被称为分类与回归树[4]。
原理
决策树的构造通常采用自顶向下的递归方式,属于贪心搜索策略。算法在每个节点评估所有候选特征,选择能把当前样本划分得最“纯”的那个特征作为测试条件,然后按其特征取值生成子节点,并对子集递归调用同一过程[5]。当子集中样本类别一致,或可用特征耗尽时停止分裂。整个构造过程可概括为选择分裂、判断终止与叶节点赋值三个方面[6]。
衡量节点“不纯度”的方式主要有三类。基于信息论的做法用熵描述不确定性,并定义信息增益为划分前后熵的减少量,选择增益最大的特征[7];CART 则使用基尼系数,其值越小表示节点越纯[8]。以熵为准则时,增益的计算可写为 $Gain(A)=H(D)-\sum_{v}\frac{|D_v|}{|D|}H(D_v)$,其中 $H(D)$ 为数据集 $D$ 的熵。
生成完整树后通常还要剪枝。预剪枝在分裂前依据样本数或增益阈值提前停止生长,后剪枝则先构造完整树再删除对预测贡献不显著的子树,实际应用中预剪枝速度更快,后剪枝所得树的准确率往往更高[5]。CART 使用交叉验证选择剪枝幅度,并通过替代分支处理缺失值[9]。
flowchart TD
A[根节点: 特征 1 测试] -->|取值甲| B[内部节点: 特征 2 测试]
A -->|取值乙| C[叶节点: 类别 1]
B -->|取值丙| D[叶节点: 类别 2]
B -->|取值丁| E[叶节点: 类别 1]
发展历程
决策树算法是最早的机器学习算法之一。1966 年,Hunt、Marin 和 Stone 提出的 CLS 学习系统已包含决策树算法的基本概念,该思想后来成为 ID3、C4.5 和 CART 等多种算法的基础[10][1]。
1979 年,J. Ross Quinlan 给出 ID3 算法的原型,并在 1983 年和 1986 年对其作了总结与简化,正式确立决策树学习的理论框架,此后 ID3 成为应用广泛的决策树算法[10]。ID3 只能处理离散的符号型属性,且倾向于选择取值较多的特征,1986 年 Schlimmer 和 Fisher 在其基础上引入节点缓冲区,提出了 ID4 算法[10]。
1984 年,Leo Breiman、Jerome Friedman、Richard Olshen 和 Charles Stone 提出分类与回归树(CART),采用基尼系数作为属性选择判据并默认生成二分树,同时用交叉验证估计误分类损失[11][4]。1993 年,Quinlan 在 ID3 的基础上改进出 C4.5,改用信息增益率选择分裂属性,能够处理连续属性和缺失值,并加入剪枝与规则派生功能,成为机器学习中影响最广的算法之一[10][4]。
此后,以决策树为基学习器的集成方法进一步发展。Breiman 在 2001 年提出随机森林,通过对样本和特征的双重随机抽样构建多棵树并以投票或平均方式汇总结果[12];梯度提升类方法则以逐步拟合残差的方式组合多棵树,成为结构化数据上精度较高的常用模型[13]。
应用
决策树在医疗诊断领域使用较多。已有综述梳理了决策树及其集成方法在疾病识别中的研究,涉及心脏病、慢性肾病、青光眼、肝炎等任务,常用的评价指标包括准确率、召回率与 AUC[14]。有研究以决策树作为基学习器构建 AdaBoost 集成模型用于慢性肾病检测,报告了较高的分类准确率[15]。
金融领域是决策树的另一类主要应用场景。通过分析历史数据并筛选相关变量,决策树可用于评估借款人的信用状况,帮助机构判断贷款风险;同类方法也被用于识别交易数据中的异常模式[14]。有实验在信用违约数据集上比较多种模型,决策树在准确率与 F1 值上均有表现,而以树为基础的 LightGBM 等模型在相同数据上取得了更高的准确率[16]。
在工业与运营分析中,决策树同样被用于风险与状态预测。有研究以天气等环境因素为输入建立决策树模型预测输电线路运行状态,并利用测试集评估模型效果[11]。由于输出为可读的判定规则,这类模型在需要向业务人员解释决策依据的场合具有实用性。
局限
决策树容易出现过拟合。当模型过于贴近训练数据的细节与噪声时,对新数据的预测能力会下降;一个完全生长的树可能让每个叶节点只对应少量甚至单个样本,模型退化为对训练数据的查表,泛化能力很弱[5]。常见的应对办法是限制最大深度、设定叶节点最小样本数,或对树进行剪枝[17]。
模型对数据扰动较敏感,稳定性不足。样本的小幅变化可能导致生成结构差异较大的树,在样本量较小时结果波动尤为明显。CART 的跨样本方差较高,其树结构和据此得到的预测在新样本中不一定稳定,随机森林等重采样集成方法正是为缓解这一问题而提出的[18]。
分裂准则本身也带来偏向与表达能力的限制。算法倾向于选择可提供更多分裂点的变量,取值数较多的类别变量或连续变量更容易被选中,变量含有较多缺失值或替代变量缺失值较少时也可能影响选择结果[19]。此外,决策树只能进行与坐标轴平行的简单分裂,难以直接刻画如 $y=x_1+4x_2$ 这类特征线性组合的关系,且贪心搜索在每个节点只做局部最优判断,可能错过整体更优的树结构[20]。
在某些数据条件下表现也会受限。当某个类别占主导时,生成的树可能偏向多数类;对连续数值变量进行分箱处理可能引入偏差[20]。随着树不断增大,其结构可能变得复杂,可解释性随之下降,在特征维度很高的数据上也更容易过拟合[14]。
参见
参考资料
- 决策树-云社区-华为云 . huaweicloud.com [引用日期2026-10-04]
- [151] C . edu.my [引用日期2026-10-04]
- selectPORSrchArticle . re.kr [引用日期2026-10-04]
- CART是建構決策樹時最常用的演算法之一 . nycu.edu.tw [引用日期2026-10-04]
- AI遮天传 ML-初识决策树 . aliyun.com [引用日期2026-10-04]
- core.ac.uk 上的 PDF 文件 . core.ac.uk [引用日期2026-10-04]
- Hindawi . nih.gov [引用日期2026-10-04]
- 41598_2023_34684_MOESM1_ESM(PDF) . springer.com [引用日期2026-10-04]
- Mathias VALLA - PhD Manuscript VUCBL1(PDF) . hal.science [引用日期2026-10-04]
- 第3章 决策树的发展 . cnki.net [引用日期2026-10-04]
- c-s-a.org.cn 上的网页 . c-s-a.org.cn [引用日期2026-10-04]
- S1062737522000087 . sciencedirect.com [引用日期2026-10-04]
- pdf . mdpi.com [引用日期2026-10-04]
- citations . ieee.org [引用日期2026-10-04]
- \[T_i = PCA(F_i)\] . ieee.org [引用日期2026-10-04]
- hep.com.cn 上的网页 . hep.com.cn [引用日期2026-10-04]
- tree . sourceforge.net [引用日期2026-10-04]
- unt.edu 上的 PDF 文件 . unt.edu [引用日期2026-10-04]
- A Brief History of Classification and Regression Trees . washstat.org [引用日期2026-10-04]
- recitation9(PDF) . mit.edu [引用日期2026-10-04]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-03T17:36:09Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。