思路与直觉
本章目标
- 用直观方式理解决策树到底在做什么。
- 理解为什么它在当前二维多分类 blob 数据上更能体现区域切分优势。
- 理解它与更偏全局线性边界的方法在思路上的关键差异。
重点方法与概念速览
| 名称 | 类型 | 作用 |
|---|---|---|
| 规则切分 | 核心直觉 | 通过连续提问把数据逐步分开 |
| 区域划分 | 决策形状 | 形成一块块轴对齐的分类区域 |
| 树深 | 复杂度指标 | 控制规则切分有多细,对应 max_depth 参数 |
| 特征重要性 | 可解释性 | 帮助理解哪些特征最常被用来切分 |
| 逻辑回归 | 对比算法 | 更偏全局线性边界 |
1. 为什么需要决策树
对于很多分类问题,我们不一定想先拟合一个整体公式。有时更自然的问题是:
能不能通过一连串规则判断,把样本一步步分到正确类别里?
决策树给出的思路是:
- 先问一个最有区分度的问题。
- 再在每个子区域里继续问下一个问题。
- 重复下去,直到区域足够纯净。
理解重点
- 这使决策树成为一种非常直观的规则模型。
- 它的预测更像执行一串 if-else 判断,而不是代入一个全局公式。
- 这也是为什么决策树天然具有较强可解释性。
2. 为什么当前仓库示例里它表现合理
当前决策树数据来自 make_blobs(n_samples=400, centers=4),特点是:
- 4 个类别
- 二维空间
- 各类分布在不同区域
理解重点
- 对这类数据来说,把平面切成一块块区域是很自然的分类方式。
- 决策树通过轴对齐切分,能够较直观地把不同类别样本分到不同区域里。
- 这正是当前数据能体现决策树优势的原因。
3. 用"不断提问"理解算法
可以把决策树理解成:
- 先问一个能最好分开样本的问题。
- 根据回答把样本分到不同分支。
- 对每个分支继续重复这一过程。
理解重点
- 这也是为什么
max_depth在当前分册里最值得专门观察——它限制最多能问多少轮问题。 - 如果把决策树仅理解成"一个会分类的黑盒",就会错过它最有辨识度的规则切分思想。
4. 为什么 blob 数据适合树的区域切分
理解重点
- 当前数据在二维空间中形成多个类别区域,和决策树"不断划分空间"的方式比较匹配。
- 决策树的边界通常是轴对齐的(如
),因此在这类区域化分布中容易形成清晰解释。 - 这也是为什么当前分册里特征重要性图也很有意义:树确实是在用具体特征做一层层切分。
5. 与逻辑回归的直觉差异
两者的核心差异可以这样理解:
| 算法 | 决策边界 | 核心依据 | 适用场景 |
|---|---|---|---|
| LogisticRegression | 全局线性超平面 | 线性打分 + Sigmoid 概率映射 | 近线性可分数据 |
| DecisionTreeClassifier | 局部轴对齐分段边界 | 不纯度下降 + 递归划分 | 区域化分布数据 |
理解重点
- 逻辑回归更像是在问:整张图上最好的一条全局边界是什么。
- 决策树更像是在问:先切哪一刀最能让类别变纯,再切下一刀。
- 当前 blob 数据更适合把决策树作为规则切分基线来讲解。
可视化

常见坑
- 只知道决策树很直观,却说不出它为什么适合当前 blob 数据。
- 把所有树切分都理解成"随机切",而忽略它其实在优化不纯度下降。
- 只关注预测结果,不关注树深、叶节点和特征重要性的解释价值。
- 忽略树越深越容易过拟合这一现实风险。
小结
- 决策树的直觉重点有两个:规则切分和区域划分。
- 当前仓库使用二维多分类 blob 数据,正好体现了它通过连续提问划分空间的能力。
- 与逻辑回归的全局线性边界不同,决策树形成的是局部、轴对齐的分段决策边界。
- 如果已经理解"为什么它不断提问并把空间切成越来越纯净的区域",就已经抓住了本分册最核心的直觉。