Skip to content

思路与直觉

本章目标

  1. 用直观方式理解决策树到底在做什么。
  2. 理解为什么它在当前二维多分类 blob 数据上更能体现区域切分优势。
  3. 理解它与更偏全局线性边界的方法在思路上的关键差异。

重点方法与概念速览

名称类型作用
规则切分核心直觉通过连续提问把数据逐步分开
区域划分决策形状形成一块块轴对齐的分类区域
树深 dmax复杂度指标控制规则切分有多细,对应 max_depth 参数
特征重要性可解释性帮助理解哪些特征最常被用来切分
逻辑回归对比算法更偏全局线性边界 wTx+b=0

1. 为什么需要决策树

对于很多分类问题,我们不一定想先拟合一个整体公式。有时更自然的问题是:

能不能通过一连串规则判断,把样本一步步分到正确类别里?

决策树给出的思路是:

  • 先问一个最有区分度的问题。
  • 再在每个子区域里继续问下一个问题。
  • 重复下去,直到区域足够纯净。

理解重点

  • 这使决策树成为一种非常直观的规则模型。
  • 它的预测更像执行一串 if-else 判断,而不是代入一个全局公式。
  • 这也是为什么决策树天然具有较强可解释性。

2. 为什么当前仓库示例里它表现合理

当前决策树数据来自 make_blobs(n_samples=400, centers=4),特点是:

  • 4 个类别
  • 二维空间
  • 各类分布在不同区域

理解重点

  • 对这类数据来说,把平面切成一块块区域是很自然的分类方式。
  • 决策树通过轴对齐切分,能够较直观地把不同类别样本分到不同区域里。
  • 这正是当前数据能体现决策树优势的原因。

3. 用"不断提问"理解算法

可以把决策树理解成:

  1. 先问一个能最好分开样本的问题。
  2. 根据回答把样本分到不同分支。
  3. 对每个分支继续重复这一过程。

理解重点

  • 这也是为什么 max_depth 在当前分册里最值得专门观察——它限制最多能问多少轮问题。
  • 如果把决策树仅理解成"一个会分类的黑盒",就会错过它最有辨识度的规则切分思想。

4. 为什么 blob 数据适合树的区域切分

理解重点

  • 当前数据在二维空间中形成多个类别区域,和决策树"不断划分空间"的方式比较匹配。
  • 决策树的边界通常是轴对齐的(如 x13.2),因此在这类区域化分布中容易形成清晰解释。
  • 这也是为什么当前分册里特征重要性图也很有意义:树确实是在用具体特征做一层层切分。

5. 与逻辑回归的直觉差异

两者的核心差异可以这样理解:

算法决策边界核心依据适用场景
LogisticRegression全局线性超平面 wTx+b=0线性打分 + Sigmoid 概率映射近线性可分数据
DecisionTreeClassifier局部轴对齐分段边界不纯度下降 + 递归划分区域化分布数据

理解重点

  • 逻辑回归更像是在问:整张图上最好的一条全局边界是什么。
  • 决策树更像是在问:先切哪一刀最能让类别变纯,再切下一刀。
  • 当前 blob 数据更适合把决策树作为规则切分基线来讲解。

可视化

决策边界

常见坑

  1. 只知道决策树很直观,却说不出它为什么适合当前 blob 数据。
  2. 把所有树切分都理解成"随机切",而忽略它其实在优化不纯度下降。
  3. 只关注预测结果,不关注树深、叶节点和特征重要性的解释价值。
  4. 忽略树越深越容易过拟合这一现实风险。

小结

  • 决策树的直觉重点有两个:规则切分和区域划分。
  • 当前仓库使用二维多分类 blob 数据,正好体现了它通过连续提问划分空间的能力。
  • 与逻辑回归的全局线性边界不同,决策树形成的是局部、轴对齐的分段决策边界。
  • 如果已经理解"为什么它不断提问并把空间切成越来越纯净的区域",就已经抓住了本分册最核心的直觉。