Skip to content

思路与直觉

本章目标

  1. 理解 SVR 的 ε-管道直觉——为什么管道内的样本不参与决策。
  2. 理解 RBF 核的非线性映射直觉——如何在高维空间中找到线性划分。
  3. 理解支持向量的稀疏性直觉——为什么模型复杂度由支持向量数量决定。

重点方法与概念速览

名称类型作用
ε-管道直觉概念管道宽度 2ϵ——管道内的样本被"忽视",管道外才受惩罚
平坦性直觉概念12|w|2 最小化——让拟合函数尽量平滑,不随样本剧烈弯曲
RBF 核直觉概念每个支持向量是一个"影响中心"——RBF 核在支持向量周围形成局部响应
支持向量直觉概念只有管道边界上和管道外的样本才影响模型——稀疏性的来源
C 的权衡直觉概念C 小 → 宽管道/多容忍 → 平滑但可能欠拟合;C 大 → 窄管道/少容忍 → 贴合但可能过拟合

1. 为什么当前数据适合讲 SVR

Friedman1 的目标函数是 y=10sin(πx1x2)+20(x30.5)2+10x4+5x5+ε——包含三种非线性结构。

参数速览

非线性类型Friedman1 中的体现线性模型能否捕捉SVR(RBF)能否捕捉
特征交互sin(πx1x2)——x1x2 以乘积耦合否——需要手动构造交互项是——RBF 核自动捕获
平方项20(x30.5)2——抛物线弯曲否——需手动构造 x32是——核映射隐式构造
正弦周期sin(πx1x2)——周期性震荡是——RBF 局部性适合拟合

理解重点

  • 如果数据是线性的——SVR 与线性回归无异,核函数的非线性价值无从展示。
  • Friedman1 刻意包含乘积、平方、正弦——三种典型的非线性结构,是展示 RBF 核能力的理想数据。
  • 这份数据就是为"观察 SVR 如何处理非线性"而选择的。

2. ε-管道的直觉:忽视小误差,关注大偏差

参数速览

参数名类型说明示例取值
ϵ管道半宽误差在 ±ϵ 内的样本不计损失epsilon=0.1
管道内样本概念|yf(x)|ϵ——不计损失,不是支持向量
管道边界上/外样本概念|yf(x)|ϵ——成为支持向量

示例代码

python
# 可视化 ε-管道概念
# 管道中心线: f(x)
# 管道上界: f(x) + epsilon
# 管道下界: f(x) - epsilon
# 管道内点: 无惩罚,非支持向量
# 管道外点: 线性惩罚,成为支持向量

理解重点

  • 想象拟合曲线周围有一个宽度为 2ϵ 的"管道"——管道内的样本"不受惩罚",管道外的样本才被惩罚。
  • ε 是一种"宽容度"——告诉模型:"误差在 ±0.1 以内就不算错"。
  • 这与 OLS 形成鲜明对比——OLS 对所有误差(无论多小)都给予平方惩罚,SVR 对小误差零容忍零惩罚。
  • ε 越大 → 管道越宽 → 更多样本被"放过" → 支持向量越少 → 模型越简单。

3. 平坦性的直觉:不仅要拟合,还要光滑

参数速览

参数名类型说明示例取值
12|w|2正则项控制拟合函数的"弯曲程度"——|w| 越小越平坦
C权衡参数拟合精度 vs 平坦性的权重——C 大 = 更重视精度C=10.0

理解重点

  • SVR 与其他回归方法的根本哲学差异:SVR 不仅关心"预测是否准确",还关心"拟合函数是否光滑"。
  • 想象两张纸——一张平整,一张褶皱——SVR 倾向于平整的那张,即使它不能穿过所有数据点。
  • w2 越小,拟合函数越"不弯曲"——这在高维核空间中表现为更少的支持向量。
  • C 控制"拟合精度"与"平坦性"的权衡——C=10.0 表示当前配置偏向拟合精度(较大 C = 较少的正则化)。

4. RBF 核的直觉:每个支持向量是一个影响中心

参数速览

参数名类型说明示例取值
RBF 核函数K(xi,x)=exp(γ|xix|2)kernel='rbf'
γ影响半径的倒数γ 大 → 影响范围小(局部);γ 小 → 影响范围大(全局)gamma='scale'

理解重点

  • RBF 核的本质:每个支持向量 xi 是一个"影响源"——它对附近点的预测贡献大(K1),对远处点的贡献小(K0)。
  • γ 控制"附近"的定义——γ 大 = 影响范围小,每个支持向量只影响极近邻的点 → 函数可以非常弯曲。
  • γ 小 = 影响范围大,每个支持向量影响远处 → 函数更平滑。
  • 多个支持向量的核函数加权叠加,形成了最终的拟合曲面——这就像用一堆高斯钟形曲线拼接出目标函数。

5. 支持向量的三分类直觉

训练后,每个样本根据其在管道中的位置分为三类:

参数速览

样本类型位置αiαi是否参与预测
管道内样本|yf(x)|<ϵ=0否——被模型忽略
管道边界上样本|yf(x)|=ϵ(0,C)是——定义了管道位置
管道外样本|yf(x)|>ϵ=C是——被惩罚的偏离点

理解重点

  • 管道内的样本对模型零影响——这是 SVR 稀疏性的根源:不重要的样本被彻底忽略。
  • 管道边界上的样本是"关键少数"——它们决定了拟合曲线的走向。
  • 管道外的样本是"被惩罚的偏离点"——C 限制了它们的影响力上限。
  • 支持向量数量 = 边界上样本数 + 管道外样本数——通常远小于总样本数。

6. C 和 ε 的联合调参直觉

参数速览

场景Cε效果
追求高精度大(如 100)小(如 0.01)窄管道 + 强惩罚 → 大量支持向量,可能过拟合
追求平滑小(如 1)大(如 1.0)宽管道 + 弱惩罚 → 少量支持向量,可能欠拟合
当前默认10.00.1中等——适合 Friedman1 的教学展示

理解重点

  • C 和 ε 不是独立的——调大 C 会让模型更努力覆盖管道外的点,可能需要调小 ε 来获得更细致的拟合。
  • 先定 ε(根据目标变量的量级和能容忍的误差),再调 C(根据过拟合/欠拟合状态)。
  • 支持向量数量是调参最直接的反馈——支持向量突然增多往往意味着 C 过大或 ε 过小。

7. 与线性回归和决策树回归的直觉对比

直觉维度线性回归决策树回归SVR
拟合方式全局直线/平面局部 if-else 分段全局核函数——支持向量加权叠加
误差态度所有误差都被惩罚(平方)叶子均值——隐含惩罚管道内不计——选择性惩罚
复杂度控制固定(特征数)max_depth 硬约束C + ε + γ 软约束
"看见"什么全部样本平等按分裂规则分区只看支持向量——管道内样本被忽略
模型结构w 向量二叉树支持向量集 + RBF 核

常见坑

  1. 以为 SVR 的"管道"会随训练数据自动选择最优宽度——ε 是超参数,需人工设定。
  2. 忽略 C 是正则化倒数——C 越大 = 正则化越弱 = 越容易过拟合,直觉与其他模型的 α 相反。
  3. 将 RBF 核的"无限维映射"理解成"一定能完美拟合"——无限维是理论能力,实际受 C、ε、γ 和样本量限制。
  4. 认为支持向量越少越好——过少的支持向量可能意味着欠拟合(管道太宽)。

小结

  • SVR 的核心直觉是三层:ε-管道提供宽容度,平坦性正则化提供光滑性,RBF 核提供非线性。
  • ε-管道使大量样本被"忽略"——这是 SVR 稀疏性的根源,也是它与所有"所有样本都参与"的回归方法最根本的区别。
  • RBF 核将每个支持向量变成一个"影响中心"——最终拟合是多个高斯钟形曲线的加权叠加。
  • 支持向量数量是模型复杂度的直接反映——比 R² 或 MSE 更直观地告诉你模型"有多复杂"。