0%

高斯过程

空间插值问题可以这样描述:在若干已知位置 x1,,xnx_1, \ldots, x_n 观测到值 y1,,yny_1, \ldots, y_n,如何估计任意位置 xx^* 处的值?地理学界经典的答案是克里金(Kriging),机器学习界的答案是高斯过程(Gaussian Process)。这两个名字来自不同学科,但数学上是同一个东西。本文从贝叶斯线性回归出发,推导高斯过程回归的核心公式,并说明它为什么就是克里金的概率版本。

从贝叶斯线性回归到函数分布

权重空间视角

考虑线性回归模型 f(x)=ϕ(x)wf(x) = \phi(x)^{\top} w,其中 ϕ(x)\phi(x) 是特征映射(可以是多项式、径向基等)。对权重 ww 赋予高斯先验 wN(0,Σp)w \sim \mathcal{N}(0, \Sigma_p),观测 y=f(x)+εy = f(x) + \varepsilonεN(0,σn2)\varepsilon \sim \mathcal{N}(0, \sigma_n^2)。由高斯分布的共轭性,后验也是高斯,预测分布的均值和方差有解析形式:

fˉ=ϕ(x)ΣpΦ(ΦΣpΦ+σn2I)1y\bar{f}_* = \phi(x_*)^{\top} \Sigma_p \Phi^{\top} \left( \Phi \Sigma_p \Phi^{\top} + \sigma_n^2 I \right)^{-1} y

V[f]=ϕ(x)Σpϕ(x)ϕ(x)ΣpΦ(ΦΣpΦ+σn2I)1ΦΣpϕ(x)\mathbb{V}[f_*] = \phi(x_*)^{\top} \Sigma_p \phi(x_*) - \phi(x_*)^{\top} \Sigma_p \Phi^{\top} \left( \Phi \Sigma_p \Phi^{\top} + \sigma_n^2 I \right)^{-1} \Phi \Sigma_p \phi(x_*)

其中 Φ\Phi 是特征矩阵。这个形式的问题在于:特征映射 ϕ\phi 需要显式选择,特征维度可能很高甚至无限。

函数空间视角:核技巧

注意到上面公式里特征只以内积形式出现:ΦΣpΦ\Phi \Sigma_p \Phi^{\top}ϕ(x)Σpϕ(x)\phi(x_*)^{\top} \Sigma_p \phi(x_*)。定义核函数:

k(x,x)=ϕ(x)Σpϕ(x)k(x, x') = \phi(x)^{\top} \Sigma_p \phi(x')

核函数是特征空间的内积,它让我们无需显式构造 ϕ\phi 就能计算高维甚至无限维特征空间的内积。这就是高斯过程的核技巧视角:一个高斯过程就是定义在函数空间上的高斯分布,由均值函数 m(x)m(x) 与协方差函数(核)k(x,x)k(x, x') 完全刻画:

fGP(m(x),k(x,x))f \sim \mathcal{GP}(m(x), k(x, x'))

高斯过程的直觉:它不是输出一个函数,而是输出一个"函数的分布"。任意有限个点处的函数值服从多元高斯分布:

[f(x1),,f(xn)]N(μ,K)[f(x_1), \ldots, f(x_n)] \sim \mathcal{N}(\mu, K)

其中 Kij=k(xi,xj)K_{ij} = k(x_i, x_j)。核函数 kk 编码了我们关于函数光滑性的先验:核函数值随距离衰减得越快,函数越"崎岖"。

高斯过程回归

联合分布与条件分布

给定训练数据 (X,y)(X, y),观测 y=f(X)+εy = f(X) + \varepsilon,测试点 XX_* 处的函数值 ff_*。训练观测与测试值的联合分布为:

[yf]N(0,[K(X,X)+σn2IK(X,X)K(X,X)K(X,X)])\begin{bmatrix} y \\ f_* \end{bmatrix} \sim \mathcal{N}\left( 0, \begin{bmatrix} K(X, X) + \sigma_n^2 I & K(X, X_*) \\ K(X_*, X) & K(X_*, X_*) \end{bmatrix} \right)

条件分布(高斯条件公式)给出预测:

预测均值

fˉ=K(X,X)[K(X,X)+σn2I]1y\bar{f}_* = K(X_*, X) \left[ K(X, X) + \sigma_n^2 I \right]^{-1} y

预测方差

V[f]=K(X,X)K(X,X)[K(X,X)+σn2I]1K(X,X)\mathbb{V}[f_*] = K(X_*, X_*) - K(X_*, X) \left[ K(X, X) + \sigma_n^2 I \right]^{-1} K(X, X_*)

预测均值是训练观测的核加权线性组合,权重由核矩阵的逆决定;预测方差给出每个预测点的不确定性估计,这是高斯过程区别于普通插值方法的核心能力:它不仅给出插值结果,还给出"这个结果有多可信"

常用的核函数

径向基核(RBF):最常用,对应无限维特征空间:

k(x,x)=σf2exp(xx22l2)k(x, x') = \sigma_f^2 \exp\left( -\frac{\|x - x'\|^2}{2l^2} \right)

其中 ll 是长度尺度(length scale),控制函数光滑度;σf2\sigma_f^2 是信号方差。在空间插值语境下,ll 就是空间相关的"作用半径"ll 大意味着远处的点也互相影响,ll 小意味着只有近邻相关。

Matérn 核:更灵活,通过参数 ν\nu 控制光滑度,ν\nu \to \infty 时退化为 RBF:

kν(x,x)=σf221νΓ(ν)(2νxxl)νKν(2νxxl)k_\nu(x, x') = \sigma_f^2 \frac{2^{1-\nu}}{\Gamma(\nu)} \left( \frac{\sqrt{2\nu}\|x - x'\|}{l} \right)^\nu K_\nu\left( \frac{\sqrt{2\nu}\|x - x'\|}{l} \right)

ν=3/2\nu = 3/2ν=5/2\nu = 5/2 是实际中的常用选择,比 RBF 更贴合真实空间数据的粗糙度。

超参数学习

核函数中的超参数(llσf2\sigma_f^2σn2\sigma_n^2)通过最大化边际似然(marginal likelihood)学习:

logp(yX)=12y(K+σn2I)1y12logK+σn2In2log2π\log p(y \mid X) = -\frac{1}{2} y^{\top} \left( K + \sigma_n^2 I \right)^{-1} y - \frac{1}{2} \log \left| K + \sigma_n^2 I \right| - \frac{n}{2} \log 2\pi

边际似然自动实现奥卡姆剃刀:过复杂的模型(核太"活泼")拟合噪声需要更高的复杂度惩罚项 logK\log|K|,简单模型拟合数据不足则残差项大。对超参数求导可用梯度优化,这是高斯过程"自动调参"的机制。

高斯过程 vs 克里金:同一个数学,两个名字
克里金的预测公式与高斯过程回归的预测均值完全一致:克里金的变差函数(variogram)对应高斯过程的核函数,克里金的权重求解就是核矩阵求逆。区别在于学科语言与扩展方向:地理学强调空间相关结构分析(变差函数拟合),机器学习强调核选择与边际似然优化。理解等价性后,两边的文献可以互相翻译。

计算复杂度与近似方法

高斯过程回归需要求 n×nn \times n 核矩阵的逆,复杂度 O(n3)O(n^3),存储 O(n2)O(n^2)。当样本数超过几千时直接计算不可行,常见近似:

  • 稀疏近似(Inducing Points):用 mnm \ll n 个诱导点近似核矩阵(如 FITC、VFE),复杂度降到 O(nm2)O(nm^2)
  • 随机特征:用随机傅里叶特征近似核函数,把 GP 变成线性模型。
  • 可扩展变分(SVGP):结合变分推断与诱导点,支持小批量训练,适合大规模数据。

空间插值中的实际用法

以气象站点数据插值为例:站点位置 xix_i、温度 yiy_i,目标是在网格上估计温度场。流程为:

  1. 选核函数(Matérn 5/2 常用),初始化超参数。
  2. 最大化边际似然学习 llσf2\sigma_f^2σn2\sigma_n^2
  3. 对每个网格点计算预测均值与方差,得到温度场与不确定性场。

高斯过程相比确定性插值(IDW、样条)的优势是自带不确定性:站点稀疏区域的预测方差大,这在决策场景(哪里需要补测站点)中直接可用。相比普通克里金,GP 框架更容易扩展:加异方差噪声、多任务联合插值、与深度学习特征结合(深度核学习)。

参考

[1] Rasmussen, C. E., & Williams, C. K. I. Gaussian Processes for Machine Learning. MIT Press, 2006.
[2] Matheron, G. Principles of Geostatistics. Economic Geology, 58(8):1246-1266, 1963.
[3] Krige, D. G. A Statistical Approach to Some Basic Mine Valuation Problems on the Witwatersrand. Journal of the Southern African Institute of Mining and Metallurgy, 1951.
[4] Cressie, N. Statistics for Spatial Data. Wiley, 1993.
[5] Williams, C. K. I., & Rasmussen, C. E. Gaussian Processes for Regression. NeurIPS 1996.
[6] Titsias, M. Variational Learning of Inducing Variables in Sparse Gaussian Processes. AISTATS 2009.
[7] Wilson, A. G., et al. Deep Kernel Learning. AISTATS 2016.

🌙