给定一张地图上的一堆点(犯罪事件、店铺位置、疾病病例),我们关心的常常不是"哪里密度高"(那是核密度分析的答案),而是"这些点的空间分布是随机的、聚集的还是均匀的"。这个问题是点模式分析(Point Pattern Analysis)的核心。本文从空间完全随机性(CSR)假设出发,介绍 Ripley’s K 函数、L 函数与交叉 K 函数,它们用"距离尺度的函数"刻画点分布的空间结构。
空间完全随机性(CSR)
泊松过程模型
点模式分析的基准是空间完全随机性(Complete Spatial Randomness, CSR):点在研究区域内独立均匀分布。数学上对应齐次泊松点过程,其性质是:
- 任意区域 内的点数服从泊松分布:,其中 是强度(单位面积的平均点数), 是区域面积。
- 不同区域的点数相互独立。
CSR 是"零假设":如果点模式显著偏离 CSR,则存在聚集(clustered)或规则(regular)结构。点模式分析的框架就是构造统计量、与 CSR 的理论值对比、检验偏离。
聚集与规则
- 聚集(Clustered):点在局部区域密集,小距离上"点的邻居异常多"。
- 规则(Regular):点之间互相排斥,分布均匀,小距离上"点的邻居异常少"(如树木间距受竞争限制)。
Ripley’s K 函数
定义
Ripley’s K 函数刻画"以任意点为中心、半径 的圆内平均有多少个其他点":
在 CSR 假设下, 的理论值是圆的面积:
因为 CSR 下点的位置独立均匀,任意点周围的其他点密度就是全局强度 ,半径 圆内期望点数为 。
估计
实际数据中 用经验估计,需要考虑边界效应(研究区域边缘的点,其圆会超出区域):
其中 是研究区域面积, 是点数, 是边校正权重(如 Ripley 的 isotropic 校正: 等于以 为圆心、 为半径的圆弧落在区域内的比例)。边校正保证估计无偏。
解读
- :小距离上邻居过多,点聚集。
- :小距离上邻居过少,点规则分布。
- :符合 CSR。
是尺度化的:不同 值对应不同的距离尺度,它揭示"聚集发生在哪个尺度"。例如犯罪点可能在 200 米尺度聚集(街头犯罪),在 2 公里尺度均匀(城市整体覆盖)。
L 函数:稳定化的 K
定义
与 的比较在数值上随 增长,不直观。L 函数对 做变换,使 CSR 下的理论值为一条直线:
CSR 下 。更常用的版本减去基准线,突出偏离:
- :聚集(在尺度 上邻居多于 CSR)。
- :规则分布。
- :CSR。
L 函数的优势是零基线直观:所有偏离都围绕 0 波动,方便做置信带检验。
置信带与显著性
L 函数的显著性通过蒙特卡洛模拟检验:在区域内按 CSR 模拟大量点集(如 999 次),每次计算 ,取模拟值的包络(如 2.5% 与 97.5% 分位)作为置信带。真实数据 超出置信带的位置,才认为在该尺度上有显著聚集或规则结构。这个模拟框架是点模式分析的通用显著性检验方式。
交叉 K 函数:两类点的空间关系
定义
当有两类点(如商店 A 与商店 B、病例与对照)时,关心的是两类点之间的空间关系。交叉 K 函数统计"以 类点为中心、半径 内 类点的平均数量":
CSR(两类点独立随机)下理论值仍为 。交叉 L 函数:
解读
- : 类点倾向于出现在 类点附近(吸引,如店铺聚集在商圈)。
- : 类点避开 类点(排斥,如竞争性店铺保持距离)。
- 蒙特卡洛检验时,模拟需要保持两类点的数量不变,随机重排位置(随机标记检验),而不是重新生成点。
交叉 K 函数在生态学(物种共存/排斥)、流行病学(病例 vs 对照的空间聚集)、商业地理(竞争/互补关系)中应用广泛。
实践要点
边界效应
点模式分析最大的实践陷阱是边界效应:研究区域边缘的点,其邻域圆超出区域,若不校正会低估 。常用边校正:
- isotropic 校正:按圆弧落在区域内的比例加权。
- translate 校正:按平移后仍落在区域内的比例加权。
- border 校正:只统计到边界距离 的点,最简单但丢弃数据。
非平稳性
K/L 函数假设强度 均匀(平稳点过程)。真实数据常是非平稳的(城市中心点密度高、郊区低),此时 K 函数会把"整体密度变化"误判为"聚集"。处理方式:
- 分区域分析:把研究区划分为子区域,分别分析。
- 非齐次 K 函数:用核密度估计的强度 归一化,。
与密度聚类、核密度的配合
完整的空间点分析工作流:先用核密度看整体形态,用 HDBSCAN 得到簇划分,再用 K/L 函数检验聚集的尺度与显著性,三者回答不同层次的问题(哪里密、怎么分组、聚集是否显著)。
参考
[1] Ripley, B. D. Modelling Spatial Patterns. Journal of the Royal Statistical Society Series B, 1977.
[2] Besag, J. Contribution to the Discussion of Dr. Ripley’s Paper. Journal of the Royal Statistical Society Series B, 1977.
[3] Dixon, P. M. Ripley’s K Function. Encyclopedia of Environmetrics, 2002.
[4] Baddeley, A., Rubak, E., & Turner, R. Spatial Point Patterns: Methodology and Applications with R. Chapman & Hall/CRC, 2015.
[5] Getis, A., & Franklin, J. Second-Order Neighborhood Analysis of Mapped Point Patterns. Ecology, 1987.
[6] Wiegand, T., & Moloney, K. A. Rings, Circles, and Null-Models for Point Pattern Analysis in Ecology. Oikos, 2004.
[7] Ripley, B. D. Statistical Inference for Spatial Processes. Cambridge University Press, 1988.