0%

Transformer 是 2017 年之后几乎全部主流语言模型的骨架。它的价值不在于某个单一技巧,而在于用注意力把序列建模的三件事同时解决:任意两个位置可以直接交互、整条序列可以并行计算、位置信息以显式方式注入。本文将按自顶向下的顺序,从统一框架出发逐层推导自注意力、位置编码、残差与归一化、前馈网络与掩码,再讨论三种架构范式、训练与推理的工程要点、架构演进主线,最后给出它与图注意力之间的联系。

阅读全文 »

最近参与了一个横向,项目架构与基础代码大概稳定下来了,浅浅记录一下。

阅读全文 »

给定一张地图上的一堆点(犯罪事件、店铺位置、疾病病例),我们关心的常常不是"哪里密度高"(那是核密度分析的答案),而是"这些点的空间分布是随机的、聚集的还是均匀的"。这个问题是点模式分析(Point Pattern Analysis)的核心。本文从空间完全随机性(CSR)假设出发,介绍 Ripley’s K 函数、L 函数与交叉 K 函数,它们用"距离尺度的函数"刻画点分布的空间结构。

阅读全文 »
🌙