0%

长上下文是过去两年模型结构演进最集中的方向。标准注意力在序列长度上带有平方复杂度,序列翻倍、计算量变四倍,同时还需要一份随长度线性增长的 KV 缓存。围绕这个瓶颈出现了两条完全不同的技术路线:一条想办法把注意力本身线性化,用固定大小的状态替代全量键值;另一条把序列建模重新表述成状态空间递推,用可并行的扫描算法保住训练效率。本文将先给出能同时容纳这两条路线的统一框架,再分别推导线性注意力的核方法与状态空间模型的离散化,接着讨论 Mamba 的选择性机制与状态空间对偶,最后把长上下文的工程手段(位置外推、注意力汇、KV 压缩、序列并行)与选型判据一并收口。

阅读全文 »

YOLO 是目标检测里被使用得最多的单阶段方法。它的价值不在于某个模块的精巧,而在于把检测从一条由候选框、分类器、回归器拼成的多阶段流水线,压缩成一次前向传播就能出结果的统一网络:图像进来,网格化的密集预测出去。从 2016 年到现在,家族内部的骨干网络、特征融合、标签分配、损失函数与后处理几乎被逐项换过一轮,但单网络单次前向这个骨架没有变。本文将按自顶向下的顺序,从统一框架与评价指标出发,逐层讨论骨干、颈部、检测头与标签分配、损失函数、后处理,再给出范式对比、版本演进主线与工程落地要点。

阅读全文 »
🌙