Transformer 是 2017 年由 Google 团队提出的深度学习架构,其核心创新是摒弃了传统的循环和卷积结构,完全基于 concepts/attention-mechanism 实现序列建模。这一架构从根本上改变了 NLP 和 CV 的技术格局,是当前所有主流 LLM 的基础。
核心组件
Self-Attention(自注意力) 是 Transformer 的计算核心。每个位置的 token 通过三组线性变换生成 Query、Key、Value 向量,通过计算注意力权重来捕获序列内任意两个位置之间的依赖关系。Multi-Head Attention 将注意力空间拆分为多个子空间,使模型能同时关注不同类型的语义关系。
2026/5/29大约 2 分钟
