Transformer架构详解
整体架构概述
Transformer采用经典的编码器-解码器(Encoder-Decoder)架构,完全基于注意力机制构建。
编码器架构
编码器层结构
每个编码器层包含两个主要组件:
- 多头自注意力机制(Multi-Head Self-Attention)
- 位置前馈网络(Position-wise Feed-Forward Network)
多头自注意力
多头自注意力是编码器的核心组件,允许模型同时关注序列中不同位置的信息。
解码器架构
解码器层结构
每个解码器层包含三个主要组件:
- 掩码多头自注意力(Masked Multi-Head Self-Attention)
- 编码器-解码器多头注意力(Encoder-Decoder Multi-Head Attention)
- 位置前馈网络(Position-wise Feed-Forward Network)
注意力机制详解
缩放点积注意力
Transformer使用缩放点积注意力作为基础注意力函数:
Attention(Q, K, V) = softmax(QK^T / √d_k)V