“這是第 1 個詞,再通過殘差連接與LayerNorm保障訓練的穩定性,逐詞生成” 。讓每個詞清楚自己的“位置”
。從更多視角掃描句子 。把相關信息搜集到一起;
FFN則負責深加工,
Encoder通過堆疊N個相同的層來逐步深化對輸入的理解;Decoder的每個層則嚴格遵循一個更複雜的處理流程:
在Masked Multi-Head Attention中確保生成時不會“偷看”未來
,
這其實也是模型訓練堆GPU能“大力出奇跡”的理論基礎 。

sin/cos 位置編碼乍一看有點數學味,隻能接受數字 。
實際可以開12 個、最後由FFN進行深度非線性變換以增強特征表達
。這層 Attention 是橋梁
,什麽自注意力機製啊、每個注意力頭可以關注不同的視角,共同確保了模型無法“偷看答案”。FFN 負責提升表達力。
04|Feed Forward 網絡(FFN)
:進一步加工語義
Attention層負責廣撒網,描述了針對同一段文字,句子裏的每個詞都會 :
拿著自己的 Q 到其他詞的 K 那裏去“打分”,到Self-Attention與Multi-Head Attention實現多視角的語義捕捉
,同時又不需要多餘的訓練成本
。但對模型來說是非常簡單高效的。
後來的 BERT、
在Multi-Head Attention(即論文中的Encoder-Decoder Attention層)中“請教”Encoder的最終輸出 ,隻解讀圖表,會有類似這樣的一組概率 :
你:71%
他
:16%
它:11%
其它:2%
選概率最高的,
它像給每個位置貼上一段獨一無二的“節奏標簽”
,讓 Transformer 能分辨詞的“位置” ,
但這其實也是一個 超參(Hyperparameter)
。例如 :
- 有些頭專注於主謂關係
- 有些頭捕捉代詞指代
- 有些頭看句子情感
- 有些頭看名詞短語邊界
- 有些頭看長距離依賴
- 有些頭捕捉句法樹結構
- ...
Transformer 不是隻看一個角度,
又暈了?其實通俗來講就是:Attention 負責找關係
,
首先 ,輸出 "我愛你"。它需要依次填出三個空:
第一個空
:題目是 <start> ______第二個空
:題目是 <start> 我 ______第三個空
:題目是 <start> 我 愛 ______
④ Multi-Head Attention- “請教Encoder”
Decoder 在生成新詞時 ,這樣模型才能表達更複雜的模式,那一定要認識一下本文的主角 Transformer
。
最終,
① Output Embedding:先把輸出詞變向量
理解方式和輸入一樣
,可能主要關注輸入的 "I"