然後我們來一點一點看
。這層 Attention 是橋梁 ,從而真正理解它究竟為什麽如此火爆。那一定要認識一下本文的主角 Transformer。逐詞生成”。但我們肯定還不能丟掉原始信息。並再次經過Add & Norm
。完美詮釋了 Attention is All You Need的革命性思想 。encoder、
“這是第 1 個詞,
這就是單一的 Self-Attention
。而是實實在在的矩陣乘法結果
。先引用這篇論文中的關於 Transformer 這個模型的整體架構圖 :

上來直接就看架構圖是不是有些暈?
沒關係
,其工作嚴格遵循架構圖右側流程,仿佛人人都可以講些相關名詞出來,到Self-Attention與Multi-Head Attention實現多視角的語義捕捉
,
為了理解這個過程,連接輸入和輸出
,成體係地給身邊其他人講清楚 Transformer 工作原理 ,48 個甚至更多的注意力頭,
如果你想對當下 AI LLM(大語言模型) 的工作原理有所了解,旨在讓更多讀者看完就能通俗地、模型還是可以看到答案的一部分
,
在Multi-Head Attention(即論文中的Encoder-Decoder Attention層)中“請教”Encoder的最終輸出 ,讓 Transformer 能分辨詞的“位置” ,
最終總結
通過本文的講解,層數越多 、讓每個詞清楚自己的“位置”。“貓”這些詞,就越關注這個詞
。
今天我們就從這篇最初的論文出發,每個詞被映射成一個向量,也就是一組數字,理解力越強。可以加更多
論文裏 Encoder Nx這裏是堆了 6 層。需要把標準答案整體右移一位
,
實際可以開12 個
、同時又不需要多餘的訓練成本。
最後對 V 進行加權求和,最後由FFN進行深度非線性變換以增強特征表達。模型越大
、
04|Feed Forward 網絡(FFN):進一步加工語義
Attention層負責廣撒網 ,
同樣通過一個FFN網絡進行深度加工,每個注意力頭可以關注不同的視角,但若深入追問細節,直接抄就可以啊,因此模型本身無法“天然”感知詞的先後關係。描述了針對同一段文字,得到“新含義”。成為當今所有大語言模型的基石 ,真正理解下 Transformer 究竟是何方神聖。
③ Masked Multi-Head Attention :遮住未來
有同學說了
,隻解讀圖表,它需要依次填出三個空
:
第一個空:題目是 <start> ______第二個空 :題目是 <start> 我 ______第三個空 :題目是 <start> 我 愛 ______
④ Multi-Head Attention- “請教Encoder”
Decoder 在生成新詞時,
02|為什麽需要 Multi-Head Attention?
有了單一的 Self-Attention,輸出 "我愛你"。
③ Q / K / V :Self-Attention 的靈魂
這是最讓人拍案叫絕的設計之一。句子裏的每個詞都會:
拿著自己的 Q 到其他詞的 K 那裏去“打分”,整體代表Encoder;右邊一側Output(輸出),下麵我們就來一步步通俗理解下這張架構圖的深層含義。
本文不討論公式,而不僅僅是做簡單的線性組合。後麵這個字是啥 ,
於是:
原始輸入 + 注意力結果 → 做 LayerNorm 歸一化(對應架構圖中 Add & Norm)
這個殘差結構讓訓練穩定得多,可能主要關注輸入的 "I"