事前学習Ⅱ LLM【事前学習Ⅱ:基礎理論 A-2】
Self-Attentionは、文脈のどこをどの程度参照するかを決めるTransformerの中心機構です。Q・K・V、Causal Mask、マルチヘッド、計算量を、役割とデータフローから理解します。
事前学習Ⅱ
詳細設計書
実装詳細
基礎理論
機械学習