事前学習Ⅱ LLM【事前学習Ⅱ:基礎理論 A-3】 Self-Attentionで集めた文脈を、深いTransformerの中で安定して変換するには何が必要か。LayerNorm、RMSNorm、GELU、SwiGLUの役割と選択の考え方を解説します。 2026.09.01 事前学習Ⅱ
実装詳細 LLM【事前学習:実装詳細B-5】 残差接続と層正規化の詳細実装12層以上の深いTransformerを安定して訓練するには、残差接続(Skip Connection)と層正規化(Layer Normalization)が不可欠です。本記事では、これらの技術がなぜ必要で、どう... 2026.02.02 実装詳細