事前学習Ⅱ

LLM【事前学習Ⅱ:基礎理論 A-5】

Transformerはトークン列の順序をそのままでは知りません。絶対位置、相対位置、RoPE、ALiBiの違いから、語順と距離を表現へ組み込む設計を理解します。
事前学習Ⅱ

LLM【事前学習Ⅱ:基礎理論 A-4】

LLMは文章をそのまま読めません。BPEとSentencePiece、語彙サイズ、特殊トークン、多言語の観点から、テキストをモデル入力へ変換する設計を理解します。
事前学習Ⅱ

LLM【事前学習Ⅱ:基礎理論 A-3】

Self-Attentionで集めた文脈を、深いTransformerの中で安定して変換するには何が必要か。LayerNorm、RMSNorm、GELU、SwiGLUの役割と選択の考え方を解説します。
事前学習Ⅱ

LLM【事前学習Ⅱ:基礎理論 A-2】

Self-Attentionは、文脈のどこをどの程度参照するかを決めるTransformerの中心機構です。Q・K・V、Causal Mask、マルチヘッド、計算量を、役割とデータフローから理解します。
事前学習Ⅱ

LLM【事前学習Ⅱ:基礎理論 A-1】

TransformerがなぜLLMの基盤なのか。Embedding・Attention・FFN・Add & Normという構成要素の役割と配置の理由を、全体像から理解します。
現象の理解

LLM【スケール則:現象の理解 D-6】

## セクション D-6: 今後のスケーリング研究と新しい方向性前回の ( では、アーキテクチャによってスケーリングの効き方が変わることを確認しました。Transformer は基準として安定しており、MoE は大規模化で伸びやすく、ViT...
現象の理解

LLM【スケール則:現象の理解 D-5】

Transformer、MoE、ViT等のアーキテクチャ別スケーリング特性を比較。α/β係数の違い、効率スコア、選択戦略を詳解。
現象の理解

LLM【スケール則:現象の理解 D-4】

スケール則の観測範囲・隠れた仮定・成立しないケースを詳解。データ品質補正を加えた修正スケール則と信頼度評価フレームワークを提示。
現象の理解

LLM【スケール則:現象の理解 D-3】

スケーリング実験の設計から測定方法まで解説。パラメータスケーリング・データスケーリング実験、効率指標の計算、検証チェックリストを網羅。
現象の理解

LLM【スケール則:現象の理解 D-2】

訓練終盤で突然テスト性能が急上昇するGrokking現象を解説。過学習→スタグネーション→サージの3段階、発生条件、LLMとの関係を詳解。