事前学習Ⅱ LLM【事前学習Ⅱ:基礎理論 A-1】 TransformerがなぜLLMの基盤なのか。Embedding・Attention・FFN・Add & Normという構成要素の役割と配置の理由を、全体像から理解します。 2026.08.30 事前学習Ⅱ
最適配分戦略 LLM【スケール則:最適配分戦略C-4】 Scaling Lawから見たアーキテクチャ選択。Transformer vs MoE(Mixture-of-Experts)の比較、α値の解釈、マルチモーダルモデルのパラメータ配分戦略を解説。 2026.07.06 最適配分戦略