アーキテクチャ

事前学習Ⅱ

LLM【事前学習Ⅱ:基礎理論 A-1】

TransformerがなぜLLMの基盤なのか。Embedding・Attention・FFN・Add & Normという構成要素の役割と配置の理由を、全体像から理解します。
最適配分戦略

LLM【スケール則:最適配分戦略C-4】

Scaling Lawから見たアーキテクチャ選択。Transformer vs MoE(Mixture-of-Experts)の比較、α値の解釈、マルチモーダルモデルのパラメータ配分戦略を解説。