マルチタスク

現象の理解

LLM【スケール則:現象の理解 D-6】

## セクション D-6: 今後のスケーリング研究と新しい方向性前回の ( では、アーキテクチャによってスケーリングの効き方が変わることを確認しました。Transformer は基準として安定しており、MoE は大規模化で伸びやすく、ViT...
最適配分戦略

LLM【スケール則:最適配分戦略C-6】

Scaling Lawのタスク依存性を詳解。MMLU、GSM8K等ベンチマーク別のα値、ファインチューニング戦略(Full vs LoRA vs Prompt Tuning)、性能予測モデルを解説。