スケーリング

データセット戦略

大規模言語モデル【事前学習:データセットC-1】LLMデータセットの出発点

# Common Crawlとスケール戦略大規模言語モデル(LLM)の性能は、**訓練データの量と質**に大きく左右されます。では、その土台になるデータはどこから来るのでしょうか。本記事では、LLM訓練データの出発点としてよく挙げられるCo...
実装詳細

大規模言語モデル【事前学習:実装詳細B-6】

Transformer進化系とスケーリング最適化:ALBERT, GQA, Flash Attentionの革新オリジナルのTransformer(2017年)から7年、多くの革新的な改良が積み重ねられてきました。本記事では、現代の大規模L...