トークン化

事前学習Ⅱ

LLM【事前学習Ⅱ:基礎理論 A-4】

LLMは文章をそのまま読めません。BPEとSentencePiece、語彙サイズ、特殊トークン、多言語の観点から、テキストをモデル入力へ変換する設計を理解します。