大規模言語モデル — 次トークン予測・スケーリング則・文脈内学習
ChatGPT の中身は、突き詰めれば「次のトークンを当てる」だけの機械です。その単純な目的が、規模を極端に大きくすると、翻訳も推論も会話もこなす汎用能力に化ける。このレッスンでは LLM を支える3つの柱 — 次トークン予測・スケーリング則・文脈内学習 — を、実際に動かして確かめます。
1. LLM の正体 — 訓練目標はたった1つ
大規模言語モデル(LLM)の事前学習は、インターネット規模のテキストで「ここまでの文脈から次のトークンを予測する」ことをひたすら繰り返すだけです。前レッスンの Transformer デコーダを何十層も積み、何兆トークンも読ませる。翻訳用の教師データも、対話の台本も要りません。
2. 次トークン予測マシン — 温度と top-p で「選び方」が変わる
モデルの出力は「次のトークン1個」ではなく全語彙にわたる確率分布です。そこから実際に1つ選ぶのがサンプリング。温度 T は分布の尖り方を調整し(低い=堅実、高い=ギャンブル)、top-p は累積確率が p に達するまでの上位候補(核)だけに絞ります。
下のデモで文脈を切り替え、温度を動かして分布の形を見てから、「サンプリング」で実際に文章を伸ばしてみてください。同じ文脈でもリセットのたびに違う文が生まれることがあります — それが確率的生成です。
3. スケーリング則 — 規模が質を変える
LLM 以前の常識では、モデルを大きくしすぎると過学習するはずでした。ところが言語モデルでは、パラメータ数・データ量・計算量を増やすほど損失がべき乗則で下がり続けることが実験的に確認されました(Kaplan et al., 2020)。log-log プロットで直線になる、驚くほどきれいな法則です。
▶ を押して計算量を注ぎ込んでいくと、損失の直線的低下とともに、ある規模で突然できるようになるタスク(創発的能力)が現れる様子を見てください。
4. 文脈内学習 — 重みを変えずに学ぶ
GPT-3 の論文(2020)が示した最大の驚きがこれです。プロンプトに例をいくつか見せるだけで、モデルがそのタスクをこなし始める。勾配降下もパラメータ更新も一切していないのに、です。これを文脈内学習(In-Context Learning, ICL)、例の数に応じて few-shot / one-shot / zero-shot と呼びます。
下のデモで例を 0個 → 1個 → 3個 と増やし、同じ質問「cat → ?」への予測分布が正解の書式「ねこ」に吸い寄せられていく様子を見てください。
5. トークナイズ — LLM は文字ではなくトークンを見ている
モデルに入る前に、文章はサブワード(部分単語)の列に分割されます。頻出する並びは長いまま1トークンに、珍しい単語は細切れになる — BPE(Byte Pair Encoding)系のアルゴリズムが、データから語彙を自動で作ります。モデルが見るのは色のついたブロックの ID 列だけで、その中の文字は見えていません。
6. 限界と付き合い方 — できないことを知る
次トークン予測という出自は、そのまま LLM の弱点にもなります。
これらは「たまたまのバグ」ではなく仕組みに根ざした性質です。だから実用では、検索で最新情報を与える(RAG)、計算はツールに任せる、出典を確認する、といった外側の仕組みで補うのが定石になっています。
7. まとめ
- 事前学習=インターネット規模の次トークン予測。目的関数はたった1つ、それが知識も文法も推論も引き連れてくる。
- 温度と top-p が「確率分布からどう1つ選ぶか」を決める。生成AIの出力の個性はここで調整される。
- スケーリング則 — 損失は規模のべき乗則で下がり続け、その途中で創発的能力が現れる(ように見える)。
- 文脈内学習 — 重みを固定したまま、プロンプト中の例だけで振る舞いが変わる。
- 幻覚・カットオフは仕組み由来。外側のツールと組み合わせて使うのが前提。