LLM / 2026-10-07
多数候補の「power sampling」を、1回の生成に近づける学習法OPPD
power distributionで推論を改善する際の「多数候補を生成して採点する」負担を減らすため、1回の生成で同様の効果を狙う学習手法OPPDを提案。MATH500やGSM8Kなどで単発生成の精度向上を報告している。
#大規模言語モデル#蒸留#サンプリング#推論#強化学習
- 論文の記載
- 原論文に書かれている内容。原文の引用を添えています。
- AIによる解釈
- AIが読み取った意味づけ。論文が述べたものではありません。
背景
大規模言語モデルの推論では、1回の出力だけだと誤答を引いてしまうことがあり、複数回の生成や選別で成績を上げようとする発想があります。
論文の記載
論文は、正答が「個々の誤答」より高い確率でも、誤答群が合計で大きな確率質量を持つため、サンプルとしては誤答を引きがちになりうると述べています。
原文を確認する(Abstract)
“A language model can give a correct answer more probability than any single incorrect answer and still usually sample an incorrect one”論文の記載
power distributionは、各「完了回答」の確率を1より大きい指数でべき乗して正規化し、モデルがより尤もらしいとみなす回答へ確率を移す(sharpening)と説明されています。
原文を確認する(Abstract)
“The power distribution raises each complete answer's probability to a power above one and renormalizes, shifting probability toward answers the model finds most likely (sharpening).”論文の記載
power distributionからのサンプリングはパラメータを変えずに推論を改善する一方で、クエリごとに多数のスコア付き候補が必要だとしています。
原文を確認する(Abstract)
“Sampling from it improves reasoning without changing parameters, but needs many scored candidates per query.”論文の記載
提案手法のOn-policy power distillation(OPPD)は、学習対象モデルが候補を生成し、凍結した教師モデルのpower distributionで重み付けするSequential Monte Carloサンプラを用い、その重みを最大尤度更新にも用いると述べています。
原文を確認する(Abstract)
“On-policy power distillation (OPPD) runs a sequential Monte Carlo sampler in which the model being trained generates candidates and a frozen teacher's power distribution weights them; the same probabilities weight each answer in a maximum-likelihood update.”論文の記載
OPPD学習により、同温度・未学習モデル比で単発生成の精度がMATH500で最大+23.0点、GSM8Kで+27.3点向上したと報告しています。
原文を確認する(Abstract)
“Training raises single-generation accuracy by up to 23.0 points on MATH500”論文の記載
単発生成が、64候補の既報power samplingよりMATH500で+2.4点、GSM8Kで+3.5点上回り、未学習モデルが16候補で得る改善の94 percentを回復したと述べています。
原文を確認する(Abstract)
“and one generation scores 2.4 and 3.5 points above published power sampling with 64 candidates”論文の記載
同一チェックポイントと予算で検証済み報酬を用いるGRPOと比べ、参照解なしでMATH500/GSM8K/AIMEにてそれぞれ+3.8/+4.0/+5.4点高く、またGRPO後にOPPDを適用すると最大+9.3点上積みできるとしています。
原文を確認する(Abstract)
“OPPD scores 3.8, 4.0 and 5.4 points higher on MATH500, GSM8K and AIME using no reference answers”AIによる解釈
要旨の記述どおりに読む限り、この研究は「多数候補を生成してスコア付けすることで得ていた改善」を、学習によって“1回の生成側”へ移し替え、推論時の手間(候補生成・採点)を減らす方向を狙っている、と読み取れます。
この記事の検証結果
- 引用の実在確認:通過
- 原文との照合:通過
- 数値の整合:通過
- 別モデルによる検証:通過
- 誇張表現チェック:通過
- AI生成の開示:通過
議論(0件)
まだコメントはありません。論文について気になった点を、最初の質問として投稿しましょう。
