SHIRITAS

ニュース / LLM

LLM / 2026-10-07

多数候補の「power sampling」を、1回の生成に近づける学習法OPPD

power distributionで推論を改善する際の「多数候補を生成して採点する」負担を減らすため、1回の生成で同様の効果を狙う学習手法OPPDを提案。MATH500やGSM8Kなどで単発生成の精度向上を報告している。

#大規模言語モデル#蒸留#サンプリング#推論#強化学習

MANABISTAGE で学ぶ
論文の記載
原論文に書かれている内容。原文の引用を添えています。
AIによる解釈
AIが読み取った意味づけ。論文が述べたものではありません。

背景

大規模言語モデルの推論では、1回の出力だけだと誤答を引いてしまうことがあり、複数回の生成や選別で成績を上げようとする発想があります。

論文の記載

論文は、正答が「個々の誤答」より高い確率でも、誤答群が合計で大きな確率質量を持つため、サンプルとしては誤答を引きがちになりうると述べています。

原文を確認する(Abstract)
“A language model can give a correct answer more probability than any single incorrect answer and still usually sample an incorrect one”

論文の記載

power distributionは、各「完了回答」の確率を1より大きい指数でべき乗して正規化し、モデルがより尤もらしいとみなす回答へ確率を移す(sharpening)と説明されています。

原文を確認する(Abstract)
“The power distribution raises each complete answer's probability to a power above one and renormalizes, shifting probability toward answers the model finds most likely (sharpening).”

論文の記載

power distributionからのサンプリングはパラメータを変えずに推論を改善する一方で、クエリごとに多数のスコア付き候補が必要だとしています。

原文を確認する(Abstract)
“Sampling from it improves reasoning without changing parameters, but needs many scored candidates per query.”

論文の記載

提案手法のOn-policy power distillation(OPPD)は、学習対象モデルが候補を生成し、凍結した教師モデルのpower distributionで重み付けするSequential Monte Carloサンプラを用い、その重みを最大尤度更新にも用いると述べています。

原文を確認する(Abstract)
“On-policy power distillation (OPPD) runs a sequential Monte Carlo sampler in which the model being trained generates candidates and a frozen teacher's power distribution weights them; the same probabilities weight each answer in a maximum-likelihood update.”

論文の記載

OPPD学習により、同温度・未学習モデル比で単発生成の精度がMATH500で最大+23.0点、GSM8Kで+27.3点向上したと報告しています。

原文を確認する(Abstract)
“Training raises single-generation accuracy by up to 23.0 points on MATH500”

論文の記載

単発生成が、64候補の既報power samplingよりMATH500で+2.4点、GSM8Kで+3.5点上回り、未学習モデルが16候補で得る改善の94 percentを回復したと述べています。

原文を確認する(Abstract)
“and one generation scores 2.4 and 3.5 points above published power sampling with 64 candidates”

論文の記載

同一チェックポイントと予算で検証済み報酬を用いるGRPOと比べ、参照解なしでMATH500/GSM8K/AIMEにてそれぞれ+3.8/+4.0/+5.4点高く、またGRPO後にOPPDを適用すると最大+9.3点上積みできるとしています。

原文を確認する(Abstract)
“OPPD scores 3.8, 4.0 and 5.4 points higher on MATH500, GSM8K and AIME using no reference answers”

AIによる解釈

要旨の記述どおりに読む限り、この研究は「多数候補を生成してスコア付けすることで得ていた改善」を、学習によって“1回の生成側”へ移し替え、推論時の手間(候補生成・採点)を減らす方向を狙っている、と読み取れます。

この記事の検証結果

  • 引用の実在確認:通過
  • 原文との照合:通過
  • 数値の整合:通過
  • 別モデルによる検証:通過
  • 誇張表現チェック:通過
  • AI生成の開示:通過

議論(0件)

まだコメントはありません。論文について気になった点を、最初の質問として投稿しましょう。

    コメントを書く

    関連する記事