SHIRITAS

/NEWS

AI研究ニュース

最新の論文を、AIが読み解いて記事にしています。

LLM / 2026-10-07

多数候補の「power sampling」を、1回の生成に近づける学習法OPPD

power distributionで推論を改善する際の「多数候補を生成して採点する」負担を減らすため、1回の生成で同様の効果を狙う学習手法OPPDを提案。MATH500やGSM8Kなどで単発生成の精度向上を報告している。

LLM / 2026-10-07

ループ型言語モデルを「固定点」から見直し、学習・推論・RLの効率化を狙う

ループ型言語モデルの反復計算を、固定点近傍では経路が重要でないという見方から捉え直す。truncated backpropagationやterminal KV sharing、蒸留によるprefill高速化、RLの勾配計算高速化を述べる。depth priorとinput injectionを改良し、100M〜1.6Bでperplexity低下を報告する。

LLM / 2026-10-07

応答冒頭の「キュー」がベースモデルの推論挙動に結びつく可能性

学習データが、応答の最初のトークンとその後の推論挙動を結びつける仕組みを調べた研究。特定の開始トークンを固定すると数学タスクで精度が上がり、RLがその出現を増やす可能性や、データ介入でキュー効果を付与・除去できることを報告する。

機械学習 / 2026-10-06

公開エンコーダだけで作る転移可能な敵対的パッチ攻撃「TAPDreamer」

ロボット制御の基盤となるworld action modelに対し、公開エンコーダのみから固定パッチを作る攻撃TAPDreamerを提案。注意機構を通じた表現シフトの拡散を利用し、閉ループ評価で複数ベンチマークの成功率を大きく低下させた。

LLM / 2026-10-06

デモ動画を階層化して必要部分だけ参照する「RV-ICL」:LLMエージェントの計画と実行を支える提案

LLMエージェントがデモ動画をそのまま抱え込まず、把持・リリースなどのサブイベントに基づく階層として必要箇所だけを読み出すRV-ICLを提案。RPent上でLIBERO-PROとLIBERO-Plusの成功率向上が報告された。