LLM / 2026-10-06
デモ動画を階層化して必要部分だけ参照する「RV-ICL」:LLMエージェントの計画と実行を支える提案
LLMエージェントがデモ動画をそのまま抱え込まず、把持・リリースなどのサブイベントに基づく階層として必要箇所だけを読み出すRV-ICLを提案。RPent上でLIBERO-PROとLIBERO-Plusの成功率向上が報告された。
#LLMエージェント#ロボティクス#デモ動画#インコンテキスト学習#VLA
- 論文の記載
- 原論文に書かれている内容。原文の引用を添えています。
- AIによる解釈
- AIが読み取った意味づけ。論文が述べたものではありません。
背景
LLMエージェントは、状況に応じて計画を立てて実行することが期待されていますが、実行中に参照すべき情報(たとえば視覚情報)が多いほど、扱い方が課題になり得ます。
論文の記載
論文は、テキストメモリは「エージェントが何をしたか」は記録する一方で、「タスクのやり方」は記録しないと述べています。
原文を確認する(Abstract)
“text memory, which records what the agent did but not how the task is done.”論文の記載
論文は、フル動画を毎ターン扱うと遅くなり、固定キーフレームでは把持が保持されるかを左右する接触の詳細を失うと述べています。
原文を確認する(Abstract)
“The full video slows every turn, fixed keyframes lose the contact detail that decides whether a grasp holds”論文の記載
論文は、Recursive Video In-Context Learning(RV-ICL)を、訓練不要(training-free)で、デモをプロンプトとして与えるのでなくエージェントがナビゲートする階層に変換する手法として提案しています。
原文を確認する(Abstract)
“We introduce Recursive Video In-Context Learning (RV-ICL), a training-free method that turns a demonstration into a hierarchy the agent navigates rather than a prompt it receives.”論文の記載
論文は、その階層が把持やリリースなどのサブイベントから構築され、全体のキーフレームからフェーズ、モーメント、短いクリップへと細かくなると述べています。
原文を確認する(Abstract)
“The hierarchy is built from the sub-events of the demonstration, such as grasps and releases. Its levels grow finer, from keyframes of the whole task to phases, moments and short clips”論文の記載
論文は、エージェントが計画前に粗い階層を読み、実行中は必要に応じて階層に再入場し、現在のサブゴールのクリップのみを読み込むと述べています。
原文を確認する(Abstract)
“The agent reads the coarse levels before planning. During execution it re-enters the hierarchy whenever a step needs more detail and loads only the clip of its current sub-goal.”AIによる解釈
要旨の記述からは、計画段階では全体像(構造)を、実行段階では手元の接触付近(詳細)を、というように「同じデモでも参照したい粒度が変わる」点に合わせて、動画参照を切り替える狙いがあると読み取れます。
論文の記載
論文は、RPent上でRV-ICLによりLIBERO-PROの成功率が92.6%から96.5%に向上したと報告しています。
原文を確認する(Abstract)
“RV-ICL raises success from 92.6% to 96.5% on LIBERO-PRO”論文の記載
論文は、RPent上でRV-ICLによりLIBERO-Plusの成功率が86.7%から95.8%に向上したと報告しています。
原文を確認する(Abstract)
“and from 86.7% to 95.8% on LIBERO-Plus.”この記事の検証結果
- 引用の実在確認:通過
- 原文との照合:通過
- 数値の整合:通過
- 別モデルによる検証:通過
- 誇張表現チェック:通過
- AI生成の開示:通過
議論(0件)
まだコメントはありません。論文について気になった点を、最初の質問として投稿しましょう。
