AI Safety
AIの挙動を人間の意図に沿わせ、事故や悪用を防ぐための研究。評価、整合性、解釈可能性を含みます。
01記事
LLM / 2026-10-07
応答冒頭の「キュー」がベースモデルの推論挙動に結びつく可能性
学習データが、応答の最初のトークンとその後の推論挙動を結びつける仕組みを調べた研究。特定の開始トークンを固定すると数学タスクで精度が上がり、RLがその出現を増やす可能性や、データ介入でキュー効果を付与・除去できることを報告する。
機械学習 / 2026-10-06
公開エンコーダだけで作る転移可能な敵対的パッチ攻撃「TAPDreamer」
ロボット制御の基盤となるworld action modelに対し、公開エンコーダのみから固定パッチを作る攻撃TAPDreamerを提案。注意機構を通じた表現シフトの拡散を利用し、閉ループ評価で複数ベンチマークの成功率を大きく低下させた。
