AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

「左にある」をどう判断するか:物体の位置と質問内の役割を追跡する

Relative-Position Reasoning

保存した記事を見る
原論文の図

Relative-Position Reasoningの原論文から掲載した図です。細部はクリックして拡大できます。

原論文の図の説明を読む

Figure 8: Example data used in our experiments

出典:Relative-Position Reasoning / arXiv ↗

概要

  • 相対位置の判断には、物体の位置と、質問中の対象・基準の役割の両方が必要になる。
  • 元の質問の正答率だけでは、位置交換や役割反転に対する不整合を見逃す。
  • 著者らは内部状態への操作で位置情報の伝わり方を調べ、役割を表す方向の操作による改善を報告した。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、Relative-Position Reasoningの仕組み

左から右へ読む
  1. 01場面と左右の質問
  2. 02物体位置を追跡
  3. 03対象と基準を照合
  4. 04左右の回答

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

画像を見て「青い箱は赤い箱の左か」と答えるには、両方の位置を捉え、質問中のどちらが調べる対象で、どちらが位置の基準かを保つ必要がある。同じ二物体でも役割を逆にすると正答は反転する。

一問の正答率が高くても、この反転に失敗するモデルがある。位置の見落としと質問の読み違いは対処が異なるため、対応する入力を組にした評価と、内部でどの情報が使われるかの分析が役立つ。

手法

著者らは二物体または三物体の場面を画像か文章で与え、「対象は基準の左か右か」を尋ねる。物体の位置を交換する組と、場面を保って質問中の対象・基準を逆にする組を作り、回答がそれぞれ正しく反転するか測る。たとえば赤い丸が青い四角の左にある場面なら、質問の役割だけを逆にした正答は右になる。

内部の分析には、ある入力で得たモデルの中間状態を別の入力へ移す「活性パッチ」を使う。入力側の物体表現、質問中の物体名、回答直前の状態を層ごとに調べ、位置情報の移動を追う。さらに同じ物体が対象である場合と基準である場合の状態差から役割の方向を求め、状態への加算が回答に与える影響を確かめる。

新規性

著者らは、相対位置の回答に必要な情報を、画像や説明文にある物体の位置と、質問でどちらを基準にするかという役割に分けて調べた。内部の状態を入れ替える実験で、入力側の位置情報が質問中の物体表現と回答に影響する経路を示す。

さらに、対象と基準の役割に対応する内部状態の方向を推定した。人工的な場面から得た方向を自然画像の評価にも適用し、多くの設定で再学習なしの改善を報告している。

従来手法との違い

通常の正答率は、一問ごとの答えが合っているかを数える。しかし、二つの物体の場所を交換したり、同じ画像のまま質問の対象と基準を入れ替えたりしても、モデルが正しく答えを反転できるとは限らない。

著者らは元の質問の正答率に加え、この二種類の対応する質問の両方に正答する割合を測った。さらに画像を入力する視覚言語モデル、同じモデルへの文章入力、その言語モデル部分への文章入力を比べ、どの情報が回答に作用するかを調べている。

実験結果

著者らは十の視覚言語モデルと言語モデル部分を、人工的な二・三物体場面と写真のWhat’sUpで評価した。写真を視覚言語モデルへ入力したLLaVA-1.6-Mistralでは、元の質問の正答率88.85%に対し、役割反転の組で81.03%、位置交換の組で78.31%だった。

機構の分析は三つの視覚言語モデルと対応する言語モデル部分で行われた。入力側の状態を置き換えると質問側の位置情報や回答が変わり、位置を表す方向の操作でも回答の反転が確認された。人工場面から得た役割方向による操作は、What’sUpとCOCO-Spatialの多くの設定で正答率と組の整合性を改善したと著者らは報告する。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案:倉庫内の棚画像から「赤い箱は青い箱の左か」と答える画像確認作業に使う。入力は棚画像、対象と基準を明示した質問、物体の位置を入れ替えた評価用画像の組であり、出力は左右の回答と組ごとの整合性記録である。

導入前に、通常の画像だけでなく、対象と基準を逆にした質問を同じ画像へ投げる。片方だけ正解する例を集めれば、配置の読み取りと質問の役割解釈のどちらを重点的に調べるか決めやすい。論文の内部状態操作を業務システムへ直ちに組み込む提案ではない。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案:対象業務に近い画像を少数選び、物体二つの位置と左右の正答を人手で確定する。各画像について元の質問と役割を逆にした質問を作り、可能なら位置を交換した画像も組にする。

現行モデルを基準として、一問ごとの正答率、役割反転の両問正答率、位置交換の両問正答率を分けて記録する。片方だけ誤る例を画像の重なりや質問文の型ごとに見直し、改善策を導入した後も同じ組で測り直す。

限界と課題

著者らの位置追跡の実験は、正しい答え同士の差が明確に出る事例を選んで内部状態を解析している。そのため、解析結果を全ての失敗例や自由形式の空間質問にそのまま広げることはできない。

編集上は、重なった物体、曖昧な左右、複数の基準物体でも同じ傾向が出るかを確認したい。また、内部状態を動かして回答が変わることと、画像を正しく理解したことは同義ではない。現場では回答を反転させるだけでなく、元画像に照らした正答も測る必要がある。

応用先の候補
研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

Who Is Left of Whom? Tracing Spatial Evidence and Role Binding in Relative-Position Reasoning

High instance-level accuracy can mask inconsistencies in spatial reasoning when objects exchange positions or their roles are reversed in the query. The internal representations supporting relative-position reasoning remain poorly understood. We investigate two complementary components of this process: tracking object locations in the input and representing their query roles. Across three VLMs with visual or textual inputs and their language-model backbones, activation patching reveals a staged progression from early-layer source representations through intermediate-layer query-object representations to late-layer answer states. Targeted interventions further establish causal links along this progression: manipulating source-side representations shifts location information at query-object mentions and ultimately alters relation predictions. Beyond object-location information, we also identify a stable query-side direction associated with the roles of the two objects in the comparison. Steering along directions estimated on synthetic scenes generalizes to natural-image benchmarks, improving accuracy and both forms of paired consistency in most settings without retraining. Our findings reveal complementary components of relational reasoning across visual and textual settings and show how targeted interventions can improve the consistency of models' behavior.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29