新着研究 / RAG / VLM
文書検索で画像・表・本文を全部渡すべきかを測るGraphRAG研究
Modality-Aware Multimodal GraphRAG
Modality-Aware Multimodal GraphRAGの原論文から掲載した図です。細部はクリックして拡大できます。
原論文の図の説明を読む
Figure 1: Overview of our modality-aware multimodal QA framework.
概要
- 知識グラフの各事実に、本文・表・画像・配置のどれが根拠かを記録する。
- 二種類の根拠を必要とする1,051問を五つのモデルで調べ、単独の寄与と組み合わせの効果を分けて評価した。
- 著者らは表と本文の寄与が強く、本文を含む組み合わせでは重複が多いと報告した。
補足:編集した模式図で仕組みを確認する
VISUAL EXPLAINER
図でつかむ、Modality-Aware Multimodal GraphRAGの仕組み
- 01図表と本文を含む文書
- 02根拠の種類を記録
- 03種類を指定して検索
- 04質問への回答
原論文の説明をもとにした模式図です。処理の細部は省略しています。
研究の背景
GraphRAGは、文書内の事実を「項目と関係」からなる知識グラフに整理し、質問に関係する根拠を探して回答へ渡す方法だ。図、表、本文、ページ上の配置まで含めると、候補となる根拠は増える。
一方、同じ事実を複数の形で示す文書では、証拠を増やしても新しい情報が加わらない場合がある。どの種類が回答を助け、どの組み合わせが重複するかを測ることは、実務の検索設計に役立つ。
手法
既存のRAG-Anythingが文書を本文、表、画像、配置の単位に分けて知識グラフを作る際、各関係がどの部分から得られたかを記録する。質問時には指定した種類に裏付けられた関係だけを残し、その根拠部分を質問との近さで並べ、上位を回答モデルへ渡す。例えば表と本文が必要な質問なら、表のみ、本文のみ、両方の条件を試せる。
結果の分析にはSHAPEを使う。これは種類を一つ加えた時の回答成績の変化を複数の条件で平均し、二種類を合わせた効果も別に測る指標だ。組み合わせの値が低ければ、同じ内容の重複や回答への干渉が疑われる。
新規性
知識グラフの各関係に、根拠となった文書部分とその種類を記録し、種類を指定して検索結果を切り替えられるようにした。その上で、各種類の単独の寄与と、二種類を合わせた時の協力・重複を分けて評価する。
著者らの主張は、証拠を増やす判断を一律にせず、質問と文書の性質に応じて選べる分析基盤を示した点にある。
従来手法との違い
比較の基準は、利用できる種類の証拠を一律に検索する設定と、指定した種類だけを検索する設定である。通常の一種類ずつの除外実験は、その種類の価値と他の種類との相互作用を一つの差にまとめてしまう。
本研究は単独と組み合わせをともに評価するSHAPE指標を使う。確認できた本文の範囲では、表と本文の寄与が強く、本文を含む組み合わせでは重複が多いと著者らは報告している。
実験結果
著者らはLongDocURLとMMLongBench-Docの計327文書から、正解根拠がちょうど二種類の1,051問を選んだ。各問で根拠の一種類目、二種類目、両方を試し、五つのマルチモーダル言語モデルで計15,765回回答を生成した。回答精度とSHAPEの寄与・協力指標を評価した。
掲載表では両種類を使う条件の全体精度が、LongDocURLでモデルにより19.15~48.56%、MMLongBench-Docで13.04~25.61%だった。著者らは表と本文の寄与が強く、本文を含む組み合わせに重複が多いと報告する。ただし確認できた本文の範囲は結果節の途中までで、詳細な組み合わせ別の数値は確認できない。
応用の可能性
編集上の応用案 · 論文が実証した用途とは区別しています。
編集上の応用案:社内の長い報告書から、数値の根拠を尋ねる質問に答える検索支援を作る。入力は本文・表・図・配置情報を含む報告書と質問で、出力は回答と参照した文書部分だ。
質問が表の数値を求める場合は表を含む証拠集合を試し、本文だけの集合や全種類の集合と結果を比べる。回答ごとにどの種類の根拠が採用されたかを残し、数字の取り違えを人が確認する。
導入時の検証
導入時の検証案 · 対象データでの再評価が必要です。
導入時の検証案:社内文書から、正解と根拠箇所を確認済みの質問を少数用意する。本文、表、画像、配置の出所を各根拠に付け、全種類、本文のみ、表のみなど同じ質問への検索条件を切り替える。
全種類を渡す設定を基準とし、回答正確率、根拠箇所の一致率、回答漏れを質問の種類ごとに測る。効果が明確な種類の組み合わせだけを候補に残し、文書形式が変わった場合も同じ傾向か確認する。
限界と課題
著者らの分析対象は、正解の根拠種類が二つ付いた質問に限られる。一種類だけで答えられる質問と、三種類が必要な少数の質問は主分析から外した。したがって、得られた相互作用の傾向をすべての文書質問に広げることはできない。
編集上は、実務文書で根拠の種類を正しく記録できるか、質問意図の分類誤りが証拠選択へどう響くかを確認したい。検索する証拠を減らした時の回答漏れも、正確さと合わせて測る必要がある。
出典
元のタイトル・要旨を確認する(英語)
Signal or Noise? Modality Contribution and Cooperation in Multimodal GraphRAG
Multimodal knowledge graphs (KGs) integrate information from text, figures, tables, and other modalities into a unified structured representation, with the promise that richer evidence enables better inference. In GraphRAG systems built over such graphs, it is commonly assumed that retrieving evidence from more modalities at inference time improves downstream performance. Yet, redundant or overlapping multimodal evidence may distract language models in question answering (QA), and whether each modality contributes equally across questions, models, and tasks remains poorly understood. In this work, we study how modality-aware retrieval affects downstream inference in a multimodal GraphRAG pipeline, using document visual question answering (DocVQA) as a testbed. We extend an existing KG-based QA framework to be modality-aware, leveraging the graph structure to track which modality supports which facts and to selectively filter evidence at the edge level. This enables us to investigate whether providing all available multimodal evidence at inference time benefits QA, and to evaluate the contribution and cooperation of modalities across question, task, and model characteristics. Through a controlled analysis within a state-of-the-art multimodal GraphRAG pipeline, five multimodal LLMs and two DocVQA benchmarks, we find that tables and text provide the strongest contributions, and that combining modalities frequently produces redundancy rather than synergy, particularly for pairs involving textual information. Positive cooperation appears mainly between non-text modalities and depends on question intent and task type. Our findings argue for selective, modality-aware retrieval in the design of more effective GraphRAG systems, where modalities are filtered according to the downstream task rather than retrieved uniformly.
論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29