新着研究 / LLM
会話履歴の偽情報をLLMはいつ信じるか――出所の見せ方を変えた多ターン評価
Epistemic Policy Divergence
Epistemic Policy Divergenceの原論文から掲載した図です。細部はクリックして拡大できます。
原論文の図の説明を読む
Figure 1. Session structure and post-injection trajectories. A 15-turn evaluation session showing baseline turns, the turn-5 injection, and post-injection tracking trajectories for the three models.
概要
- 同じ誤情報でも、会話履歴での出所の見せ方により、モデルの採用率が大きく変わった。
- Gemini-3.1 Flash-Liteの採用率は、過去の自分の発言を装う条件で0.1%、指示上書きで94.0%だった。
- 長い対話を使う業務では、単発の正答率に加え、履歴混入後の採用と回復を測る必要がある。
補足:編集した模式図で仕組みを確認する
VISUAL EXPLAINER
図でつかむ、Epistemic Policy Divergenceの仕組み
- 01正しい対話履歴
- 02過去の応答を差し替え
- 03後続の対話
- 04誤情報の採用判定
原論文の説明をもとにした模式図です。処理の細部は省略しています。
研究の背景
LLMを長い対話で使うと、前の発言や参照資料が次の回答の材料になる。会話履歴に誤った情報が混ざれば、モデルがそれを事実として引き継ぎ、後の回答まで誤らせる可能性がある。
単発の質問に正答できるかだけでは、この影響は測れない。文書検索や記憶機能を使う業務では、情報の内容に加え、誰が述べたように見えるかが回答にどう響くかを知る必要がある。
手法
各セッションは15ターンで、最初の4ターンで正しい会話を進める。5ターン目の入力を作る際、4ターン目の実際の応答を、誤った前提を含む文に置き換える。その後はモデル自身の回答を履歴に残して15ターン目まで続ける。たとえば既知の事実と矛盾する文を「以前の回答」として置き、後の質問でその扱いを見る。
同じ誤った前提を五つの出所・権威の表現で試す。採用の有無に加えて崩れの程度と回復を自動判定し、人が付けた正解ラベルとの一致も確認する。ここでの「回復」は、誤情報を採用した後、観測中に正しい回答へ戻ることを指す。
新規性
この研究は、同じ誤った前提を保ったまま、過去の自分の発言、利用者が挙げた情報源、権威ある指示など、出所の見せ方を五つの方式で変える。誤情報の内容と提示の仕方を切り分け、どの条件で受け入れられるかを調べた。
評価は、誤情報を採用したかという二値判定に加え、応答がどの程度崩れたかを段階的に見る。採用後に正しい回答へ戻るかも追うため、一回の正誤だけでは見えない会話中の変化を測れる。
従来手法との違い
比較は三つのLLMと五つの混入方式の間で行われた。GPT-5.4 Miniは実験した500セッションで誤情報の採用がゼロだった一方、Gemini-3.1 Flash-Liteでは、過去の自分の発言を装う場合と、指示で上書きする場合で採用率が大きく異なった。
GLM-4.5-Airでも、権威を装った内容を受け入れる度合いと、明示的な指示に従う度合いが分かれた。著者らはこの差を別の失敗機構を示すものと解釈するが、モデル内部の因果的な仕組みを確定した結果ではない。
実験結果
著者らはGPT-5.4 Mini、Gemini-3.1 Flash-Lite、GLM-4.5-Airを十領域で調べ、温度0で計22,500ターンを評価した。人による120ターンの判定との一致はCohenのκで0.901だった。κは偶然の一致を補正した判定者間の一致度である。
Geminiの採用率は、自分の過去発言を装う条件で0.1%、利用者が挙げた情報源で23.5%、システム由来の権威を装う条件で68.2%、指示の上書きで94.0%だった。GLMは権威条件で15.8%、指示上書きで84.2%。著者らは、影響を受けたGLMセッションの94.5%が観測中に回復したと報告する。
応用の可能性
編集上の応用案 · 論文が実証した用途とは区別しています。
編集上の応用案:社内文書を参照しながら長く対話する業務アシスタントで、会話履歴の改変に気付けるかを検査する。入力は事実を確認できる質問と、過去の応答または参照文書に紛れ込ませた誤った前提で、出力はその後の回答履歴である。
検査環境では、同じ誤情報を出所の表現だけ変えて提示し、採用、訂正、再発を記録する。運用上は、履歴や参照文書の出所を保存し、重要な回答を信頼できる根拠に照らして確認する設計へつなげる。
導入時の検証
導入時の検証案 · 対象データでの再評価が必要です。
導入時の検証案:業務で重要な既知の事実を少数選び、通常の会話を基準として回答を保存する。検査用の履歴に同じ誤情報を、過去の応答、引用情報、強い指示という複数の形で置き、後続の質問を同じ順序で実行する。
条件別の誤情報採用率、訂正までのターン数、最後まで戻らない割合を測る。誤りが続く条件では、履歴の出所表示や回答前の根拠確認を加え、同じ課題で再測定する。
限界と課題
著者らの結論は、指定した三モデル、十の知識領域、温度0、15ターンの実験条件に基づく。GPT-5.4 Miniの採用ゼロも、その500セッション内の結果であり、すべての誤情報や将来の設定での耐性を意味しない。
編集上の確認事項は、実際の業務履歴の長さ、参照文書の形式、誤情報の見つけにくさが変わる場合の結果である。自動判定は人の正解ラベルとの一致を確認しているが、個々の業務判断に必要な根拠確認を代替するものではない。
出典
元のタイトル・要旨を確認する(英語)
Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation
Large language models process conversation history as unverified context: false premises injected into prior turns can be adopted as fact, a failure mode we term session-level contamination. We introduce five contamination protocols arranged along a source-authority gradient, isolating distinct failure mechanisms while holding the false premise constant, and evaluate GPT-5.4 Mini, Gemini-3.1 Flash-Lite, and GLM-4.5-Air across ten knowledge domains at temperature zero (22,500 turns), using a dual-track automated judge validated against a human gold standard (Cohen's \k{appa} = 0.901). GPT-5.4 Mini showed zero adoptions across all 500 sessions, a content-independent policy at the session level; token-level probing shows the underlying margin, while large, is finite. Gemini-3.1 Flash-Lite followed a steep authority gradient: 0.1% adoption for self-attributed falsehoods, 23.5% for user-cited sources, 68.2% for system-injected authority, and 94.0% under instruction override. GLM-4.5-Air showed a shallower gradient (15.8% vs 84.2%), a 68-percentage-point dissociation confirming that authority deference and instruction compliance are distinct mechanisms within one architecture. Recovery also diverged: GLM recovered in 94.5% of affected sessions, whereas 26.1% of affected Gemini sessions never did, rising to 40.0% under instruction override. Conversation history is an untrusted attack surface requiring provenance-aware system design; the complete framework is released as an open-source benchmark.
論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。収集:2026-09-30