AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

SAE特徴の「反応する入力」と「出力への作用」を結ぶDAFI

DAFI

保存した記事を見る
原論文の図

DAFIの原論文から掲載した図です。細部はクリックして拡大できます。

原論文の図の説明を読む

Figure 1: Overview of DAFI’s three-component interpretation target.

出典:DAFI / arXiv ↗

概要

  • SAE特徴について、反応する入力、介入後の出力、両者の関係を別々に説明する。
  • GemmaScopeの100特徴では、著者らの報告で入力・出力スコアが対応する比較手法を上回った。
  • 短文脈での証拠収集は大規模走査を避けられる一方、報告された入力スコアはコーパス由来の例より低かった。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、DAFIの仕組み

左から右へ読む
  1. 01対象のSAE特徴
  2. 02反応語を調査
  3. 03出力変化を調査
  4. 04三つの解釈を修正

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

疎オートエンコーダー(SAE)は、言語モデル内部の複雑な状態を、少数ずつ反応する多数の「特徴」に分ける道具である。ただし、特徴がどんな入力で反応するかだけでは、生成結果への作用までは分からない。

反対に、特徴を操作したときの出力だけでも、いつその作用が起きるかは見えにくい。多数の特徴を調べる際には、活性化例を得るための大規模な文章走査も負担になる。

手法

DAFIは言語モデルとSAEの対象特徴を受け取り、反応する入力、特徴への介入で促される出力、その結び付きを別々の仮説として書く。短い文脈に候補語を入れて反応を測り、必要に応じて反応した文脈で特徴の働きを変える。「介入」とは、特徴の値を操作して出力への影響を見ることを指す。

例えば「cat」「kitten」で反応し、特徴を強めると「cute」「lovely」が出やすくなる場合、入力は猫、出力は愛情を示す表現と説明する。DAFIは三つの説明を個別に採点し、弱い部分の証拠収集や書き直しを選ぶ。基準を満たすか修正を止めるまで繰り返し、最も根拠のある一組を返す。

新規性

著者らは、入力側の意味と出力側の意味の関係を、独立した「機能解釈」として評価対象に加えた。入力と出力を個別に説明するだけでは、特徴が生成時に果たす役割を取り違えうるという問題に対応する。

加えて、短い文脈で候補語を試す方法により、関心のある特徴だけの活性化証拠を必要時に集める。成功した修正を再利用可能な手順として蓄積する仕組みも組み込んでいる。

従来手法との違い

入力側の比較対象SAGEに対して、DAFIは特徴が反応する語や文脈の説明を、境界例も使って修正する。出力側の比較対象Token Changeに対しては、介入で増減した出力語を調べ、仮説を繰り返し見直す。

両比較は同じ100特徴で、それぞれ対応する成分を比べたものだ。汎用のClaude Codeとも比較しているが、こちらは25特徴であり、対象数が異なる。DAFIは入力・出力・機能の三つの説明を一組として返す。

実験結果

著者らはGemmaScopeの100特徴で、入力スコアがDAFIの91.4%、SAGEの78.3%、出力スコアがDAFIの66.7%、Token Changeの27.8%だったと報告する。差はそれぞれ13.1、38.9ポイントで、DAFIの使用量は特徴当たり平均0.758百万トークンだった。

短文脈の語調査では、修正後の入力スコアは88.5%で、コーパス由来の例を使う91.4%を下回った。別の継続学習実験では、未使用特徴で三つとも基準を満たす割合が58.0%から92.0%へ上がった。これらは著者らの設定での結果である。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案:社内向け言語モデルで、特定の話題に応答が偏る原因を調べる場面を想定する。入力は調査対象モデル、SAE、疑わしい特徴と、その特徴が反応した問い合わせ例とする。

DAFIで反応条件、特徴を強めた際の出力変化、両者の関係を記録し、担当者が元の問い合わせと照合する。出力は特徴ごとの説明と根拠であり、そのまま安全性や業務上の妥当性を保証する判定には使わない。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案:調べたい特徴を少数選び、既存の入力側説明と、DAFIが返す三つの説明を並べる。同じ問い合わせ例について、反応する条件と反応しない近接例を人手で確認する。

次に、特徴を操作した際の出力語の変化が機能説明に沿うかを記録する。基準は説明の一致率、根拠が不足した件数、特徴当たりの調査トークン数とし、従来のコーパス由来の例を使う方法とも比べる。

限界と課題

著者らの分析では、入力と出力の説明がともに基準を満たした215特徴のうち、7.0%は両者の意味的なつながりを確立できない「Break」だった。機能説明には、証拠が足りない場合を残す必要がある。

編集上の確認事項は、介入条件を変えても説明が成り立つか、判定に使う言語モデルを変えても結論が保たれるか、対象モデルやSAEが変わった際に再検証できるかである。

応用先の候補
研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

From Input to Output: A Flexible Agent for Dual-End Interpretation of Sparse Autoencoder Features

Sparse autoencoders (SAEs) are an important tool for mechanistic interpretability, but interpreting their many features remains challenging. Existing methods characterize input-side activation patterns and output-side intervention effects, yet often leave their functional connection implicit, while input-side evidence collection typically relies on costly large-corpus scans. We introduce functional interpretation, which characterizes an SAE feature as a mapping from its activating input semantics to its output effects under intervention, and present Dual-End Agentic Feature Interpretation (DAFI), an agent that actively gathers evidence and refines input-side, output-side, and functional interpretations through component-specific feedback. Its short-context token probing enables on-demand activation evidence collection without a full corpus scan. On GemmaScope, DAFI improves Input score by 13.1 percentage points over SAGE and Output score by 38.9 points over Token Change, while being substantially more token-efficient than a general-purpose coding agent. Skills distilled from successful refinements raise the held-out joint pass rate from 58.0% to 92.0% and improve both interpretation quality and efficiency when transferred to a new model-SAE setting. Across features with reliable endpoint interpretations, 70.7% exhibit non-equivalent input and output semantics. On AxBench, DAFI also improves steering-feature selection over output-score filtering. Code is available at https://github.com/THUAIS-Lab/DAFI.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。収集:2026-09-30