新着研究 / Generative AI / VLM
画像をどう直すか自分で判断する生成AIを測るSolveEdit
SolveEdit
SolveEditの原論文から掲載した図です。細部はクリックして拡大できます。
原論文の図の説明を読む
Figure 1: SolveEdit : infer, execute, preserve.
概要
- SolveEditは、画像と目標から必要な変更を判断して実行する力を2,728課題で測る。
- 変更の達成と無関係な部分の維持を別々の条件で確認し、複数の正しい完成画像を許容する。
- 著者らの条件では、事前に変更内容を計画するとGPT-Image-2のSolveScoreが57.0%から71.6%になった。
補足:編集した模式図で仕組みを確認する
VISUAL EXPLAINER
図でつかむ、SolveEditの仕組み
- 01元画像と目標
- 02必要な変更を特定
- 03画像を一回編集
- 04条件ごとに採点
原論文の説明をもとにした模式図です。処理の細部は省略しています。
研究の背景
SolveEditは、画像編集モデルが目標から必要な変更を推定し、周囲を保ったまま実行できるかを測る。実務の依頼には「正しい位置に直す」のように、位置そのものは画像から読み取らなければならないものがある。
きれいな画像が出ても、対象を誤った場所に置いたり、関係のない物を変えたりすれば依頼は満たせない。結果を見る際は、変更の達成と無関係な部分への影響を分ける必要がある。
手法
評価では元画像と目標だけを生成モデルに渡し、編集後の画像を受け取る。各課題には、完成時に必要な状態と、変えてはいけない状態が記される。採点する側がそれぞれを確認し、達成度から不要な変更の分を差し引く。これをSolveScoreと呼ぶ。
SolveEdit-Planでは、編集前に画像を調べ、指示に足りない対象や行き先を特定する。次に候補となる変更を比べ、保持すべき部分も含めて編集指示を作り、同じ生成器を一回呼ぶ。たとえば「唯一の空き枠に置く」なら、空き枠を画像から見つけて指示に明記する。
新規性
SolveEditは、画像と目標だけを渡し、何を変えれば達成できるかまでモデルに判断させる評価である。指示に変更内容が書かれた場合、現状を見て行き先を決める場合、画像内の規則を読んで決める場合を分けている。
採点には、達成すべき条件と守るべき条件を細かく記した「遷移契約」を使う。完成画像が一つの見本と異なっても、条件を満たせば評価できる設計だ。
従来手法との違い
従来の画像編集評価は、変更内容が明示された指示を実行できるかを調べるものが多い。SolveEditでは、たとえば空いている場所を画像から探して物体を置くなど、変更先を決める作業も課題に含める。
著者らは、直接編集する方法に加え、画像を見て変更内容を先に決めるSolveEdit-Planを試した。同じ生成器を一回呼ぶ条件で、単に指示文を書き直す比較方法とも比べている。
実験結果
著者らは10領域・54小領域の2,728課題で、画像編集モデル9種と動画生成モデル2種を評価した。直接編集の最高SolveScoreはGPT-Image-2の57.0%。画像内の規則を読む課題は、指示だけで変更が決まる課題より、主要3モデルで17.2~23.7ポイント低かった。
同じ生成器を一回使う条件で、SolveEdit-PlanはGPT-Image-2を57.0%から71.6%へ高めたと著者らは報告する。3生成器での平均改善は9.1ポイント。ただし計画には各課題で追加の言語モデル呼び出しが2回必要だった。
応用の可能性
編集上の応用案 · 論文が実証した用途とは区別しています。
編集上の応用案:店舗の棚配置画像と「空いた区画に商品を収める」という目標を入力する。計画段階で空き区画と動かしてはいけない商品を特定し、その内容を編集器へ渡して、修正画像を出力する。
担当者は、商品が正しい区画に入ったか、ほかの棚や文字が変わっていないかを確認する。画像の見栄えだけでなく、目的の達成と周辺の維持を別々に記録する。
導入時の検証
導入時の検証案 · 対象データでの再評価が必要です。
導入時の検証案:実際の編集依頼から、変更内容が明示された例と、画像を見て決める例を集める。各例に「達成する条件」と「残す条件」を人が記し、直接編集を基準として、計画を挟む方法と同じ生成器で比べる。
条件ごとの達成率、意図しない変更の件数、利用者の修正時間を測る。見た目が自然でも条件を満たさない例を残し、計画段階の判断ミスと画像生成の実行ミスを分けて調べる。
限界と課題
著者らの直接評価では最良モデルでもSolveScoreは57.0%で、必要な変更の達成や無関係な部分の維持に失敗が残る。計画法は生成前に2回の言語モデル呼び出しを加えるため、成績向上には追加の計算が伴う。
編集上の確認事項は、自社画像に必要な条件を細かく書けるか、採点者の判断が安定するかである。動画モデルは最後のフレームで採点しており、動画全体の動きの正しさを示す結果ではない。
出典
元のタイトル・要旨を確認する(英語)
SolveEdit: Benchmarking Visual Problem Solving in Generative Models
Machine intelligence is often evaluated through abstract reasoning problems, yet many real-world problems are visual, such as arranging objects, repairing layouts, or tracing routes. Solving these problems requires understanding a scene, inferring what must change to achieve a goal, and realizing that change without disturbing unrelated content. However, existing benchmarks mainly evaluate perception, generation, or explicitly specified transformations, leaving goal-driven visual problem solving underexplored. To bridge this gap, we introduce SolveEpIT, a benchmark for visual problem solving through scene transformation. Given an image and a goal, a model must infer a valid transformation from the request, the scene, or a visually expressed rule, then execute it while preserving unrelated content. SoLvEEDrr contains 2,728 cases. Atomic transition contracts specify required and protected conditions, enabling SoLvEScoRE to measure completion and unintended changes without a single reference output. The strongest evaluated model achieves only57.0% SolvEScore. We further introduce SolveEdiT-PLAN, a two-stage visual planner that instantiates the transition before generation. Under matched single-generation evaluation, it improves SoLvEScoRE by 9.1 points on average across three tested generators, including a gain from 57.0% to 71.6% for GPT-Image-2, without modifying the editor.
論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。収集:2026-09-30