AI ResearchNotes.法人向けのご案内 ↗
← 検索結果に戻る

AIは高校生による学習用フィードバックの評価を再現できるか

LLM Simulation of Learner Feedback Evaluations

保存した記事を見る
原論文の図

LLM Simulation of Learner Feedback Evaluationsの原論文から掲載した図です。細部はクリックして拡大できます。

原論文の図の説明を読む

Figure 1: Overview of the experiments and research questions. We first evaluate LLM simulation without learner-specific evaluation data (Exp. 1), and then examine performance using real learner evaluation data, such as profiles and evaluation examples (Exp. 2). At the group level, we investigate simulation performance (RQ1) the effects of Big Five traits (RQ2), and the contribution of learner evaluation data to group- and individual-level simulation (RQ3). Finally, we analyze feedback types that lead to disagreement between LLMs and learner evaluations (RQ4).

出典:LLM Simulation of Learner Feedback Evaluations / arXiv ↗

概要

  • 日本の高校生321人による4,478件の評価を使い、6モデルの予測を実際の学習者評価と比べた。
  • 性格傾向や評価例は点数のずれや個人単位の一致を改善する場合があるが、集団の順位一致は安定しない。
  • 詳細で記号の多い解説文をLLMが過大評価する例があり、教材選択には実際の学習者による確認が要る。
補足:編集した模式図で仕組みを確認する

VISUAL EXPLAINER

図でつかむ、LLM Simulation of Learner Feedback Evaluationsの仕組み

左から右へ読む
  1. 01生物問題と解説文
  2. 02生徒の実評価を整理
  3. 03LLMに評価させる
  4. 04点数と順位を照合

原論文の説明をもとにした模式図です。処理の細部は省略しています。

研究の背景

この研究は、LLMが学習用の解説文について、実際の生徒の評価をどれほど再現できるかを調べる。解説文は同じ正解を伝えていても、ヒント中心、手順中心、励まし中心など書き方が異なる。どれが役立つと感じるかは学習者によって変わる。

LLMに生徒役を任せれば多数の解説案を早く比べられるが、その点数が本物の生徒とずれていれば選択を誤る。著者らは集団平均と個人の評価を分け、プロフィールや過去の評価例がずれを縮めるかを調べた。

手法

実データには、高校生が生物の選択式問題へ答え、自分への解説文を6観点で3段階評価した結果がある。LLMにも問題、回答、解説文を渡して同じ観点の点数を付けさせる。まず生徒情報なしで評価し、次に性格傾向や学習経験、同じ生徒が別の問題で付けた評価例を追加する。

結果は2つの物差しで比べる。MAEは予測点と実際の点の差の平均で、小さいほど近い。スピアマンの順位相関は、解説文の良し悪しの並べ方がどれだけ一致するかを表し、高いほど近い。著者らは集団の平均点と、生徒一人ひとりの評価の両方でこれらを確認した。

新規性

この研究は、学習者役のLLMがもっともらしい評価を出すかではなく、実際の高校生が付けた評価とどれほど一致するかを集団と個人の両方で測った。性格傾向、学習に関する事前回答、同じ生徒の評価例を与えた場合も比較している。

点数の近さと、どの説明を高く評価するかという順位の一致を分けて調べた結果、追加情報で片方だけが改善する場合を示した。説明が詳細で記号を多く含むと、LLMが生徒より高く評価しがちな例も分析した。

従来手法との違い

基準条件では、LLMに個々の生徒の情報を渡さず、問題への回答に対する説明文を評価させる。比較条件では、Big Fiveと呼ばれる5種類の性格傾向、事前質問への回答、同じ生徒による別の評価例を組み合わせて与える。Big Fiveは好奇心や協調性などを含む性格特性の整理法である。

情報を増やすと点数の平均的なずれが小さくなる場合が多い一方、説明文の評価順位まで安定して良くなるわけではない。個人単位では評価例が役立ったが、著者らは学習者の判断を十分に再現できたとは結論していない。

実験結果

データは日本の高校1年生321人、7問、222種類の解説文からなり、評価は4,478件、6観点の点数は計26,868個だった。著者らは6つのLLMを比較した。生徒情報なしの集団評価でGPT-5の順位相関は0.638、MAEは0.393。Big Fiveを加えるとそれぞれ0.625、0.294となり、点数差は縮んだが順位一致は少し下がった。

モデルによる差も大きい。Gemini-3.5-flashの順位相関は0.434から0.706へ上がり、Gemini-2.5-flashは0.532から0.098へ下がった。個人評価では同じ生徒の評価例を与えると全モデルで改善したが、最良として示された順位相関は0.479だった。

応用の可能性

編集上の応用案 · 論文が実証した用途とは区別しています。

編集上の応用案。高校生向けの生物問題で、同じ誤答に対する2種類の解説文を作る。入力は問題、生徒の回答、解説文、評価観点とし、LLMに「どちらが理解しやすいか」の暫定的な予測を出させる。出力は予測点と、その判断に使った文中の根拠である。

公開前に少人数の実際の生徒にも同じ解説を評価してもらい、LLMの予測と並べる。意見が割れた説明文は教員が読み直し、情報量が多すぎないか、記号が理解を妨げていないかを確認するための補助として使う。

導入時の検証

導入時の検証案 · 対象データでの再評価が必要です。

導入時の検証案。実際の学習者に複数の解説文を評価してもらい、問題、正誤、解説の種類ごとに結果を残す。その一部だけをLLMへの評価例として使い、残りの解説文について、生徒情報なしの場合と評価例ありの場合の予測を比べる。

確認する数値は、実点数との平均絶対誤差と、解説文の評価順位の一致度である。正答者と誤答者も分けて集計する。点数が近くても選ぶ解説文が変わるなら、教材の採用判断は実際の学習者評価に戻して確認する。

限界と課題

著者らは、集団と個人のどちらでもLLMの再現能力は限定的だと述べる。個人評価では例を与えても相関は多くの場合低く、最大として示された相関も0.479だった。詳細な説明や矢印などを含む表現を過大評価し、提示されていない教科書の説明を評価理由に持ち出す例もあった。

編集上は、対象が日本の高校1年生による生物の選択式問題である点を踏まえ、別の教科や年齢層に結果を移す前に実測したい。学習者のプロフィールを使う場合も、予測が実際の評価に近づくかを基準条件と比べる必要がある。

応用先の候補
研究内容と応用案に基づく分類です。業界での導入実績を示すものではありません。

出典

元のタイトル・要旨を確認する(英語)

How Well Can LLMs Simulate Real Learner Evaluations of Educational Feedback?

While recent studies have explored human behavior and preference simulation using large language models (LLMs), it remains unclear how well LLMs can simulate subjective evaluations from real learners in educational settings. We investigate this question using real learner evaluation data on feedback for high-school biology questions at both the group and individual levels. We compare performance with and without learner-specific information, such as personality traits and evaluation examples, across six models. Our results show that LLMs still have a limited ability to simulate learner evaluations. Providing learner profiles and examples improves score calibration and individual-level simulation, but more often fails to improve group-level consistency. These findings highlight the need to investigate which learner information and adaptation strategies are effective for learner preference simulation.

論文本体の取得範囲に基づく解説。AIが作成した未校閲の記事です。性能の数値は著者の評価条件に依存します。応用例と検証計画は編集上の提案です。解説更新:2026-09-29