思考モード内での前処理と検証を組み込んだ自動採点プロンプトの開発と評価
DOI:
https://doi.org/10.51094/jxiv.6479キーワード:
大規模言語モデル、 自動採点、 プロンプト、 思考モード抄録
本研究では,LLMの思考モードを活用したプレ採点・本採点・検証の3段階サイクルを組み込んだ自動採点プロンプトの有効性を,拡張思考の有無を変えた4条件で検証した.大学生の記述式回答1189件を対象に,Claude Opus4.6およびSonnet4.6で採点を実施し人間採点と比較した結果,拡張思考あり条件では一致率0.855〜0.873,重み付きκ(二乗)0.291〜0.342,ICC(2,1) 0.352〜0.382を示し,なし条件をそれぞれ0.16〜0.28,0.05〜0.07,0.09〜0.10ポイント上回り,思考モードの活用が採点精度の向上に有効であることが確認された.
利益相反に関する開示
開示すべき利益相反はない.ダウンロード *前日までの集計結果を表示します
ダウンロード実績データは、公開の翌日以降に作成されます。
引用文献
LANDIS, J. R., & KOCH, G. G. (1977). The measurement of observer agreement for categorical data. Biometrics, 33(1), 159-174.
STUREBORG, R., ALBER, A. F., Shi, H., & DURRETT, G. (2024). Large Language Models are Inconsistent and Biased Evaluators. arXiv preprint arXiv:2405.01724.
ダウンロード
公開済
投稿日時: 2026-09-15 02:46:41 UTC
公開日時: 2026-10-07 06:35:57 UTC
研究分野
心理学・教育学
ライセンス
Copyright(c)2026
松河, 秀哉
この作品は、Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International Licenseの下でライセンスされています。
