プレプリント / バージョン1

ユーザー接地型 忠実性プローブ —— 走るコードと現場の専門知に接地した生成 AI 能力評価の診断的手法

##article.authors##

  • 東田, 学 国立大学法人大阪大学

DOI:

https://doi.org/10.51094/jxiv.5707

キーワード:

生成 AI、 能力評価、 診断的プローブ、 忠実性、 計算機教育

抄録

大学の現場には,モデル選択を判断する共有可能な語彙が乏しい.本稿は,生成 AI の能力を正誤の二値でも汎用ベンチマークの順位でもなく,利用者が正解を握る診断的プローブとして測る手法「ユーザー接地型 忠実性プローブ」を提案する.挑発的主張への応答と走るコードの生成を,実行による採点で連続指標(到達深度・忠実性)へ分解する.入れ子構成の到達深度は単一試行では能力段階(tier)に沿って見えるが,n=5 反復で取り直すと提供元・世代を固定した統制比較(Claude 三段)で段階差は消え,単一試行が確率変動を段へ見せていたとわかる.残るのは段階でなく再現信頼性の勾配であり,高階の入れ子を反復して頑健に通すのは gpt-5 のみ(5/5),他は高分散の領域に分布する.到達能力と再現性は独立の軸である.二値指標が中間段階を不連続な創発に見せる効果と,閾値判断が利用者側にある二層分離を授業開発の実例で示す.本稿は別稿に続く評価方法論であり,演習科目一般に拡張する.

利益相反に関する開示

申告すべきCOIなし

ダウンロード *前日までの集計結果を表示します

ダウンロード実績データは、公開の翌日以降に作成されます。

引用文献

A. M. Turing: Computing Machinery and Intelligence. Mind, 59(236):433–460, 1950.

Artificial Analysis: AI Model & API Providers Analysis. https://artificialanalysis.ai/ (アクセス: 2026 年 5 月 28 日).

W.-L. Chiang etal.: Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132, 2024.

R. Schaeffer, B. Miranda, and S. Koyejo: Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004, 2023.

D. F. Mansfield and N. J. Wildberger: Plimpton 322 is Babylonian Exact Sexagesimal Trigonometry. Historia Mathematica, 44(4):395–419, 2017.

E. Robson: Neither Sherlock Holmes nor Babylon: A Reassessment of Plimpton 322. Historia Mathematica, 28(3):167–206, 2001.

東田 学: 全学的 JupyterHub on Kubernetes の運用実証(VIORAS,AXIES 1 本目,投稿中). 2026.

東田 学: 政府「源内」と Jupyter AI に学ぶ大学のための AI 統合計算環境(AXIES 2 本目,投稿中). 2026

ダウンロード

公開済


投稿日時: 2026-07-23 02:46:51 UTC

公開日時: 2026-08-05 07:56:54 UTC
研究分野
情報科学