ユーザー接地型 忠実性プローブ —— 走るコードと現場の専門知に接地した生成 AI 能力評価の診断的手法
DOI:
https://doi.org/10.51094/jxiv.5707キーワード:
生成 AI、 能力評価、 診断的プローブ、 忠実性、 計算機教育抄録
大学の現場には,モデル選択を判断する共有可能な語彙が乏しい.本稿は,生成 AI の能力を正誤の二値でも汎用ベンチマークの順位でもなく,利用者が正解を握る診断的プローブとして測る手法「ユーザー接地型 忠実性プローブ」を提案する.挑発的主張への応答と走るコードの生成を,実行による採点で連続指標(到達深度・忠実性)へ分解する.入れ子構成の到達深度は単一試行では能力段階(tier)に沿って見えるが,n=5 反復で取り直すと提供元・世代を固定した統制比較(Claude 三段)で段階差は消え,単一試行が確率変動を段へ見せていたとわかる.残るのは段階でなく再現信頼性の勾配であり,高階の入れ子を反復して頑健に通すのは gpt-5 のみ(5/5),他は高分散の領域に分布する.到達能力と再現性は独立の軸である.二値指標が中間段階を不連続な創発に見せる効果と,閾値判断が利用者側にある二層分離を授業開発の実例で示す.本稿は別稿に続く評価方法論であり,演習科目一般に拡張する.利益相反に関する開示
申告すべきCOIなしダウンロード *前日までの集計結果を表示します
引用文献
A. M. Turing: Computing Machinery and Intelligence. Mind, 59(236):433–460, 1950.
Artificial Analysis: AI Model & API Providers Analysis. https://artificialanalysis.ai/ (アクセス: 2026 年 5 月 28 日).
W.-L. Chiang etal.: Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132, 2024.
R. Schaeffer, B. Miranda, and S. Koyejo: Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004, 2023.
D. F. Mansfield and N. J. Wildberger: Plimpton 322 is Babylonian Exact Sexagesimal Trigonometry. Historia Mathematica, 44(4):395–419, 2017.
E. Robson: Neither Sherlock Holmes nor Babylon: A Reassessment of Plimpton 322. Historia Mathematica, 28(3):167–206, 2001.
東田 学: 全学的 JupyterHub on Kubernetes の運用実証(VIORAS,AXIES 1 本目,投稿中). 2026.
東田 学: 政府「源内」と Jupyter AI に学ぶ大学のための AI 統合計算環境(AXIES 2 本目,投稿中). 2026
ダウンロード
公開済
投稿日時: 2026-07-23 02:46:51 UTC
公開日時: 2026-08-05 07:56:54 UTC
ライセンス
Copyright(c)2026
東田, 学
この作品は、Creative Commons Attribution 4.0 International Licenseの下でライセンスされています。
