プレプリント / バージョン1

実証監査アーキテクチャ(EAA)

複数 AI による証拠再構成を比較可能にする監査方法の開発と前向き検証

##article.authors##

DOI:

https://doi.org/10.51094/jxiv.6148

キーワード:

生成 AI、 実証監査、 証拠再構成、 盲検検証、 監査可能性、 不確実性、 再現可能性、 人間・AI 協働

抄録

生成 AI は、複数の文書や時点に分散した証拠資料から、出来事の経過、関係主体、判断、不確実な状態などを短時間で再構成できる。一方、複数の AI に同じ資料を与えた場合、主要な出来事への理解が近くても、情報のまとめ方、対象範囲、時点との結び付け、不確実性の残し方には差が生じる。

本研究では、複数 AI による証拠再構成を、原回答を保持したまま共通形式へ整理し、差異と不確実性を保存しながら比較・追跡・再実行するための監査方法として、実証監査アーキテクチャ(Empirical Audit Architecture: EAA)を開発した。

方法形成には二つの開発事例を用いた。EV-01 では、複数 AI が主要な研究状態を広く共通して再構成しても、記述単位や表現形式の違いによって機械的比較が難しくなる問題を確認した。EV-02 では、比較形式に加え、証拠範囲、判定基準、情報接触状態、不確実性、実行仕様そのものを事前に自己完結させる必要性を確認した。これらを反映した Architecture Kernel v0.2.5 を凍結した後、新しい事例 EV-03 を凍結済み方法に対する最初の前向き検証として実施した。ここでいう前向き検証は、事例選択過程全体の完全な事前登録を意味するものではなく、監査方法を凍結した後に新しい事例へ適用したことを指す。

EV-03 の自由盲検再構成では、38 個の標準化命題のうち 33 個が 3 種類の検証 AI すべてで回収された。GPT-5.6 Sol は 38 個、Gemini は 33 個、Claude は 35 個を回収し、Claude では 2 個が曖昧と判定された。これらの回収数は本事例における意味対応状態を示すものであり、各モデルの一般的な性能順位を評価するものではない。確定状態同士が両立しない実質的内容の衝突は 0 件だった。差は主に、情報伝達経路と実際の情報取得、情報集合の完全性、情報接触状態、「不明」と「未解決」の扱い、個別の不確実性の明示に現れた。

続く独立した不確実性確認では、4 項目について 3 検証 AI から得た計 12 回答すべてで必要状態が回収され、4 項目すべてで 3 者の判定が一致した。この追加確認によって自由再構成の原回答は変更しなかった。最終的に、機械比較可能性に関する 10 項目の検査をすべて通過し、意味対応付け確定後の比較処理について同一条件から同一結果を再生成できた。

本研究は、複数 AI の再構成結果を一つの合意へ統合せず、それぞれの原回答、差異、不確実性、意味対応付けの履歴を保持した状態で比較可能にする監査方法を提示する。今回の前向き検証は一事例を対象としており、今後は独立した判定者による意味対応付けの再現性、異なる領域への適用、第三者による独立再実施を検証する必要がある。

利益相反に関する開示

著者は、本稿の内容に関して開示すべき利益相反はない。

ダウンロード *前日までの集計結果を表示します

ダウンロード実績データは、公開の翌日以降に作成されます。

著者の経歴

Meta, S.、独立研究者

独立研究者。AI生成出力の監査可能性、長期的な人間-AI協働、構造的ドリフト、実務判断支援のための補助的監査フレームワークを研究している。

引用文献

Min S, Krishna K, Lyu X, et al. FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. 2023:12076–12100. doi:10.18653/v1/2023.emnlp-main.741.

Liu Y, Iter D, Xu Y, Wang S, Xu R, Zhu C. G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. 2023:2511–2522. doi:10.18653/v1/2023.emnlp-main.153.

Zheng L, Chiang WL, Sheng Y, et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems 36 (NeurIPS 2023), Datasets and Benchmarks Track. 2023;36:46595–46623. arXiv:2306.05685.

Du Y, Li S, Torralba A, Tenenbaum JB, Mordatch I. Improving Factuality and Reasoning in Language Models through Multiagent Debate. Proceedings of the 41st International Conference on Machine Learning. PMLR. 2024;235:11733–11763.

Farquhar S, Kossen J, Kuhn L, Gal Y. Detecting hallucinations in large language models using semantic entropy. Nature. 2024;630:625–630. doi:10.1038/s41586-024-07421-0.

Plank B. The “Problem” of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing. 2022:10671–10682. doi:10.18653/v1/2022.emnlp-main.731.

Lin H, Deng Y, Gu Y, Zhang W, Ma J, Ng SK, Chua TS. FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2025:360–381. doi:10.18653/v1/2025.acl-long.17.

Pineau J, Vincent-Lamarre P, Sinha K, et al. Improving Reproducibility in Machine Learning Research: A Report from the NeurIPS 2019 Reproducibility Program. Journal of Machine Learning Research. 2021;22(164):1–20.

Ojewale V, Suresh H, Venkatasubramanian S. Audit Trails for Accountability in Large Language Models. arXiv:2601.20727. 2026.

Li Z, Lu H, Wei T, et al. Constructing Industrial-Scale Optimization Modeling Benchmark. arXiv:2602.10450. 2026. Accepted for publication at ICML 2026.

Kadaboina RK. Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks. arXiv:2605.20312. 2026.

Yang W, Li S, Ping H, Zhang P, Bogdan P, Thomason J. Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge. arXiv:2602.09341. 2026.

Najera A, Moon A, Srinivasan V, Veeraraghavan R. When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis. arXiv:2605.29025. 2026.

Nakrani V. AuditWeave: A Tamper-Evident, Auditor-Navigable Evidence Layer for AI-Assisted and Data-Transformation Workflows. arXiv:2607.09682. 2026.

Lushtaku E, Kargi B, Elganzory A, Ferreira F, Salamanca AR, Kreutzer J, Salinas D. JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation. arXiv:2608.02620. 2026.

ダウンロード

公開済


投稿日時: 2026-08-20 00:29:24 UTC

公開日時: 2026-09-16 04:25:58 UTC
研究分野
情報科学