プレプリント / バージョン1

精度差分観測による重み共有再帰Transformerの学習ダイナミクス解明

Gate Decay振幅制御、FP32崩壊境界、および多制御器協調学習

##article.authors##

DOI:

https://doi.org/10.51094/jxiv.6476

キーワード:

再帰Transformer、 重み共有、 Gate Decay、 表現崩壊、 LayerNormオーバーフロー、 多制御器学習、 適応的深度

抄録

7.0Bパラメータの重み共有再帰Transformer(BathysRDT)を200Mトークンの日本語テキストで知識蒸留により事前学習し、4つの知見を報告する。第一に、再帰ゲーティング関数に適用される深度依存減衰機構(Gate Decay)は、隠れ状態の方向を保持しつつ(全深度でトークン平均コサイン類似度 > 0.96)、振幅を最大76倍抑制する。4条件のアブレーション実験により、減衰設定から勾配配分を経てクロスエントロピー性能に至る因果連鎖を確立した。第二に、深い再帰においてFP32 LayerNormの分散計算がオーバーフローし、完全な表現崩壊(representation collapse)を引き起こすことを発見した。この崩壊境界は学習中に浅い側へ侵食する。反実仮想シミュレーションにより、減衰強化ではこの侵食を止められないことを示し、差分精度実験(FP64 LayerNorm)により崩壊が完全に消失することを確認した。FP64化により有効深度上限はd=8からd=15に拡大し、V3安定性指標の最小値は0.127から0.972に改善した。第三に、減衰ダイナミクスと数値精度の相互作用は、入力分離に基づく多制御器フレームワークを必要とする。第四に、再帰の初回ステップ(d=1)は再帰的洗練(d≥2)とは質的に異なる注入段階であり、全深度一律の減衰パラメータでは制御が不十分となることを発見した。深度1専用の減衰時定数を分離導入し、深度拡張後に深層との性能差が拡大することを中間結果として確認した(学習継続中)。具体的な制御アルゴリズムとパラメータは特許出願書類に記載されている。これらの知見は、重み共有パラメータの繰り返し適用から生じる学習ダイナミクスを示すものであり、重み共有再帰アーキテクチャに特に関連が深い。

利益相反に関する開示

該当なし。本研究で用いた多制御器協調学習フレームワークに関する特許(ALTH-001〜006、ALTH-012 特願2026-201413)は著者により出願済みである。

ダウンロード *前日までの集計結果を表示します

ダウンロード実績データは、公開の翌日以降に作成されます。

引用文献

Bae, S. et al. (2025). Mixture-of-Recursions. arXiv:2507.10524.

Banino, A. et al. (2021). PonderNet: Learning to Ponder. arXiv:2107.05407.

ByteDance (2025). Ouro: Looped Language Models. arXiv:2510.25741.

Csordas, R. et al. (2026). Universal Transformers Need Memory. arXiv:2604.21999.

Dehghani, M. et al. (2019). Universal Transformers. ICLR.

Geiping, J. et al. (2025). Scaling Up Test-Time Compute with Latent Reasoning. arXiv:2502.05171.

Logan, J. (2026). Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers. arXiv:2607.14427.

Micikevicius, P. et al. (2018). Mixed Precision Training. ICLR.

Nakamura, T. (2026). Apparent Convergence in Transformer Hidden States. Jxiv.

Schuster, T. et al. (2022). Confident Adaptive Language Modeling. NeurIPS.

Wortsman, M. et al. (2023). Small-scale proxies for large-scale Transformer training instabilities. arXiv:2309.14322.

Zhang, T. et al. (2026). When Does Recurrence Become an Algorithm? arXiv:2607.20594.

Zhou, W. et al. (2020). PABEE: Pre-Trained Model Based Early Exiting. ACL.

ダウンロード

公開済


投稿日時: 2026-09-15 01:10:52 UTC

公開日時: 2026-10-01 06:17:19 UTC
研究分野
情報科学