複数教師の蒸留、学習の落とし穴を解明
複数のRL教師の能力を1つの小型モデルへ統合する蒸留で、損失の平均化方式や数値精度が成果を左右することが判明した。AI開発の品質管理と計算コストに直結する知見である。

研究の概要
Zhu氏らの研究チームは、強化学習で鍛えた複数の教師モデルの強みを1つの生徒モデルに集約する「マルチ教師オンポリシー蒸留(MOPD)」を分析した。Qwen3-1.7Bを生徒とし、同じ初期値から4つの領域別教師を訓練した。SmolLM3-3Bでも補助的に検証した。勾配、オプティマイザの更新量、学習曲線を比較し、教師の信号がパラメータ変化にどう反映されるかを調べた。
第一の知見は、損失の平均化方式が応答に暗黙の重みを与える点である。トークン単位の平均化は長い応答を優遇する。領域ごとの寄与を均等にしても、領域内ではこの偏りが残る。
第二に、最適化手法Adamの第1モーメントが更新の差を縮める。生のままでは教師間で勾配が異なるが、更新方向のコサイン類似度は教師間で0.83、平均化方式間で0.96に達した。設定の違いが見かけほど更新に表れない場合がある。
第三に、数値精度の影響である。FP32のマスター重みの約97%が初期値から変化していたのに対し、BF16の重みで変化していたのは**7〜11%**にとどまった。小さな学習の進捗が丸め処理で隠れる。
第四に、語彙上位64件の交差KL勾配は、全語彙の勾配とほぼ一致した。ただし、タスク性能への影響は平均化方式に依存した。数学の正答率は、応答平均では標本トークン方式のポリシー勾配より2.6ポイント高く、全体トークン平均では2.1ポイント低かった。
ビジネスへの示唆
最大の含意は、同じ手法でも実装の細部で結果が逆転し得る点である。自社専用の小型モデルを開発する企業は、手法の採否だけでなく、平均化方式と精度設定まで含めて検証する必要がある。
影響が大きいのは次の部門と指標である。
- カスタマーサポート部門:問い合わせ分類、要約、返信生成の専門モデルを1つに統合すれば、運用するモデル数と保守工数を減らせる。応答の長さの偏りは、回答の冗長化や初回解決率の悪化を招く恐れがある。
- 金融・法務部門:契約審査や与信、数学的推論を担う別々の教師を統合する際、長文を優遇する重み付けが短い判断タスクの精度を下げる可能性がある。領域別の正答率と誤判定率を監視すべきである。
- ソフトウェア開発部門:コード生成、テスト生成、レビューなど領域別教師を統合する際、推論コストの削減を狙える。1リクエスト当たりの推論単価とレイテンシが主要な評価指標となる。
- MLOps・AI基盤部門:BF16で学習を進めると、改善が反映されていないように見える場合がある。メモリ節約と学習の可視性の間で、精度設定のコストと効果を比較する必要がある。
小型モデルへの統合は、GPU費用の抑制やオンデバイス実行につながる。製造業の現場端末や医療機関の院内システムなど、外部にデータを出しにくい環境で特に利点が大きい。一方、統合後の性能が単純な平均では予測できない以上、導入前の領域別ベンチマーク整備が不可欠となる。
今後の展望
今回の検証は1.7B〜3B規模の小型モデルと4領域に限られる。大規模モデルや領域数が増える場合に同じ傾向が続くかは未確認である。また、数学以外の業務タスクで平均化方式の影響がどの程度出るかも今後の課題である。
それでも、蒸留の勾配や更新量を診断する手法は、実務の品質保証に応用できる。教師ごとの寄与度や、精度設定による更新の消失を事前に点検する体制を整えれば、再学習の回数を減らし、開発期間と計算コストの両面で効率化が見込まれる。複数の専門AIを1つに束ねる動きが広がるなか、蒸留の設計根拠を説明できる企業ほど、運用の信頼性で優位に立つとみられる。
関連トピック
同セクションの記事
OmniSeek、音声映像を能動的に探索
長い音声付き映像から、必要な場面を自ら選んで見聞きする推論AI「OmniSeek」が登場した。映像と音声の両方を根拠とする推論を促し、監視や会議分析の精度向上に道を開く。

ループ型AI、推論精度向上と計算半減を両立
米研究チームが、ループ型Transformerの途中計算を活用し追加学習なしで推論精度を高める手法LoopCDを開発した。ループ数を半減しても同等以上の精度を保ち、演算量を最大48.2%削減した。

DMAD、高速画像生成の蒸留を簡素化
中国・米国の研究チームが、拡散モデルを少ステップで動かす蒸留手法DMADを発表した。補助モデルを不要とし、1~4ステップで教師モデルを上回る品質を示し、生成コストの削減に道を開く。
