Multiverse、LLM半減時のMMLUを約77に維持

深層圧縮の成果

80層中40層の削除
MMLU76.9の維持
従来法比約23点の優位

組合せ選定の仕組み

相互作用込みの最適化
ヘッセ行列の再利用

探索と適用範囲

タブー探索で秒単位の解
異種構成モデルへの適用
詳細を読む

Multiverse Computingの研究チームは2026年9月21日、LLMの削除対象ブロックをイジング模型として選ぶ制約付き二値最適化手法を公表しました。Llama-3.3-70B-Instructの80層中40層を再学習なしで削除し、MMLUを76.9に維持しました。従来のブロック影響度法は54.0で、差は約23ポイントです。

ブロック単独の重要度だけで削除順を決める従来法は、同時に外すブロックの組み合わせを十分に扱えません。新手法は各ブロックを残すか削るかの二値変数とし、損失の二次テイラー展開から得るヘッセ行列で単独効果とブロック間の相互作用を表します。

この選択問題は、削除数を固定した制約付き二値最適化として、全結合のイジンググラスの低エネルギー状態探索に置き換えられます。エネルギーは圧縮後モデルのベンチマーク品質を推定する安価な指標となり、低いほど高性能な候補に対応します。

ヘッセ行列は小規模な校正データによる順伝播と逆伝播から一度だけ計算し、異なる削除数にも再利用できます。候補ごとの評価は実モデルの実行を要しないエネルギー計算で済み、検証可能な難しい事例でもオープンソースのタブー探索が最低エネルギー状態へ秒単位で到達しました。

最小エネルギー解が常に最良とは限りません。Llama-3.1-8B-Instructでは、初期ブロックも削る17番目の励起状態が軽い再学習後に複数のベンチマークで基底状態を上回り、上位候補を複数試す意義を示しました。

新手法はLlamaQwenだけでなく、Mamba2、Attention、MoE層を混在させたNVIDIA Nemotronの異種構成にも再学習なしで適用されました。量子化や低ランク圧縮などとも併用できるため、深さの削減を既存の圧縮工程に組み込めます。