AllenAI、LLM評価を質問単位で監査
出典:Hugging Face
詳細を読む
AllenAIは2026年9月1日、LLMベンチマークを設問単位で監査する新手法「BenchMIRT」を発表しました。100のLLMが16種類、3万4千超の設問に回答した結果を多次元項目反応理論で分析し、総合点に混在する安全性と一般推論力の信号を分離します。研究者が評価結果を正確に解釈し、より焦点を絞った評価を設計しやすくする狙いです。
BenchMIRTは心理測定の項目反応理論を多次元化し、モデルの能力と、各設問の難易度・識別力を同時に推定します。能力名を事前に与えなくても、安全性と一般推論力という二つの主要次元を独立に抽出し、解析をやり直しても同じ次元が現れました。
分析では、社会的偏見を測るBBQと危険知識を扱うWMDPが、安全性より一般推論力と強く結び付きました。HarmBenchでも、有害依頼への対応は安全性に近い一方、著作権関連の設問は一般推論力に近く、単一スコアが複数の能力を混ぜる実態が示されました。
設問の識別力と難易度を基に選ぶと、全設問の10%だけでも、多くの場合にモデルの強弱の傾向をほぼ維持できました。未回答設問の正誤予測も79%で、ベンチマーク平均だけを使う単純手法の70%を上回り、評価コストを抑える可能性があります。
一方、分析対象のモデルは2025年3月までに公開されたものに限られ、抽出される能力次元も与えるベンチマーク群に左右されます。無作為に保留した設問でモデル順位を予測する目的では平均点がわずかに優れ、重要設問の特定が評価を意図的に弱める用途に悪用されるリスクもあります。