英国AISI、EvalEvalでAI評価を再現可能に
出典:Hugging Face
詳細を読む
英国政府のAI Security Institute(AISI)は2026年9月22日、EvalEvalの共有基盤を使い、AIモデルの評価手法と結果を公開すると発表しました。検証済みの結果に設定や文脈を添えてEvaluation Cardsで共有し、費用のかかる再実験に頼らず、第三者が結果を再現・検証・比較しやすくする狙いです。
公開対象は、HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0の5ベンチマークです。Claude Opus 4、4.5、4.6とGPT-5、5.2、5.4の6モデルを含み、別枠でCyber CTFsとThe Last Onesの結果も収録します。
データは、推論時の計算量と評価手順が最先端LLMの成績にどう影響するかを調べたAISI論文に伴うものです。Humanity's Last Examでは、正誤フィードバックを与える条件で、使用トークンが増えるほど追加の課題を解けたと報告しています。
EvalEvalは、共通報告仕様Every Eval Ever(EEE)と公開基盤Evaluation Cardsを運営します。ベンチマーク情報、実行条件、モデル情報を同じ構造で記録するため、一見似たスコアでも条件差を踏まえて解釈できます。
企業のAI責任者や開発者は、単一スコアだけでモデルを選ぶべきでしょうか。今回の公開は、推論予算や評価プロトコル、個別の実行記録まで確認し、自社用途への適合性を判断する材料になります。