Google、AIの失敗を蓄積するWikiSkill開発

知識を三層化

改変しない実行履歴
成功と失敗の知識庫
実行用スキル

検証で更新を選別

4段階の改善循環
不採用案の履歴保持

成果と残る課題

最大12ポイント優位
モデル間のスキル移転
知識庫の肥大化
詳細を読む

Google ResearchとVirginia Techは、AIエージェントの成功・失敗履歴を構造化した知識庫に蓄え、そこから実行用スキルを継続的に改善する枠組み「WikiSkill」を開発しました。過去の診断や不採用となった修正案を捨てずに再利用しながら、知識庫そのものは実行時のプロンプトに入れず、企業が持つ実行履歴を推論負荷を抑えつつ再利用可能な知識へ変える狙いです。

WikiSkillは作業領域を、改変しない実行履歴、構造化した知識庫、実行用スキルの三層に分けます。実行履歴には行動、推論、ツールの呼び出しと出力、最終回答を保存し、知識庫には繰り返す失敗や成功策、改善履歴、スキル変更の効果を記録します。各スキルは、作成や修正の根拠となった知識庫のパターンにも結び付きます。

改善は、訓練課題から履歴を作る、成功・失敗を知識庫へ反映する、スキル案を作る、検証用データで評価するという4段階です。候補は過去最高の検証得点を上回った場合だけ採用します。模擬家事環境の事例では、却下した広すぎるスキルの記録を残したことで、次の反復時に具体的な繰り返し防止スキルへ改善できました。

研究チームは数学推論、ウェブ検索、表計算、長文文書への質問応答、対話型家事の5ベンチマークで、Qwen、Gemma、Geminiを評価しました。WikiSkillは全モデルで最高の平均得点を記録し、各モデルで最も強い競合手法を3.3~12ポイント上回りました。Qwenでは4B、9B、27Bとモデルが大きくなるにつれ、スキルなしとの差が12.3、17.5、23.9ポイントに広がりました。

スキルは一部でモデル間の移転も可能で、ALFWorldではQwen-3.5-9BがQwen-3.6-27Bの作ったスキルを使うと70.2%を得て、自身のスキルを使った63.4%を上回りました。知識庫を実行役に見せず、45~129行の短いスキルだけをプロンプトへ入れる設計は、推論時の計算量を抑えます。Gemini-3.5-Flashの除去実験でも標準構成は平均63.7%で、知識庫を外した48.7%や実行役にも見せた60.9%より高い結果でした。

一方、改善サイクルでは反復ごとに約10~20回の推論とツール呼び出しが加わります。スキル群が増えた際の検索や起動、すぐ得点に結び付かない変更の扱い、増え続ける知識庫の自動整理、数百操作や数時間に及ぶ課題への対応は未検証です。