ServiceNow、合成データで成功率7.2ポイント向上

失敗から教材を生成

弱点に沿う課題設計
実行可能性の検証
教師モデルの成功例

二段階の品質管理

正誤両面の判定
批評に基づく修復

二領域で効果確認

2千件を18時間で生成
Pass@1を7.2ポイント改善
ITSMでも8.41ポイント向上
詳細を読む

ServiceNow CoreAIは2026年10月2日、企業向けAIエージェントの失敗を、検証済みの合成学習データへ変える「AutoSynthData」を公開しました。対象モデルの苦手分野を診断し、より高性能な教師モデルの成功例を基に実行可能な課題を生成する仕組みで、企業固有の業務環境に合わせて性能を継続的に高める狙いです。

同システムは、タスクを「システム仕様、利用者の指示、検証器」の組み合わせとして扱います。候補には実行可能性、現実性、難しさを求め、検証器には指示との整合性、誤りを退ける健全性、正しい別解も認める完全性を求めます。

まず診断タスクで対象モデルと教師モデルを比較し、失敗箇所や必要な能力を匿名化した仕様カードに整理します。元の評価課題の指示や固有情報は生成器に渡さず、新しい状態と解法を持つ課題を作成します。中核例を検証するtarget段階と、その合格例から派生例を増やすmultiply段階を分け、世代を重ねた逸脱を抑えます。

各候補は参照解の実行、正しい結果を通す検証、誤った結果を退ける検証を受け、失敗時には批評に基づく修復を限られた回数だけ試します。実験設定では、対象モデルの成功が3回中1回以下、より強い解答モデルの成功が3回中2回以上の課題を優先しました。さらにバッチ単位で偏りや重複を点検し、不足する能力へ生成を振り向けます。

EnterpriseOps GymのHybrid領域では、2,000件を約18時間で生成してGemmaを追加学習し、平均Pass@1を7.2ポイント、相対値で35%改善しました。検証器の成功率は63.01%から68.55%へ上がり、元の参照モデルとの差を59%縮めました。ITSM領域でも1,994件による追加学習で平均Pass@1が18.77%から27.18%へ上昇しており、異なる企業業務領域で効果を確認しています。