Ai2、GPU予算制でデバッグ待ち30秒

GPUデバッグ

予算制の仕組み

階層型のGPU時間配分
7日間の公平配分
最長8時間の実行保証

導入後の成果

割当GPU時間の98%提供
クラスター稼働率98%維持
デバッグ待ち30秒
有人修理74%減
詳細を読む

AI研究機関Ai2は7月末から、保有するGPUクラスターに予算型の階層的公平配分と時間分割を組み合わせた新スケジューラーを順次導入しました。研究チームごとにGPU時間を予算として割り当て、ジョブの実利用を7日間の窓で追跡することで、需要が供給の2〜3倍ある環境でも重要案件への配分と98%の稼働率維持を両立させました。

従来の優先度方式では、実行中のジョブを守る設定に費用がなく、全ジョブが最高優先度を選ぶ状況や、GPUを確保し続ける空ジョブが生じていました。保守が必要な機器でも担当者が利用者と停止交渉を重ねており、希少な計算資源の利用と運用負担の双方に課題がありました。

新方式では、管理職が研究戦略に沿ってGPU時間の予算を階層的に配り、過去7日間の実績が割り当てを下回るチームのジョブを優先します。各ジョブは有意義な進捗に必要な最短実行時間を申告し、最長8時間の保護期間後は中断・再投入できるため、チーム間の公平な時間分割が可能です。

30日間の検証では、需要分を上限にチームへ支払うべきGPU時間の98%を提供し、15チーム中13チームが95%以上を受け取りました。未割り当てのジョブにも18%のGPU時間を開放したため、予算と実需がずれた時間帯も全体の稼働率を98%に保てました。

デバッグ用ジョブの待ち時間は90パーセンタイルで2時間から30秒、最大規模のH100クラスターでは中央値が5分から24秒に短縮しました。さらに、保護期間の終了に合わせて不調な機器からジョブを自動退避し、人手が必要な修理を74%削減しました。

一方、対話型セッションは8時間を超えると中断対象になり、作業状態の再構築が利用者の負担となりました。Ai2はCPU専用クラスターと復元可能なセッションを計画するほか、大規模ジョブを配置しにくくする容量断片化の可能性もシミュレーターと実測で調べています。