Waymo、モデル性能でなく評価成熟度で出荷を判断

評価中心の開発

評価成熟度で完成度判断
発売後も継続する評価

安全性の担保

希少・危険ケースの重点検証
発売判断に人間の監督
累計2.2億マイルの自律走行

企業への示唆

効率化と信頼性の両立
AI活用に必要な明確な目標
社内エージェントも評価対象
詳細を読む

Alphabet傘下の自動運転企業Waymoは、AIプロジェクトの完成度を「モデルの性能が良いとき」ではなく「評価が通るとき」で判断していると明らかにしました。同社エンジニアリング責任者のマナシ・ジョシ氏が、イベント「VB Transform 2026」で説明したものです。評価を最終確認ではなく開発の中核に据える評価中心の開発を掲げ、テストの成熟度でプロジェクトの成熟度を測ります。

評価は発売前の一度きりの作業ではないとジョシ氏は強調します。Waymoは走行・シミュレーション・検証にまたがる継続的なプロセスとして評価を扱い、モデルや業務プロセス、利用者の行動、入力データの変化に応じてテストを続けます。企業にとっても発売前のテストだけでは不十分で、評価を広い業界ベンチマークではなく実際のビジネス成果に結びつけるべきだと指摘します。

評価の階層は安全という一つの目標に貫かれています。同社は自社の走行ログや一部の外部データ、数十億マイル相当の合成シナリオを用い、交通弱者や踏切、工事区間といった複雑な状況を重点的に検証します。発売の可否は自動化に委ねず、社内の安全責任者による承認など人間の監督を組み込んでおり、これまで2.2億マイル超の完全自律走行で重傷事故が人間の17分の1だったといいます。

一方で計算資源やストレージ、メモリー、ネットワークへの需要は供給を上回って増えており、効率化と信頼性の両立が課題となります。Waymoはデータ選別による効率化を進め、2017年に導入したTransformerから大規模言語モデルや視覚言語モデルへ発展させ、現在は生成系のマルチモーダルモデルを基盤戦略に据えています。

社内では技術者の生産性を高めるためにAIエージェントも活用し、データ分析や不具合の切り分けを任せつつ、その出力の信頼性を評価しています。経営層への示唆は明快です。エージェント型AIには強力なモデルだけでなく、明確な目標、代表性のある評価データ、継続的なテスト、効率的な基盤、そして責任を負う人間の意思決定者が欠かせないという点です。