MIT、強化学習の訓練効率を最大30倍に

学生強化学習MIT

訓練効率の突破口

訓練効率を最大30倍
100モデルを約3に削減
関連問題への汎化性能

交通政策への応用

排出量を11〜22%削減
車速制御で発停を抑制
政策判断をデータで支援

他分野への広がり

物流・供給網への展開
製造・資源配分への応用
詳細を読む

MIT土木環境工学科とデータ・システム・社会研究所に所属するCathy Wu准教授の研究チームは2023年、関連する最適化問題の中から、学習しやすく汎化性能の高い問題を選んで強化学習モデルを訓練する手法を開発しました。通常なら100モデルの訓練が必要な場面で約3モデルに抑え、訓練効率を最大30倍に高めました。

Wu氏は2018年、自動運転車が各種の道路網で交通流に与える影響の分析に強化学習を適用し、可能性を示しました。しかし、その後2年間は応用に失敗し、2022年には、ある問題で機能するアルゴリズムがよく似た問題では機能しないほど、強化学習が条件に敏感だと突き止めました。

研究チームは、問題群の約10%では強化学習が良好に進む点に着目しました。その問題群で訓練した複数のモデルを組み合わせ、直接訓練では解けない問題を含む関連問題群でも性能を発揮させる文脈型強化学習へ研究を発展させています。

最近の研究では、車速を賢く制御して不要な停止と発進を減らすエコドライブ施策に強化学習を応用し、車両の排出量を11〜22%削減できると示しました。複雑な交通システムをデータで分析し、実証に基づく政策判断を支えることが狙いです。

交通以外ではどこに生かせるのでしょうか。開発したアルゴリズムは、物流、供給網、製造、資源配分など、難しい最適化問題の解法づくりを効率化する可能性があります。実社会の課題から基礎的な知見を引き出し、別の課題にも生かす「用途に着想を得た基礎研究」がWu氏の研究姿勢です。

Wu氏はMITでの学部時代に自動運転の講義をきっかけとして交通研究に進み、2023年にはアメリカ国立科学財団の若手研究者向け賞、2025年には指導者としての賞を受けました。複雑な課題に挑む学生には、小さく始め、好奇心を持って問い続けるよう勧めています。