TwelveLabs、動画からロボ訓練データ生成
新モデルの要点
一人称映像への特化
行動の時刻付き分割
手と物体の役割認識
企業の導入価値
注釈と品質確認の自動化
静止画対応の追加
導入時の注意
数値比較の非公開
ロボ制御は対象外
出典:VentureBeat
詳細を読む
動画AI企業のTwelveLabsは2026年10月6日、一人称視点の映像からロボット学習向けデータを作る「Pegasus 1.6」を公開しました。作業者や機械の目線で撮った映像を行動ごとに分け、内容と時刻を付けた構造化データへ変換することで、ロボット開発企業やデータ供給企業の注釈作業を効率化します。
新機能の核は、従来版が不得手としていた一人称映像への特化です。静止画をつなぎ合わせる一般的なマルチモーダルLLMとは異なり、時間の流れや因果関係を踏まえて映像全体を解釈する設計だと同社は説明しています。
企業は必要な項目を指定し、物体の持ち上げや位置決め、締め付けなどを個別の区間として整理できます。詳細な説明文の生成に加え、遮蔽や手ぶれ、不明瞭な動作の品質確認、異常や重複の検出、機密性の高い映像の識別にも対応し、静止画も同じAPIで処理できます。
ただし、Pegasusが提供するのは映像の説明と構造化までです。圧力や触覚、精密な軌道、実機の制御は別のシステムが担う必要があり、ロボットの動作改善を直接保証するものではありません。また、社内評価の数値や競合との再現可能な比較、検証可能なロボット顧客の成果も公開されていません。
公表料金は入力動画1時間当たり1.75ドルに加え、入力画像と出力トークンへの従量課金です。区間定義を複数指定すると動画時間の請求が定義数に応じて増えるため、企業は限定した作業で有効な訓練例1件当たりの費用、注釈の修正時間、実機性能への寄与を測る必要があります。作業者の撮影許可や企業秘密の管理も、導入前に確認すべき論点です。