SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment
第64回 コンピュータビジョン勉強会@関東(後編)
@caprest
1
※本資料/本発言に含まれる意見や見解は、私個人のものであり、所属する組織の立場や方針を代表・代弁するものではありません。
※資料中の引用は特に言及がない限り当該中の論文から行っています
書誌情報
2
ざっくりいうと
3
背景:カメラオンリー地図レス自動運転
LiDARや地図を使わない自動運転
4
背景:Closed-loop VS Open-loop 自動運転
モデルの出力で入力が変化するのがClosed-loop, 変化しないのが Open-loop
5
問題設定
6
モデルの入力は?
カメラ画像・自車速度・ナビゲーション指示・タスクプロンプトで構成されるプロンプト
“〈image features〉 Current speed: 〈v〉m/s. Command: 〈nav. features enav〉. 〈task prompt ptask〉.”
7
モデルの出力は?
二種類の座標値とCommentary
8
モデルアーキテクチャ
基本はInternVL2-1Bを使用
9
画像入力部分はどうなっている?
自動運転に必要な高解像度に対応するためのテクニックが入っている
10
言語入力/出力部分は?
指示をトークンに変換、一般的なVLM構成+座標値のMLP+learnable token
11
学習方法は?
LLM部分のみLoRA、他はフルトレーニング
12
どのようなSupervisionを与える?
データセットの構成に工夫を加えている
13
Action Dreamingとは
実際には取らないような軌道指示と軌道のGTを与えるデータ拡張
14
運転のGTデータはどうやって集めた?
オラクル情報にアクセスできる「特権的」なルールベース運転モデルを使い収集
15
Evaluation
16
CARLA Leaderboard v2
17
結果: CARLA v2
カメラオンリーにもかかわらずトップクラスの結果
18
結果:Bench2Drive
Bench2DriveではSoTA
19
結果: VQA
雨、夜などの条件でも正しくVQAに成功している
20
結果:Action Dreaming
21
結果:HLCでもTP同等の精度を確保
HLC (high-level language command:言語指示) TP(target point: 座標値)
22
結果:補助タスクの効果は限定的かも?
23
結果:vanilla VLMよりもVQA性能は当然向上
24
エッジで動くのか?
動かしてはいない。
25
Limitation
26
VLAは本当に使う価値があるのか?
VLMを使うモチベーションは「常識」の導入だが、思ったよりまだ常識がない
27
GPT5 VS 天下一品
cherry pick 気味だがGPT5 は天下一品がstop signでないと認識してくれなさそう
28
画像:https://ikikuru.com/entertainment/22551/
まとめ
29