Výzkumníci zveřejnili Qwen-Drive-1.0, první krok k vizuálně-jazykovému základnímu modelu pro autonomní řízení. Model zachovává architekturu předtrénovaného VLM a v jednom rámci spojuje 3D vnímání, odpovědi na vizuální otázky a plánování pohybu. Samostatná hlava pro pohled z ptačí perspektivy zajišťuje detekci objektů, předpověď obsazenosti prostoru a segmentaci mapy. Planning Expert pak z reprezentací modelu vytváří budoucí trajektorie vozidla. Trénování kombinuje data z řízení s obecnými vizuálně-jazykovými daty, aby model získal dopravní schopnosti a současně si zachoval širší porozumění obrazu i instrukcím. Autoři uvádějí konkurenceschopné výsledky v otevřeném, pseudo-uzavřeném i uzavřeném hodnocení plánování. Kód má být zveřejněn na GitHubu.
Qwen-Drive spojuje vidění, 3D mapu a plánování jízdy
Výzkumníci zveřejnili Qwen-Drive-1.0, první krok k vizuálně-jazykovému základnímu modelu pro autonomní řízení. Model zachovává architekturu předtrénovaného VLM a v jednom rámci spojuje 3D vnímání, odpovědi na vizuální otázky a plánování pohybu. Samostatná hlava pro pohled z ptačí perspektivy zajišťuje detekci objektů, předpověď obsazenosti prostoru a segmentaci mapy. Planning Expert pak z reprezentací modelu vytváří budoucí trajektorie vozidla. Trénování kombinuje data z řízení s obecnými vizuálně-jazykovými daty, aby model získal dopravní schopnosti a současně si zachoval širší porozumění obrazu i instrukcím. Autoři uvádějí konkurenceschopné výsledky v otevřeném, pseudo-uzavřeném i uzavřeném hodnocení plánování. Kód má být zveřejněn na GitHubu.