Výzkumníci zveřejnili Qwen-Drive-1.0, první krok k vizuálně-jazykovému základnímu modelu pro autonomní řízení. Model zachovává architekturu předtrénovaného VLM a v jednom rámci spojuje 3D vnímání, odpovědi na vizuální otázky a plánování pohybu. Samostatná hlava pro pohled z ptačí perspektivy zajišťuje detekci objektů, předpověď obsazenosti prostoru a segmentaci mapy. Planning Expert pak z reprezentací modelu vytváří budoucí trajektorie vozidla. Trénování kombinuje data z řízení s obecnými vizuálně-jazykovými daty, aby model získal dopravní schopnosti a současně si zachoval širší porozumění obrazu i instrukcím. Autoři uvádějí konkurenceschopné výsledky v otevřeném, pseudo-uzavřeném i uzavřeném hodnocení plánování. Kód má být zveřejněn na GitHubu.

Radyz

Radyz publikuje komentáře a praktické texty o AI nástrojích, ChatGPT, Claude a dění kolem OpenAI a Anthropicu. Na webu se soustředí na srozumitelný výklad, vlastní zkušenost a důraz na to, co je pro čtenáře skutečně užitečné.