Alibaba đưa Qwen-Drive-1.0 vào xe tự hành, hợp nhất nhận thức 3D và lập kế hoạch trong một VLM
Qwen-Drive-1.0 giữ nguyên backbone Qwen3.5-4B và bổ sung BEV perception head cùng Planning Expert để kết hợp VQA, nhận thức 3D và motion planning.

Qwen Team đã giới thiệu Qwen-Drive-1.0, một vision-language foundation model dành cho xe tự hành. Điểm khác biệt của dự án là cố gắng đưa ba năng lực vốn thường nằm ở các module riêng — nhận thức 3D, hỏi đáp hình ảnh và lập kế hoạch chuyển động — vào cùng một framework dựa trên Qwen3.5-4B.
Theo bài công bố chính thức ngày 03/09/2026, Qwen-Drive giữ nguyên kiến trúc VLM pretrained và gắn thêm hai module bên ngoài: một BEV Perception Head để đọc cấu trúc không gian 3D và một Planning Expert để sinh quỹ đạo tương lai cho xe. Đây là bước đi đáng chú ý của Qwen sang Physical AI, nhưng chưa phải tuyên bố một hệ thống tự lái production-ready.
Qwen-Drive-1.0 cố hợp nhất perception, language và planning trong một VLM
Hệ thống xe tự hành truyền thống thường tách perception, prediction và planning thành nhiều thành phần. Camera và sensor được dùng để phát hiện vật thể, một module khác hiểu cấu trúc scene, rồi planner mới quyết định quỹ đạo. Mỗi tầng có representation và objective riêng.
Qwen-Drive thử một hướng khác: dùng shared representation từ một VLM multimodal làm nền chung. Backbone là Qwen3.5-4B, model vừa xử lý thông tin thị giác vừa giữ khả năng ngôn ngữ và instruction following.
Nhóm phát triển nhấn mạnh rằng backbone pretrained không bị sửa kiến trúc. Hai module chuyên dụng được gắn ngoài để khai thác representation đã có. Cách làm này giúp kiểm tra xem cùng một latent representation có thể phục vụ cả câu hỏi bằng ngôn ngữ, perception 3D và motion planning hay không.
BEV Perception Head biến representation của VLM thành cấu trúc 3D có thể kiểm tra
Module đầu tiên là BEV Perception Head. BEV, viết tắt của Bird’s-Eye View, biểu diễn môi trường từ góc nhìn trên cao và là một representation phổ biến trong autonomous driving vì nó giúp định vị xe, làn đường và vật thể trong không gian chung.
Qwen-Drive dùng BEV head cho ba nhóm tác vụ: 3D object detection, semantic occupancy prediction và BEV map segmentation. Nói đơn giản, model không chỉ “nhìn thấy ảnh” mà còn cố suy ra vật thể nằm ở đâu, vùng không gian nào đang bị chiếm và cấu trúc bản đồ xung quanh xe.
Điểm đáng chú ý là BEV head được mô tả như một probe 3D có thể kiểm tra. Điều này quan trọng trong nghiên cứu xe tự hành vì một câu trả lời ngôn ngữ nghe hợp lý chưa đủ để chứng minh model thực sự giữ được thông tin hình học cần cho điều khiển.
Planning Expert dùng flow matching để sinh quỹ đạo tương lai
Module thứ hai là Planning Expert. Module này nhận shared VLM representations rồi sinh future ego trajectories — quỹ đạo mà chính chiếc xe dự kiến sẽ đi trong các giây tiếp theo.
Qwen Team dùng flow matching cho phần sinh trajectory. Thay vì chỉ trả về một mô tả ngôn ngữ kiểu “rẽ trái” hoặc “giảm tốc”, Planning Expert phải tạo ra chuỗi waypoint có thể được đánh giá bằng metric planning.
Kiến trúc vẫn giữ LLM decoder gốc cho General VQA và Driving VQA. Vì vậy cùng một hệ thống có thể vừa trả lời câu hỏi về scene, vừa xuất representation 3D và vừa đưa ra quỹ đạo lái xe thông qua expert chuyên dụng.
Qwen-Drive không biến language model thành planner bằng prompt đơn thuần
Một điểm cần phân biệt là Qwen-Drive không chỉ prompt một VLM để model nói xem xe nên đi đâu. Planning được giao cho một module có objective và output space riêng, còn VLM giữ vai trò representation backbone và xử lý language.
Thiết kế này cho thấy xu hướng Physical AI có thể không đi theo hướng “một decoder làm tất cả”. Một backbone multimodal có thể chia sẻ hiểu biết về scene, sau đó các head hoặc expert chuyên biệt đảm nhiệm những đầu ra đòi hỏi hình học và điều khiển chính xác hơn.
Về mặt ý tưởng, Qwen-Drive gần với hướng xây representation thế giới hơn các chatbot thông thường. Bạn có thể đặt nó cạnh các nghiên cứu như Puffin-World, nơi physics, geometry và appearance được mô hình hóa để tăng khả năng hiểu không gian 3D.
Training được chia thành nhiều giai đoạn để giữ cả năng lực tổng quát và năng lực lái xe
Qwen-Drive dùng staged training thay vì fine-tune một lần trên một loại dữ liệu. Nhóm phát triển kết hợp driving-specific supervision với general vision-language data để model học năng lực chuyên ngành mà không đánh mất toàn bộ khả năng nhìn và làm theo instruction của Qwen3.5.
Pipeline dữ liệu phải chuẩn hóa nhiều loại annotation khác nhau. Repository chính thức mô tả ba việc quan trọng: ánh xạ perception labels vào một label space chung, re-annotate câu trả lời Driving VQA để tăng nhất quán về format và fact, và chuyển trajectory từ nhiều dataset thành một waypoint representation thống nhất.
Đây là phần ít hào nhoáng hơn benchmark nhưng rất quan trọng. Khi muốn một model học từ nhiều bộ dữ liệu xe tự hành, sự khác biệt về label, coordinate system và cách ghi trajectory có thể khiến việc “unified model” trở nên khó hơn bản thân kiến trúc.
Trên model card chính thức, Qwen-Drive-1.0-RL đạt 90,7 PDMS trên NAVSIM trong thiết lập pseudo-closed-loop. Bản SFT đạt 88,2. Nhóm cũng báo cáo best-of-6 ở mức 91,4.
Con số best-of-6 cần đọc cẩn thận: đây là thiết lập chọn phương án tốt nhất trong sáu trajectory và có tính chất upper-bound hơn là cách một xe thực tế tự chọn duy nhất một trajectory. Vì vậy 91,4 không nên được dùng như một score production trực tiếp.
Qwen cũng so sánh với nhiều phương pháp khác trên WOD-E2E, PAI-AV, NAVSIM và AlpaSim. Tuy nhiên các model không phải lúc nào cũng dùng cùng dữ liệu hoặc cùng setup. Các kết quả này là author-reported, phù hợp để hiểu xu hướng nhưng chưa thay thế đánh giá độc lập.
Reasoning bằng ngôn ngữ và trajectory vẫn chưa hoàn toàn đồng nhất
Một giới hạn mà chính nhóm nghiên cứu nêu ra là consistency giữa textual reasoning và trajectory. Một model có thể diễn giải đúng rằng cần nhường đường nhưng trajectory được sinh vẫn chưa phản ánh hoàn toàn reasoning đó, hoặc ngược lại.
Khoảng cách này là vấn đề cốt lõi khi đưa VLM vào autonomous driving. Với chatbot, một câu reasoning chưa hoàn hảo có thể chỉ làm câu trả lời kém thuyết phục; với planner, sự không nhất quán giữa mô tả và chuyển động có thể tác động trực tiếp tới safety.
Vì vậy Qwen-Drive-1.0 nên được xem là bước nghiên cứu ban đầu về vision-language foundation model cho driving, đúng với cách Qwen đặt tên bài công bố, chứ không phải bằng chứng rằng VLM 4B đã sẵn sàng thay stack tự lái hiện tại.
Weights và code mở giúp Qwen-Drive trở thành một nền tảng nghiên cứu đáng chú ý
Qwen đã công bố repository chính thức cùng model trên Hugging Face. Model card ghi Apache 2.0, tạo điều kiện cho researcher kiểm tra architecture, inference và tiếp tục benchmark trên các dataset khác.
Việc giữ backbone Qwen3.5-4B cũng khiến Qwen-Drive dễ nghiên cứu hơn những hệ thống proprietary quá lớn. Dù vậy, autonomous driving không chỉ là bài toán kích thước model; camera setup, calibration, data pipeline, simulation và evaluation loop vẫn quyết định phần lớn độ tin cậy.
Qwen-Drive khác gì với Qwen3.8-Max và các VLM đa dụng?
Qwen3.8-Max-0902 hướng tới coding, agent và multimodal general-purpose. Qwen-Drive lại là một nhánh chuyên cho autonomous driving, với output và supervision gắn trực tiếp vào perception 3D và motion planning.
Điều này cho thấy cùng một họ model có thể phân nhánh theo workload: một model generalist phục vụ reasoning và tool use, trong khi một foundation model chuyên ngành gắn thêm head/expert để làm việc với representation vật lý cụ thể.
Với người theo dõi Physical AI, Qwen-Drive đáng chú ý ở chỗ nó nối multimodal understanding với hành động trong không gian thật. Bài toán tiếp theo không chỉ là “model hiểu camera thấy gì”, mà là liệu representation chung đó có đủ ổn định để hỗ trợ quyết định chuyển động hay không.
Ý nghĩa lớn nhất của Qwen-Drive-1.0 là thử nghiệm một representation chung cho xe tự hành
Qwen-Drive-1.0 chưa xóa ranh giới giữa perception và planning, nhưng nó thử làm cho các thành phần này dùng chung một nền multimodal. BEV head giữ tính inspectable cho 3D, Planning Expert xử lý trajectory, còn VLM đảm nhiệm ngôn ngữ và representation.
Nếu hướng này tiếp tục tiến bộ, foundation model cho autonomous driving có thể đóng vai trò tương tự foundation model trong NLP: cung cấp một representation chung rồi các module chuyên dụng bám vào đó. Nhưng để đi từ benchmark tới đường thật, hệ thống vẫn cần validation, closed-loop testing và safety engineering ở cấp độ mà một model card không thể chứng minh.



