XPACE là gì? World model vừa dự đoán hành động vừa mô phỏng tương lai cho robot
XPACE là unified embodied world model vừa dự đoán hành động và future video, vừa mô phỏng hậu quả của action để robot học từ dữ liệu người, robot và video không gắn nhãn hành động.

XPACE là một unified embodied world model cho robot: cùng một hệ thống vừa dự đoán hành động có thể thực thi và future video, vừa có thể đóng vai trò world simulator để mô phỏng hậu quả hình ảnh của một action được chỉ định.
Theo paper XPACE: Joint World and Action Modeling from Heterogeneous Experience công bố ngày 15/09/2026, nhóm nghiên cứu xây XPACE để kết nối ba nguồn kinh nghiệm thường bị tách rời: video không có action label, demonstration của con người và demonstration của robot.
Ý tưởng trung tâm là: nếu robot có thể vừa dự đoán “thế giới sẽ trông như thế nào tiếp theo” vừa dự đoán “nên hành động gì”, video prediction không chỉ là nhiệm vụ phụ. Nó có thể trở thành cầu nối giữa học dynamics, học policy và tự sinh thêm dữ liệu recovery cho chính policy.
XPACE là gì?
XPACE là một embodied world model được thiết kế để phục vụ hai vai trò trong cùng kiến trúc. Ở vai trò world action model, nó jointly predict future video và executable robot action. Ở vai trò world simulator, nó nhận action được chỉ định rồi dự đoán hậu quả hình ảnh có thể xảy ra.
Cách ghép hai vai trò này nhằm giải quyết một bài toán thực tế của robotics: dữ liệu robot có action label thường đắt và hạn chế, trong khi video của con người hoặc video quan sát thế giới phong phú hơn rất nhiều. XPACE cố dùng video prediction làm representation chung để tận dụng cả hai.
World action model khác world simulator ở điểm nào?
Hai chế độ trả lời hai câu hỏi khác nhau. World action model hỏi: từ quan sát hiện tại và context, robot nên thực hiện action nào và thế giới có thể thay đổi ra sao? World simulator hỏi: nếu áp một action cụ thể, hậu quả quan sát được trong tương lai có thể là gì?
Khi cùng một backbone học cả hai chiều này, policy và simulator có thể chia sẻ representation về dynamics. Đây là điểm khiến XPACE khác một video generator chỉ dự đoán frame tiếp theo hoặc một policy chỉ xuất joint command mà không mô hình hóa future observation.
XPACE học từ dữ liệu hỗn hợp như thế nào?
Paper chia nguồn kinh nghiệm thành các nhóm có mức supervision khác nhau và dùng chúng cho mục tiêu khác nhau:
- Video không có action label: học visual dynamics, tức cách cảnh và vật thể thay đổi theo thời gian.
- Human demonstrations có action label hoặc tín hiệu tương ứng: bổ sung kinh nghiệm hành vi từ con người.
- Robot demonstrations: cung cấp action có thể thực thi trên embodiment thật và giúp policy bám vào không gian điều khiển của robot.
Thay vì huấn luyện ba model riêng, XPACE dùng shared video backbone cho policy và simulator. Nhờ đó, kiến thức về visual dynamics học từ nguồn dữ liệu rộng có thể hỗ trợ phần action modeling thay vì bị khóa trong một model video độc lập.
Vì sao XPACE dùng coarse-to-fine training curriculum?
Dữ liệu con người và video internet có quy mô lớn nhưng không khớp hoàn toàn với action space của robot. Nếu tối ưu trực tiếp cho robot control từ đầu, hệ thống có thể không tận dụng được kinh nghiệm thị giác rộng; nếu chỉ học video, model lại thiếu grounding để điều khiển embodiment.
XPACE giải quyết bằng curriculum coarse-to-fine: giai đoạn đầu nhấn mạnh học dynamics và kinh nghiệm rộng, sau đó tăng dần trọng số cho robot control trong khi vẫn giữ tín hiệu từ human experience.
Theo mô tả của paper, mục tiêu là để policy học được behavior vượt ra ngoài phạm vi hẹp của robot demonstration, nhưng cuối quá trình vẫn phải tạo action phù hợp với robot thật.
Phần thú vị nhất: simulator tự tạo deviation-recovery trajectory
Robot ngoài đời hiếm khi luôn ở đúng trạng thái “đẹp” như demonstration. Một sai lệch nhỏ có thể đẩy state sang vùng mà policy chưa từng thấy, khiến lỗi nối tiếp lỗi. Vì vậy dữ liệu về cách phục hồi sau sai lệch rất quan trọng.
XPACE dùng chính world simulator để tạo thêm supervision cho recovery. Nhóm tác giả thích nghi simulator với context do nó sinh ra, tạo các trajectory lệch khỏi expert demonstration rồi mô phỏng đường quay lại vùng hợp lệ. Các example recovery sau đó được lọc và dùng để fine-tune policy.
Về mặt ý tưởng, đây là vòng khép kín: policy cung cấp bài toán control, simulator dự đoán hậu quả action, rồi simulator lại sinh tình huống recovery để policy học cách xử lý những state khó xuất hiện trong demonstration gốc.
XPACE được thử nghiệm trên robot nào?
Nhóm nghiên cứu thử XPACE trên XPENG IRON humanoid robot. Paper báo cáo rằng training với heterogeneous experience giúp tăng robustness và hỗ trợ chuyển kỹ năng quan sát từ con người sang một số task không xuất hiện trong robot demonstrations.
Nhóm cũng báo cáo rằng recovery data do simulator tự tạo tiếp tục cải thiện tỷ lệ hoàn thành task trong thí nghiệm real-world của họ. Đây là kết quả do nhóm tác giả công bố; không nên suy rộng thành khả năng production hoặc độ an toàn của mọi deployment trên humanoid robot.
XPACE khác Puffin-World như thế nào?
Cả XPACE và Puffin-World đều thuộc làn sóng world model, nhưng chúng sở hữu hai intent khác nhau. Puffin-World tập trung hợp nhất physics, geometry và appearance thành world state 3D; XPACE tập trung joint world-action modeling cho robot control.
Nói ngắn gọn, Puffin-World hỏi nhiều hơn về “thế giới đang có cấu trúc như thế nào”, còn XPACE nhấn mạnh “robot nên làm gì và action đó sẽ làm thế giới thay đổi ra sao”. Vì vậy hai model có thể cùng dùng video prediction nhưng phục vụ mục tiêu khác nhau.
XPACE khác Vision-Language-Action model thông thường ở đâu?
Một Vision-Language-Action model thường nhận quan sát và instruction rồi xuất action. XPACE bổ sung một năng lực rõ ràng hơn về future-world prediction: policy không chỉ sinh action mà còn chia sẻ backbone với simulator có thể dự đoán visual consequence của action.
Điểm này gần với hướng Physical AI đang chuyển từ “policy phản xạ” sang hệ thống có internal model về dynamics. Với xe tự hành, Bot.io.vn đã phân tích một hướng khác qua Qwen-Drive-1.0, nơi perception, VQA và planning được tích hợp trong một VLM cho driving. XPACE đặt trọng tâm vào embodied world simulation cho humanoid robotics.
Tại sao video prediction có thể giúp robot control?
Action của robot chỉ có ý nghĩa trong bối cảnh dynamics của thế giới. Nếu model hiểu rằng đẩy, nhấc, kéo hay xoay một vật sẽ làm visual state thay đổi theo cách nào, representation đó có thể hỗ trợ việc chọn action phù hợp hơn.
Video prediction còn tạo một kênh học từ dữ liệu không có robot action label. Đây là điểm quan trọng vì lượng video quan sát con người thực hiện task lớn hơn nhiều so với số giờ demonstration thu trực tiếp trên một humanoid robot cụ thể.
Tuy nhiên, nhìn đúng future frame không đồng nghĩa action chắc chắn khả thi về torque, contact, latency hoặc safety constraint. World model vẫn phải được grounding bằng robot demonstration và evaluation trên embodiment thật.
Những giới hạn cần biết khi đọc XPACE
Thứ nhất, paper tập trung vào một thiết lập nghiên cứu và một platform humanoid cụ thể. Khả năng chuyển sang robot có morphology, sensor stack hoặc control frequency khác chưa thể suy ra chỉ từ kết quả hiện tại.
Thứ hai, world simulator dự đoán hậu quả theo representation hình ảnh. Một simulator hữu ích cho policy không đồng nghĩa nó là physical simulator chính xác ở mọi cấp độ; sai số tích lũy qua nhiều bước vẫn là vấn đề quan trọng của model-based control.
Thứ ba, recovery trajectory do model tự sinh có thể mang bias của chính simulator. Việc lọc example giúp giảm rủi ro, nhưng production system vẫn cần kiểm thử với state ngoài phân phối, failure mode thực và constraint an toàn riêng.
XPACE cho thấy hướng phát triển nào của Physical AI?
XPACE cho thấy một hướng đáng chú ý: thay vì huấn luyện policy và world model như hai khối độc lập, có thể dùng future video làm không gian chung để liên kết experience, action learning và simulation.
Giá trị lớn nhất của hướng này nằm ở khả năng tận dụng dữ liệu heterogeneous. Video không action label giúp học dynamics; human demonstration mở rộng behavior; robot demonstration grounding action; simulator lại sinh recovery data để cải thiện policy.
XPACE hiện nên được xem là một research system chứng minh ý tưởng joint world-action modeling trên humanoid robot. Việc nó trở thành nền tảng chung cho robot control còn phụ thuộc vào khả năng tái lập kết quả, scale dữ liệu, chi phí inference và độ tin cậy khi world model gặp state chưa từng thấy.



