Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories Paper • 2607.15330 • Published 6 days ago • 59
FlowWAM: Optical Flow as a Unified Action Representation for World Action Models Paper • 2607.13017 • Published 8 days ago
RotVLA: Rotational Latent Action for Vision-Language-Action Model Paper • 2605.13403 • Published May 13
SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models Paper • 2606.00664 • Published May 30 • 1
Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model Paper • 2604.03181 • Published Apr 3
Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising Paper • 2604.26694 • Published Apr 29 • 6
BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks Paper • 2602.03793 • Published Feb 3
GR-MG: Leveraging Partially Annotated Data via Multi-Modal Goal-Conditioned Policy Paper • 2408.14368 • Published Dec 23, 2024
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models Paper • 2602.18020 • Published Feb 20
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories Paper • 2607.15330 • Published 6 days ago • 59
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model Paper • 2607.11643 • Published 9 days ago • 43
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs Paper • 2510.24514 • Published Oct 28, 2025 • 22
BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models Paper • 2506.07961 • Published Jun 9, 2025 • 12
BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models Paper • 2506.07961 • Published Jun 9, 2025 • 12 • 2
Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action Models Paper • 2412.14058 • Published Dec 18, 2024 • 1
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment Paper • 2502.10391 • Published Feb 14, 2025 • 34
BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models Paper • 2506.07961 • Published Jun 9, 2025 • 12