Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models Paper • 2608.27550 • Published 5 days ago • 61
Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models Paper • 2608.27550 • Published 5 days ago • 61
ReWorld: An Interactive World Model with Long-Horizon Memory Paper • 2608.23565 • Published 8 days ago • 24
Perflow-Shuai/Wan2.2-5B-NonAR-DMD-4Step-LoRA-r64-iter1600-SLT-AR-30s-Local32-Sink8-run2-iter2200 Text-to-Video • Updated 7 days ago
Perflow-Shuai/Wan2.2-5B-NonAR-DMD-4Step-LoRA-r64-iter1600-SLT-AR-30s-Local32-Sink8-run2-iter2200 Text-to-Video • Updated 7 days ago
Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing Paper • 2607.19064 • Published Jul 21 • 77
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model Paper • 2607.24904 • Published Jul 27 • 37
XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment Paper • 2608.09892 • Published 21 days ago
Perflow-Shuai/Wan2.2-5B-NonAR-DMD-4Step-LoRA-r64-iter1600-SLT-AR-30s-Local32-Sink8-iter2450 Text-to-Video • Updated 8 days ago
Perflow-Shuai/Wan2.2-5B-NonAR-DMD-4Step-LoRA-r64-iter1600-SLT-AR-30s-Local32-Sink8-iter2450 Text-to-Video • Updated 8 days ago
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion Paper • 2608.03974 • Published 28 days ago • 104
LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation Paper • 2605.18739 • Published May 18 • 117
Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation Paper • 2605.04128 • Published May 5 • 19
LongLive: Real-time Interactive Long Video Generation Paper • 2509.22622 • Published Sep 26, 2025 • 190