MutiModal_Dataset
updated
Updated • 282
• 121
Updated • 6.06k
• 136
WildVision/wildvision-chat
Viewer
• Updated • 45.2k • 37
• 20
Viewer
• Updated • 12.4M • 2.86k
• 180
lmms-lab/LLaVA-Video-178K
Viewer
• Updated • 1.63M • 47.4k
• 201
Viewer
• Updated • 7.29M • 2.39k
• 52
Viewer
• Updated • 1.66M • 36
VILA-U: a Unified Foundation Model Integrating Visual Understanding and
Generation
Paper
• 2409.04429
• Published
Viewer
• Updated • 235M • 1.34k
• 46
Viewer
• Updated • 9.81M • 383
• 54
JefferyZhan/Language-prompted-Localization-Dataset
Preview
• Updated • 23
• 4
Viewer
• Updated • 392 • 41
• 12
mlfoundations/MINT-1T-HTML
Viewer
• Updated • 623M • 202k
• 97
DINO-X: A Unified Vision Model for Open-World Object Detection and
Understanding
Paper
• 2411.14347
• Published • 17
Preview
• Updated • 45
• 52
Viewer
• Updated • 72.5k • 89
• 10
Viewer
• Updated • 10.9M • 142
• 9
Viewer
• Updated • 2.18M • 39
• 2
Viewer
• Updated • 110k • 89
• 4
Salesforce/blip3-grounding-50m
Viewer
• Updated • 52.4M • 764
• 30
Intelligent-Internet/II-Thought-RL-v0
Viewer
• Updated • 342k • 268
• 54
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and
Verifiable Mathematical Dataset for Advancing Reasoning
Paper
• 2504.11456
• Published • 12
Viewer
• Updated • 217M • 58.2k
• 130