MutiModal_Dataset
updated
Updated • 8.03k
• 120
Updated • 14.9k
• 136
WildVision/wildvision-chat
Viewer
• Updated • 45.2k • 204
• 20
Viewer
• Updated • 12.4M • 4.04k
• 186
lmms-lab/LLaVA-Video-178K
Viewer
• Updated • 1.63M • 37.2k
• 202
Viewer
• Updated • 7.29M • 300
• 52
Viewer
• Updated • 1.66M • 26
VILA-U: a Unified Foundation Model Integrating Visual Understanding and
Generation
Paper
• 2409.04429
• Published
Viewer
• Updated • 235M • 6.98k
• 47
Viewer
• Updated • 9.81M • 627
• 54
JefferyZhan/Language-prompted-Localization-Dataset
Preview
• Updated • 69
• 4
Viewer
• Updated • 392 • 28
• 12
mlfoundations/MINT-1T-HTML
Viewer
• Updated • 623M • 816k
• 100
DINO-X: A Unified Vision Model for Open-World Object Detection and
Understanding
Paper
• 2411.14347
• Published • 18
Preview
• Updated • 191
• 52
Viewer
• Updated • 72.5k • 177
• 10
Viewer
• Updated • 10.9M • 83
• 9
Viewer
• Updated • 2.18M • 39
• 2
Viewer
• Updated • 110k • 306
• 4
Salesforce/blip3-grounding-50m
Viewer
• Updated • 52.4M • 356
• 31
Intelligent-Internet/II-Thought-RL-v0
Viewer
• Updated • 342k • 365
• 54
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and
Verifiable Mathematical Dataset for Advancing Reasoning
Paper
• 2504.11456
• Published • 12
Viewer
• Updated • 217M • 103k
• 134