MutiModal_Dataset
updated
Updated • 1.89k
• 121
Updated • 2.91k
• 136
WildVision/wildvision-chat
Viewer
• Updated • 45.2k • 39
• 20
Viewer
• Updated • 12.4M • 2.69k
• 178
lmms-lab/LLaVA-Video-178K
Viewer
• Updated • 1.63M • 38.7k
• 200
Viewer
• Updated • 7.29M • 985
• 52
Viewer
• Updated • 1.66M • 23
VILA-U: a Unified Foundation Model Integrating Visual Understanding and
Generation
Paper
• 2409.04429
• Published
Viewer
• Updated • 235M • 1.27k
• 46
Viewer
• Updated • 9.81M • 357
• 54
JefferyZhan/Language-prompted-Localization-Dataset
Preview
• Updated • 72
• 4
Viewer
• Updated • 392 • 47
• 12
mlfoundations/MINT-1T-HTML
Viewer
• Updated • 623M • 278k
• 97
DINO-X: A Unified Vision Model for Open-World Object Detection and
Understanding
Paper
• 2411.14347
• Published • 17
Preview
• Updated • 51
• 52
Viewer
• Updated • 72.5k • 75
• 10
Viewer
• Updated • 10.9M • 56
• 9
Viewer
• Updated • 2.18M • 13
• 2
Viewer
• Updated • 110k • 71
• 4
Salesforce/blip3-grounding-50m
Viewer
• Updated • 52.4M • 517
• 30
Intelligent-Internet/II-Thought-RL-v0
Viewer
• Updated • 342k • 269
• 54
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and
Verifiable Mathematical Dataset for Advancing Reasoning
Paper
• 2504.11456
• Published • 12
Viewer
• Updated • 217M • 46.9k
• 129