Published May 27, 2026
| Version v1
Dataset
Open
MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning
Authors/Creators
Description
A multimodal dataset comprising of:
- 141,364 images
- 981,947 image-level captions
- 1,742,264 region-level captions
- 1,391,779 bounding box annotations
Files
MIRCaps.zip
Additional details
Dates
- Created
-
2026-05-27