Published May 27, 2026 | Version v1

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

Authors/Creators

Description

A multimodal dataset comprising of:

  • 141,364 images
  • 981,947 image-level captions
  • 1,742,264 region-level captions
  • 1,391,779 bounding box annotations

 

Files

MIRCaps.zip

Files (13.3 GB)

Name Size
md5:b01f93a004be85aba600357282b53891
13.3 GB Preview Download
md5:fa6566b54ad2d1fa729850189fef46b9
7.0 kB Preview Download

Additional details

Dates

Created
2026-05-27