dataset link on Hugging dataset
https://huggingface.co/datasets/risashinoda/BioVITA
Arxiv link
https://arxiv.org/abs/2603.23883
Description of the dataset
BioVITA is a multimodal biological dataset containing aligned audio, image, and text data.
It supports several cross-modal retrieval settings, including:
audio → image
image → audio
audio → text
text → audio
image → text
text → image
In particular, it provides useful coverage for audio-image retrieval, which is currently relatively underrepresented in multimodal embedding benchmarks.
dataset link on Hugging dataset
https://huggingface.co/datasets/risashinoda/BioVITA
Arxiv link
https://arxiv.org/abs/2603.23883
Description of the dataset
BioVITA is a multimodal biological dataset containing aligned audio, image, and text data.
It supports several cross-modal retrieval settings, including:
audio → image
image → audio
audio → text
text → audio
image → text
text → image
In particular, it provides useful coverage for audio-image retrieval, which is currently relatively underrepresented in multimodal embedding benchmarks.