Skip to content

Add dataset: BioVITA #5143

Description

@myang333

dataset link on Hugging dataset

https://huggingface.co/datasets/risashinoda/BioVITA

Arxiv link

https://arxiv.org/abs/2603.23883

Description of the dataset

BioVITA is a multimodal biological dataset containing aligned audio, image, and text data.

It supports several cross-modal retrieval settings, including:

audio → image
image → audio
audio → text
text → audio
image → text
text → image

In particular, it provides useful coverage for audio-image retrieval, which is currently relatively underrepresented in multimodal embedding benchmarks.

Metadata

Metadata

Assignees

No one assigned

    Labels

    new datasetIssues related to adding a new task or dataset

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions