OpenVid-1M
Dataset vidéo text-to-video haute qualité et grande échelle, conçu pour la recherche et l’entraînement de modèles génératifs vidéo. OpenVid-1M propose des vidéos d’au moins 512×512 pixels, avec un sous-ensemble OpenVidHD offrant des vidéos en 1080p. Le dataset comprend des paires texte-vidéo soigneusement annotées, facilitant l’entraînement direct ou le fine-tuning sur la qualité vidéo. Le téléchargement nécessite un espace important et l’utilisation de scripts pour gérer les archives volumineuses.
Plus d’un million de vidéos text-to-video au format vidéo HD (≥512×512), incluant un sous-ensemble OpenVidHD de 433K vidéos en 1080p. Fichiers ZIP volumineux à décompresser, CSV pour paires texte-vidéo. Taille totale environ plusieurs téraoctets (OpenVidHD ~4.5 To).
CC-BY-4.0 (les vidéos proviennent de sources publiques avec leurs licences respectives, à respecter lors de l’utilisation)
Description
OpenVid-1M est un dataset text-to-video de haute qualité contenant plus d’un million de vidéos avec une résolution minimale de 512×512 pixels. Un sous-ensemble nommé OpenVidHD rassemble 433 000 vidéos en résolution 1080p pour des tâches nécessitant une meilleure définition visuelle. Les données sont accompagnées de fichiers CSV qui associent chaque vidéo à son texte descriptif, facilitant l’apprentissage supervisé et la génération vidéo conditionnelle.
À quoi sert ce dataset ?
- Entraîner des modèles de génération vidéo conditionnée sur texte
- Améliorer la qualité et la résolution des vidéos générées via du fine-tuning
- Rechercher sur des architectures vidéo avec données réalistes et haute résolution
Peut-on l’enrichir ou l’améliorer ?
Oui, le dataset peut être complété par d’autres collections vidéo, ou amélioré par une annotation fine des métadonnées, descriptions ou contextes. Des scripts sont fournis pour faciliter la manipulation et la recomposition des fichiers volumineux.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en vision par ordinateur
- Développeurs de modèles génératifs vidéo
- Laboratoires de recherche en IA multimédia
🔧 Outils compatibles
- PyTorch
- TensorFlow
- FFmpeg
- outils d’annotation vidéo
💡 Astuce
Utiliser les scripts fournis pour gérer efficacement les fichiers volumineux et optimiser le prétraitement vidéo.
Questions fréquemment posées
Quelle est la taille approximative du dataset OpenVid-1M ?
Le dataset complet est très volumineux, comptant plus d’un million de vidéos, avec le sous-ensemble OpenVidHD seul occupant environ 4,5 To d’espace disque.
Quelles sont les résolutions minimales des vidéos contenues dans OpenVid-1M ?
Toutes les vidéos ont une résolution minimale de 512×512 pixels, tandis que le sous-ensemble OpenVidHD propose des vidéos en haute définition 1080p.
Puis-je utiliser ce dataset à des fins commerciales ?
Oui, la licence CC-BY-4.0 permet une utilisation commerciale sous condition de respecter la licence et les droits des sources vidéo originales incluses dans le dataset.




