Text2Video – Préférences humaines Pika 2.2
Dataset massif d’évaluations humaines de vidéos générées à partir de descriptions textuelles, utile pour entraîner des systèmes de préférence ou affiner des modèles vidéo.
756 000 réponses (JSON), vidéos en GIF basse résolution et liens vers vidéos HD
Apache 2.0
Description
Text-2-Video Human Preferences – Pika 2.2 est un jeu de données contenant environ 756 000 réponses humaines recueillies en 24 heures auprès de 29 000 annotateurs. Ces réponses comparent des vidéos générées par le modèle Pika 2.2 à partir de descriptions textuelles, dans un format de paire (vidéo1 vs vidéo2), permettant de mesurer la qualité, la fidélité et l’alignement avec le prompt.
À quoi sert ce dataset ?
- Évaluer objectivement des modèles de génération vidéo à partir de texte
- Entraîner des modèles de préférence ou d’alignement (ex. reward models en RLHF)
- Analyser les limites actuelles des modèles de type diffusion ou transformer en vidéo
Peut-on l’enrichir ou l’améliorer ?
Oui. On peut intégrer davantage de métadonnées (durée, catégorie de contenu, qualité perçue) ou croiser les réponses avec des métriques automatiques. Il est également envisageable d’ajouter des couches de langue naturelle (justifications, commentaires) ou d’élargir le benchmark à d’autres modèles.
🔎 En résumé
🧠 Recommandé pour
- Développeurs RLHF
- Chercheurs en génération vidéo
- Évaluation de modèles multimodaux
🔧 Outils compatibles
- PyTorch
- Hugging Face Datasets
- Weights & Biases
- PEFT
- VLLM
💡 Astuce
Utilisez les réponses pondérées ("weighted_results") pour entraîner un modèle de scoring personnalisé.
Questions fréquemment posées
Ce dataset permet-il d’évaluer d’autres modèles que Pika ?
Oui, les vidéos peuvent être remplacées par celles d'autres modèles pour réutiliser la structure d'évaluation.
Est-ce que les vidéos sont téléchargeables ?
Les GIFs allégés sont inclus, et les liens vers les vidéos HD sont fournis séparément dans le dataset.
Peut-on utiliser ce dataset pour entraîner un modèle de préférence ou de reward ?
Absolument, c’est l’un de ses usages principaux, notamment dans les pipelines RLHF ou d’évaluation humaine assistée.




