Coyo 700M
Dataset massif de paires image-texte extraites de documents HTML, destiné à entraîner des modèles fondation multimodaux vision-langage.
Environ 747 millions de paires image+texte, 135 Go en fichiers Parquet
CC-BY 4.0
Description
Coyo 700M est un jeu de données de très grande ampleur comprenant environ 747 millions de paires images et textes associées extraites de documents HTML. Chaque paire est accompagnée de métadonnées permettant un usage varié dans l'entraînement de modèles IA multimodaux.
À quoi sert ce dataset ?
- Entraîner des modèles multimodaux vision-langage à grande échelle
- Améliorer les capacités de compréhension visuelle et textuelle des LLMs multimodaux
- Compléter d’autres datasets pour la formation de modèles foundation
Peut-on l’enrichir ou l’améliorer ?
Le dataset peut être affiné par filtrage, nettoyage, ou réannotation pour améliorer la qualité des paires. L’intégration de métadonnées supplémentaires ou la traduction des textes peuvent aussi enrichir le corpus.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs IA multimodale
- Développeurs foundation models
- Data scientists avancés
🔧 Outils compatibles
- Apache Spark
- Hugging Face Datasets
- TensorFlow
- PyTorch
- Dask
💡 Astuce
Priorisez un filtrage avancé pour améliorer la qualité du dataset avant entraînement.
Questions fréquemment posées
Quelle est la taille exacte du dataset Coyo 700M ?
Le dataset contient environ 747 millions de paires image-texte, occupant environ 135 Go au format Parquet.
Puis-je utiliser ce dataset pour un usage commercial ?
Oui, la licence CC-BY 4.0 permet un usage commercial sous condition de citer la source.
Ce dataset convient-il aux débutants en apprentissage automatique ?
Non, la taille et la complexité du dataset nécessitent des ressources et compétences avancées.




