En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Coyo 700M
Multimodal

Coyo 700M

Dataset massif de paires image-texte extraites de documents HTML, destiné à entraîner des modèles fondation multimodaux vision-langage.

Télécharger le dataset
Taille

Environ 747 millions de paires image+texte, 135 Go en fichiers Parquet

Licence

CC-BY 4.0

Description

Coyo 700M est un jeu de données de très grande ampleur comprenant environ 747 millions de paires images et textes associées extraites de documents HTML. Chaque paire est accompagnée de métadonnées permettant un usage varié dans l'entraînement de modèles IA multimodaux.

À quoi sert ce dataset ?

  • Entraîner des modèles multimodaux vision-langage à grande échelle
  • Améliorer les capacités de compréhension visuelle et textuelle des LLMs multimodaux
  • Compléter d’autres datasets pour la formation de modèles foundation

Peut-on l’enrichir ou l’améliorer ?

Le dataset peut être affiné par filtrage, nettoyage, ou réannotation pour améliorer la qualité des paires. L’intégration de métadonnées supplémentaires ou la traduction des textes peuvent aussi enrichir le corpus.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐✩✩✩ (Requiert un traitement massif et ressources importantes)
🧼 Besoin de nettoyage⭐⭐✩✩✩ (Important, filtrage nécessaire pour qualité optimale)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Métadonnées variées, mais annotations basiques)
📜 Licence commerciale✅ CC-BY 4.0 – libre usage commercial
👨‍💻 Idéal pour les débutants⚠️ Non, volume et traitement complexes
🔁 Réutilisable en fine-tuning✅ Excellente base pour modèles multimodaux
🌍 Diversité culturelle🌐 Large diversité par source Web mondiale

🧠 Recommandé pour

  • Chercheurs IA multimodale
  • Développeurs foundation models
  • Data scientists avancés

🔧 Outils compatibles

  • Apache Spark
  • Hugging Face Datasets
  • TensorFlow
  • PyTorch
  • Dask

💡 Astuce

Priorisez un filtrage avancé pour améliorer la qualité du dataset avant entraînement.

Questions fréquemment posées

Quelle est la taille exacte du dataset Coyo 700M ?

Le dataset contient environ 747 millions de paires image-texte, occupant environ 135 Go au format Parquet.

Puis-je utiliser ce dataset pour un usage commercial ?

Oui, la licence CC-BY 4.0 permet un usage commercial sous condition de citer la source.

Ce dataset convient-il aux débutants en apprentissage automatique ?

Non, la taille et la complexité du dataset nécessitent des ressources et compétences avancées.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.