En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Texte

RONEC

RONEC est un dataset en français dédié à la reconnaissance d’entités nommées (NER) avec 15 classes d’annotations, couvrant plus de 80 000 entités distinctes sur plus de 12 000 phrases.

Télécharger le dataset
Taille

Environ 12 330 phrases, 0.5 million tokens, format JSON / Parquet, 2.94 Mo

Licence

MIT

Description

Le dataset RONEC contient 12 330 phrases annotées en français avec 15 classes d’entités nommées. Il totalise plus de 80 000 entités distinctes, ce qui en fait une ressource précieuse pour entraîner des modèles NER spécialisés sur la langue française.

À quoi sert ce dataset ?

  • Entraîner des modèles de reconnaissance d’entités nommées (NER) en français
  • Améliorer l’extraction d’informations dans des textes francophones
  • Tester la précision des modèles NER sur des données annotées manuellement

Peut-on l’enrichir ou l’améliorer ?

Oui, le dataset peut être complété par des annotations supplémentaires, notamment en ajoutant des classes spécifiques ou en corrigeant les annotations existantes. Il est aussi possible d’élargir le corpus pour inclure plus de domaines ou contextes.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Format standard, facile à manipuler)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible, annotations bien structurées)
🏷️ Richesse des annotations⭐⭐⭐⭐⭐ (Très bonne, 15 classes annotées précisément)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants🌟 Oui, adapté à l’apprentissage du NER en français
🔁 Réutilisable en fine-tuning🎯 Parfait pour fine-tuning de modèles NER
🌍 Diversité culturelle⚡ Corpus francophone, bonne diversité linguistique

🧠 Recommandé pour

  • Chercheurs en NLP français
  • Développeurs IA
  • Étudiants en traitement automatique des langues

🔧 Outils compatibles

  • SpaCy
  • Hugging Face Transformers
  • Flair
  • Jupyter notebooks

💡 Astuce

Pour de meilleurs résultats, combinez ce dataset avec d’autres ressources NER francophones variées.

Questions fréquemment posées

Quelles sont les principales classes d’entités annotées dans RONEC ?

Le dataset contient 15 classes, incluant notamment personnes, organisations, lieux, dates, et autres entités spécifiques.

Le dataset est-il adapté pour un usage commercial ?

Oui, la licence MIT permet un usage commercial sans restriction.

Quel format de fichiers est fourni pour ce dataset ?

Les données sont disponibles en JSON et format Parquet, facilitant leur intégration dans différents pipelines NLP.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.