RONEC
RONEC est un dataset en français dédié à la reconnaissance d’entités nommées (NER) avec 15 classes d’annotations, couvrant plus de 80 000 entités distinctes sur plus de 12 000 phrases.
Environ 12 330 phrases, 0.5 million tokens, format JSON / Parquet, 2.94 Mo
MIT
Description
Le dataset RONEC contient 12 330 phrases annotées en français avec 15 classes d’entités nommées. Il totalise plus de 80 000 entités distinctes, ce qui en fait une ressource précieuse pour entraîner des modèles NER spécialisés sur la langue française.
À quoi sert ce dataset ?
- Entraîner des modèles de reconnaissance d’entités nommées (NER) en français
- Améliorer l’extraction d’informations dans des textes francophones
- Tester la précision des modèles NER sur des données annotées manuellement
Peut-on l’enrichir ou l’améliorer ?
Oui, le dataset peut être complété par des annotations supplémentaires, notamment en ajoutant des classes spécifiques ou en corrigeant les annotations existantes. Il est aussi possible d’élargir le corpus pour inclure plus de domaines ou contextes.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP français
- Développeurs IA
- Étudiants en traitement automatique des langues
🔧 Outils compatibles
- SpaCy
- Hugging Face Transformers
- Flair
- Jupyter notebooks
💡 Astuce
Pour de meilleurs résultats, combinez ce dataset avec d’autres ressources NER francophones variées.
Questions fréquemment posées
Quelles sont les principales classes d’entités annotées dans RONEC ?
Le dataset contient 15 classes, incluant notamment personnes, organisations, lieux, dates, et autres entités spécifiques.
Le dataset est-il adapté pour un usage commercial ?
Oui, la licence MIT permet un usage commercial sans restriction.
Quel format de fichiers est fourni pour ce dataset ?
Les données sont disponibles en JSON et format Parquet, facilitant leur intégration dans différents pipelines NLP.




