RONEC
RONEC es un conjunto de datos en francés dedicado al reconocimiento de entidades nombradas (NER) con 15 clases de anotación, que abarca más de 80 000 entidades distintas en más de 12 000 frases.
Aproximadamente 12.330 frases, 0,5 millones de fichas, formato JSON/Parquet, 2,94 MB
MIT
Descripción
El conjunto de datos RONEC contiene 12.330 oraciones anotadas en francés con 15 clases de entidades nombradas. Cuenta con más de 80 000 entidades distintas, lo que lo convierte en un recurso valioso para la formación de modelos NER especializados en el idioma francés.
¿Para qué sirve este conjunto de datos?
- Entrene modelos de reconocimiento de entidades nombradas (NER) en francés
- Mejorar la extracción de información de los textos francófonos
- Pruebe la precisión de los modelos NER en datos anotados manualmente
¿Se puede enriquecer o mejorar?
Sí, el conjunto de datos se puede complementar con anotaciones adicionales, incluida la adición de clases específicas o la corrección de las anotaciones existentes. También es posible ampliar el corpus para incluir más campos o contextos.
🔎 En resumen
🧠 Recomendado para
- Investigadores franceses de PNL
- Desarrolladores de IA
- Estudiantes en procesamiento automático del lenguaje
🔧 Herramientas compatibles
- SpaCy
- Hugging Face Transformers
- Flair
- Cuadernos Jupyter
💡 Consejo
Para obtener mejores resultados, combine este conjunto de datos con otros recursos NER de habla francesa.
Preguntas frecuentes
¿Cuáles son las principales clases de entidades anotadas en RONEC?
El conjunto de datos contiene 15 clases, que incluyen personas, organizaciones, lugares, fechas y otras entidades específicas.
¿El conjunto de datos es adecuado para uso comercial?
Sí, la licencia MIT permite un uso comercial sin restricciones.
¿Qué formato de archivo se proporciona para este conjunto de datos?
Los datos están disponibles en formato JSON y Parquet, lo que facilita su integración en varias canalizaciones de PNL.




