Resume Screening Dataset
Conjunto de datos anotados para entrenar los sistemas automáticos de selección de CV, basados en etiquetas de relevancia.
Descripción
Resume Screening Dataset es un conjunto de datos estructurados que contiene más de 10 000 ejemplos de currículums anotados según su relevancia para un puesto. Está destinado a la formación de modelos de procesamiento del lenguaje natural capaces de automatizar la clasificación de las solicitudes según su idoneidad para una oferta de trabajo determinada.
¿Para qué sirve este conjunto de datos?
- Desarrollar sistemas de selección automatizados para reclutadores
- Entrene modelos de clasificación binaria aplicados a las aplicaciones
- Probar los enfoques de PNL para la coincidencia de perfiles/ofertas
¿Se puede enriquecer o mejorar?
Sí. Es posible añadir ofertas de trabajo reales, metadatos (sector, puesto, ubicación) o diversificar el lenguaje o la estructura de los currículums. Una extensión multilingüe o un enriquecimiento mediante el análisis sintáctico aumentaría la solidez del conjunto de datos.
🔎 En resumen
🧠 Recomendado para
- Desarrolladores de IA de recursos humanos
- Investigadores de PNL aplicados a la contratación
- Estudiantes de clasificación de PNL
🔧 Herramientas compatibles
- Scikit-learn
- Hugging Face Transformers
- Pandas
- FastText
💡 Consejo
Complete el conjunto de datos con ofertas de trabajo reales para modelar la correspondencia entre el currículum y la oferta de una manera más refinada.
Preguntas frecuentes
¿Se puede usar este conjunto de datos en una solicitud de contratación comercial?
Sí, la licencia MIT permite el uso comercial gratuito con atribución.
¿Los currículums son reales o simulados?
Los datos son anónimos y no permiten identificar a personas reales.
¿El conjunto de datos está adaptado a otros idiomas además del inglés?
No, la mayoría de los ejemplos están en inglés. La adaptación multilingüe requeriría una traducción y un reajuste léxico.




