Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Resume Screening Dataset
Texto

Resume Screening Dataset

Conjunto de datos anotados para entrenar los sistemas automáticos de selección de CV, basados en etiquetas de relevancia.

Obtén el dataset
Tamaño

10.174 líneas, CSV y parquet (34 MB aproximadamente)

Licencia

MIT

Descripción

Resume Screening Dataset es un conjunto de datos estructurados que contiene más de 10 000 ejemplos de currículums anotados según su relevancia para un puesto. Está destinado a la formación de modelos de procesamiento del lenguaje natural capaces de automatizar la clasificación de las solicitudes según su idoneidad para una oferta de trabajo determinada.

¿Para qué sirve este conjunto de datos?

  • Desarrollar sistemas de selección automatizados para reclutadores
  • Entrene modelos de clasificación binaria aplicados a las aplicaciones
  • Probar los enfoques de PNL para la coincidencia de perfiles/ofertas

¿Se puede enriquecer o mejorar?

Sí. Es posible añadir ofertas de trabajo reales, metadatos (sector, puesto, ubicación) o diversificar el lenguaje o la estructura de los currículums. Una extensión multilingüe o un enriquecimiento mediante el análisis sintáctico aumentaría la solidez del conjunto de datos.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Muy fácil – formato CSV legible)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – columnas ya estructuradas)
🏷️ Riqueza de anotaciones⭐⭐✩✩✩ (Básico – presencia o no de relevancia)
📜 Licencia comercial✅ Sí (MIT)
👨‍💻 Ideal para principiantes🌟 Perfecto para iniciar con clasificación NLP
🔁 Reutilizable para fine-tuning🎯 Útil para ajustar modelos tipo BERT sobre datos de RRHH
🌍 Diversidad cultural⚠️ A reforzar – principalmente unilingüe y no geolocalizado

🧠 Recomendado para

  • Desarrolladores de IA de recursos humanos
  • Investigadores de PNL aplicados a la contratación
  • Estudiantes de clasificación de PNL

🔧 Herramientas compatibles

  • Scikit-learn
  • Hugging Face Transformers
  • Pandas
  • FastText

💡 Consejo

Complete el conjunto de datos con ofertas de trabajo reales para modelar la correspondencia entre el currículum y la oferta de una manera más refinada.

Preguntas frecuentes

¿Se puede usar este conjunto de datos en una solicitud de contratación comercial?

Sí, la licencia MIT permite el uso comercial gratuito con atribución.

¿Los currículums son reales o simulados?

Los datos son anónimos y no permiten identificar a personas reales.

¿El conjunto de datos está adaptado a otros idiomas además del inglés?

No, la mayoría de los ejemplos están en inglés. La adaptación multilingüe requeriría una traducción y un reajuste léxico.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.