Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Synthetic ESCO Skill Sentences
Texto

Synthetic ESCO Skill Sentences

Conjunto de datos que contiene frases sintéticas que representan anuncios de empleo, asociadas con el 99,5% de las habilidades de la base de datos ESCO v1.1.0.

Obtén el dataset
Tamaño

138,260 pares de frase-habilidad, texto, formato JSON

Licencia

CC BY 4.0

Descripción

Synthetic ESCO Skill Sentences es un conjunto de datos de más de 138 000 frases generadas automáticamente a partir de la taxonomía ESCO (habilidades, competencias, cualificaciones y ocupaciones europeas). Cada oración contextualiza una habilidad de la ESCO en una situación profesional típica, con el fin de simular anuncios de trabajo reales.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos de extracción o reconocimiento de competencias en textos de RRHH
  • Pruebe o cree sistemas para recomendar perfiles u ofertas de trabajo
  • Creación de modelos de clasificación de etiquetas múltiples en corpus relacionados con el empleo o la formación

¿Se puede enriquecer o mejorar?

Sí, es posible generar variantes más complejas o realistas de las oraciones actuales, o anotar oraciones con contextos comerciales específicos. También se puede adaptar a otros idiomas traduciendo frases o regenerándolas con plantillas multilingües.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Estructura simple - frase + competencia)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ninguno – datos limpios y coherentes)
🏷️ Riqueza de anotaciones⭐⭐⭐✩✩ (Media – cada frase está vinculada a una competencia ESCO)
📜 Licencia comercial✅ Sí (CC BY 4.0)
👨‍💻 Ideal para principiantes✅ Sí – formato accesible y listo para usar
🔁 Reutilizable para fine-tuning🗂️ Muy bueno para modelos de clasificación de texto o etiquetado
🌍 Diversidad cultural⚠️ Bajo – frases solo en inglés y generadas de manera sintética

🧠 Recomendado para

  • Proyectos de RRHH
  • Investigación de habilidades
  • ATS o desarrolladores de herramientas de orientación

🔧 Herramientas compatibles

  • SpaCy
  • Scikit-learn
  • Hugging Face Transformers
  • TARS
  • Flair

💡 Consejo

Combine este conjunto de datos con frases de anuncios reales para crear conjuntos mixtos que sean más resistentes a la variabilidad del lenguaje humano.

Preguntas frecuentes

¿Las frases del conjunto de datos están tomadas de ofertas de trabajo reales?

No, las frases se generan automáticamente a partir de la base de datos de la ESCO para cada habilidad y no provienen de textos reales.

¿Se puede usar este conjunto de datos para entrenar un modelo de extracción de habilidades?

Sí, es ideal para esto porque cada oración contiene una habilidad claramente identificada, útil para sobreaprender o poner a prueba.

¿Podemos traducir este conjunto de datos a otros idiomas?

Sí, las oraciones se pueden traducir automáticamente o se pueden regenerar a partir de las habilidades de ESCO en otros idiomas.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.