En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Synthetic ESCO Skill Sentences
Texte

Synthetic ESCO Skill Sentences

Jeu de données contenant des phrases synthétiques représentant des annonces d’emploi, associées à 99,5 % des compétences de la base ESCO v1.1.0.

Télécharger le dataset
Taille

138 260 paires phrase-compétence, texte, format JSON

Licence

CC BY 4.0

Description

Synthetic ESCO Skill Sentences est un dataset de plus de 138 000 phrases générées automatiquement à partir de la taxonomie ESCO (European Skills, Competences, Qualifications and Occupations). Chaque phrase met en contexte une compétence ESCO dans une situation professionnelle typique, de manière à simuler des annonces d’emploi réelles.

À quoi sert ce dataset ?

  • Entraîner des modèles d’extraction ou de reconnaissance de compétences dans des textes RH
  • Tester ou créer des systèmes de recommandation de profils ou d'offres d’emploi
  • Construire des modèles de classification multilabel sur des corpus liés à l’emploi ou à la formation

Peut-on l’enrichir ou l’améliorer ?

Oui, il est possible de générer des variantes plus complexes ou réalistes des phrases actuelles, ou d’annoter les phrases avec des contextes métiers spécifiques. On peut aussi l'adapter à d’autres langues en traduisant les phrases ou en les régénérant avec des modèles multilingues.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Structure simple - phrase + compétence)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Aucun – données propres et cohérentes)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Moyenne : chaque phrase est liée à une compétence ESCO)
📜 Licence commerciale✅ Oui (CC BY 4.0)
👨‍💻 Idéal pour les débutants✅ Oui – format accessible et prêt à l'emploi
🔁 Réutilisable en fine-tuning🗂️ Très bon pour modèles de classification de texte ou tagging
🌍 Diversité culturelle⚠️ Faible – phrases uniquement en anglais et générées de manière synthétique

🧠 Recommandé pour

  • Projets RH
  • Recherche sur les compétences
  • Développeurs d’ATS ou d’outils d’orientation

🔧 Outils compatibles

  • SpaCy
  • Scikit-learn
  • Hugging Face Transformers
  • TARS
  • Flair

💡 Astuce

Combinez ce dataset avec des phrases issues d’annonces réelles pour créer des ensembles mixtes plus robustes à la variabilité du langage humain.

Questions fréquemment posées

Est-ce que les phrases du dataset sont extraites d’offres d’emploi réelles ?

Non, les phrases sont générées automatiquement à partir de la base ESCO pour chaque compétence, et ne proviennent pas de textes réels.

Ce dataset peut-il servir à entraîner un modèle d’extraction de compétences ?

Oui, il est idéal pour cela car chaque phrase contient une compétence clairement identifiée, utile pour du sur-apprentissage ou du test.

Peut-on traduire ce dataset dans d'autres langues ?

Oui, les phrases peuvent être traduites automatiquement ou régénérées à partir des compétences ESCO dans d'autres langues.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.