En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Resume Screening Dataset
Texte

Resume Screening Dataset

Jeu de données annoté pour entraîner des systèmes de présélection automatique de CV, basé sur des étiquettes de pertinence.

Télécharger le dataset
Taille

10 174 lignes, CSV et Parquet (34 Mo environ)

Licence

MIT

Description

Resume Screening Dataset est un jeu de données structuré contenant plus de 10 000 exemples de CV annotés selon leur pertinence pour un poste. Il est destiné à l'entraînement de modèles de traitement du langage naturel capables d’automatiser le tri de candidatures en fonction de leur adéquation avec une offre d’emploi donnée.

À quoi sert ce dataset ?

  • Développer des systèmes de présélection automatisée pour les recruteurs
  • Entraîner des modèles de classification binaire appliqués aux candidatures
  • Tester des approches NLP pour la correspondance profil / offre

Peut-on l’enrichir ou l’améliorer ?

Oui. Il est possible d’y ajouter des offres d’emploi réelles, des métadonnées (secteur, poste, localisation), ou encore de diversifier les CV en langue ou structure. Une extension multilingue ou un enrichissement via parsing syntaxique rendrait le dataset plus robuste.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Très facile – format CSV lisible)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – les colonnes sont déjà structurées)
🏷️ Richesse des annotations⭐⭐✩✩✩ (Basique – présence ou non de pertinence)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants🌟 Parfait pour démarrer avec la classification NLP
🔁 Réutilisable en fine-tuning🎯 Utile pour ajuster des modèles BERT-like sur données RH
🌍 Diversité culturelle⚠️ À renforcer – principalement unilingue et non géolocalisé

🧠 Recommandé pour

  • Développeurs RH IA
  • Chercheurs en NLP appliqué au recrutement
  • Étudiants en classification NLP

🔧 Outils compatibles

  • Scikit-learn
  • Hugging Face Transformers
  • Pandas
  • FastText

💡 Astuce

Complétez le dataset avec des offres d’emploi réelles pour modéliser la correspondance CV-offre de manière plus fine.

Questions fréquemment posées

Peut-on utiliser ce dataset dans une application de recrutement commercialisée ?

Oui, la licence MIT permet un usage commercial libre avec attribution.

Les CV sont-ils réels ou simulés ?

Les données sont anonymisées et ne permettent pas d’identifier des personnes réelles.

Le dataset est-il adapté à d'autres langues que l'anglais ?

Non, les exemples sont principalement en anglais. Une adaptation multilingue nécessiterait une traduction et un réajustement lexical.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.