Resume Screening Dataset
Jeu de données annoté pour entraîner des systèmes de présélection automatique de CV, basé sur des étiquettes de pertinence.
Description
Resume Screening Dataset est un jeu de données structuré contenant plus de 10 000 exemples de CV annotés selon leur pertinence pour un poste. Il est destiné à l'entraînement de modèles de traitement du langage naturel capables d’automatiser le tri de candidatures en fonction de leur adéquation avec une offre d’emploi donnée.
À quoi sert ce dataset ?
- Développer des systèmes de présélection automatisée pour les recruteurs
- Entraîner des modèles de classification binaire appliqués aux candidatures
- Tester des approches NLP pour la correspondance profil / offre
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible d’y ajouter des offres d’emploi réelles, des métadonnées (secteur, poste, localisation), ou encore de diversifier les CV en langue ou structure. Une extension multilingue ou un enrichissement via parsing syntaxique rendrait le dataset plus robuste.
🔎 En résumé
🧠 Recommandé pour
- Développeurs RH IA
- Chercheurs en NLP appliqué au recrutement
- Étudiants en classification NLP
🔧 Outils compatibles
- Scikit-learn
- Hugging Face Transformers
- Pandas
- FastText
💡 Astuce
Complétez le dataset avec des offres d’emploi réelles pour modéliser la correspondance CV-offre de manière plus fine.
Questions fréquemment posées
Peut-on utiliser ce dataset dans une application de recrutement commercialisée ?
Oui, la licence MIT permet un usage commercial libre avec attribution.
Les CV sont-ils réels ou simulés ?
Les données sont anonymisées et ne permettent pas d’identifier des personnes réelles.
Le dataset est-il adapté à d'autres langues que l'anglais ?
Non, les exemples sont principalement en anglais. Une adaptation multilingue nécessiterait une traduction et un réajustement lexical.




