StackLite – Dataset des questions Stack Overflow (2016)
Ce dataset StackLite contient les métadonnées des questions posées sur Stack Overflow jusqu’en octobre 2016. Les données comprennent ID, dates, scores, tags et nombre de réponses. Il permet d’analyser les tendances et corrélations entre tags et comportements temporels.
Plus de 12 millions de questions en CSV/SQLite, avec métadonnées associées
Creative Commons Attribution-ShareAlike (CC BY-SA)
Description
Le dataset StackLite propose un extrait des questions de Stack Overflow, focalisé sur les métadonnées : identifiants, dates, scores, tags, nombre de réponses et informations utilisateur. Ce format simplifié facilite l’analyse statistique et temporelle des questions en programmation.
À quoi sert ce dataset ?
- Analyser l’évolution des questions par tags au fil du temps
- Étudier les corrélations entre tags et scores des questions
- Explorer les tendances de publication selon jours de la semaine
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible d’ajouter du texte des questions/réponses ou des données utilisateur supplémentaires pour des analyses plus fines. Une annotation qualitative des questions pourrait aussi augmenter sa valeur.
🔎 En résumé
🧠 Recommandé pour
- Data scientists
- Analystes en tendances tech
- Chercheurs en études communautaires
🔧 Outils compatibles
- Pandas
- SQL
- Jupyter
- Tableau
- PowerBI
💡 Astuce
Utiliser conjointement avec les dumps complets Stack Exchange pour des analyses textuelles approfondies.
Questions fréquemment posées
Ce dataset contient-il le texte complet des questions et réponses ?
Non, uniquement les métadonnées des questions. Le texte complet se trouve dans d’autres dumps plus volumineux.
Peut-on utiliser ce dataset pour analyser les tendances dans les technologies ?
Oui, c’est idéal pour observer la popularité et évolution des tags liés aux technologies de programmation.
Est-ce que ce dataset est adapté pour entraîner un modèle NLP ?
Pas directement, car il ne contient pas de contenu textuel, mais il peut être utilisé en complément pour analyses statistiques.




