S&P 500 Earnings Transcripts
Corpus exhaustif de transcriptions financières trimestrielles d’entreprises du S&P 500 sur 20 ans, idéal pour l’analyse sémantique, temporelle et stratégique.
33 362 transcriptions texte structurées par intervenant, format JSON
MIT
Description
Le dataset S&P 500 Earnings Transcripts regroupe plus de 33 000 transcriptions d’appels financiers trimestriels provenant de 685 entreprises américaines du S&P 500, couvrant la période 2005–2025. Chaque appel est structuré par intervenant, offrant ainsi une base riche pour les travaux de NLP appliqués à la finance et à l’analyse des dialogues économiques.
À quoi sert ce dataset ?
- Analyser le sentiment du marché à travers les prises de parole des dirigeants
- Entraîner des modèles de résumé automatique pour des contenus économiques longs
- Construire des modèles spécialisés pour le question answering financier ou la détection de signaux faibles
Peut-on l’enrichir ou l’améliorer ?
Oui, ce corpus peut être enrichi avec des annotations de tonalité, des tags thématiques (finance, croissance, risque) ou des liens vers des données boursières pour corrélation. Il est aussi possible de coupler les transcriptions avec des modèles vocaux pour l’alignement audio-texte.
🔎 En résumé
🧠 Recommandé pour
- Analystes NLP
- Chercheurs en finance quantitative
- Projets de résumé automatique
🔧 Outils compatibles
- LangChain
- SpaCy
- LlamaIndex
- Hugging Face Transformers
- Haystack
💡 Astuce
Utilisez la structure par intervenant pour entraîner un modèle de classification de rôle (CEO, CFO, analyste).
Questions fréquemment posées
Ce dataset couvre-t-il uniquement les entreprises du S&P 500 ?
Non, il inclut aussi d’autres grandes capitalisations américaines en complément des entreprises du S&P 500.
Le contenu est-il adapté pour un modèle de résumé automatique ?
Oui, la richesse du texte et la structure claire par intervenant le rendent idéal pour l’entraînement de modèles de résumé financier.
Peut-on croiser ce dataset avec des données boursières ?
Oui, chaque fichier contient des informations temporelles et d’entreprise facilitant les jointures avec d’autres bases de données.




