En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
S&P 500 Earnings Transcripts
Texte

S&P 500 Earnings Transcripts

Corpus exhaustif de transcriptions financières trimestrielles d’entreprises du S&P 500 sur 20 ans, idéal pour l’analyse sémantique, temporelle et stratégique.

Télécharger le dataset
Taille

33 362 transcriptions texte structurées par intervenant, format JSON

Licence

MIT

Description

‍

Le dataset S&P 500 Earnings Transcripts regroupe plus de 33 000 transcriptions d’appels financiers trimestriels provenant de 685 entreprises américaines du S&P 500, couvrant la période 2005–2025. Chaque appel est structuré par intervenant, offrant ainsi une base riche pour les travaux de NLP appliqués à la finance et à l’analyse des dialogues économiques.

‍

‍

À quoi sert ce dataset ?

‍

  • Analyser le sentiment du marché à travers les prises de parole des dirigeants
  • Entraîner des modèles de résumé automatique pour des contenus économiques longs
  • Construire des modèles spécialisés pour le question answering financier ou la détection de signaux faibles

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, ce corpus peut être enrichi avec des annotations de tonalité, des tags thématiques (finance, croissance, risque) ou des liens vers des données boursières pour corrélation. Il est aussi possible de coupler les transcriptions avec des modèles vocaux pour l’alignement audio-texte.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Structuré proprement par intervenant et par trimestre)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – les transcriptions sont textuelles et déjà formatées)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne – intervenants, date, entreprise, métadonnées complètes)
📜 Licence commerciale✅ Oui (MIT)
👨‍💻 Idéal pour les débutants🌟 Oui – pas besoin de traitement complexe initial
🔁 Réutilisable en fine-tuning🎯 Oui – adapté aux LLMs spécialisés finance/langage formel
🌍 Diversité culturelle⚠️ Limité au contexte économique nord-américain

‍

‍

🧠 Recommandé pour

  • Analystes NLP
  • Chercheurs en finance quantitative
  • Projets de résumé automatique

‍

‍

🔧 Outils compatibles

  • LangChain
  • SpaCy
  • LlamaIndex
  • Hugging Face Transformers
  • Haystack

‍

‍

💡 Astuce

Utilisez la structure par intervenant pour entraîner un modèle de classification de rôle (CEO, CFO, analyste).

Questions fréquemment posées

Ce dataset couvre-t-il uniquement les entreprises du S&P 500 ?

Non, il inclut aussi d’autres grandes capitalisations américaines en complément des entreprises du S&P 500.

Le contenu est-il adapté pour un modèle de résumé automatique ?

Oui, la richesse du texte et la structure claire par intervenant le rendent idéal pour l’entraînement de modèles de résumé financier.

Peut-on croiser ce dataset avec des données boursières ?

Oui, chaque fichier contient des informations temporelles et d’entreprise facilitant les jointures avec d’autres bases de données.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.