xLAM Function Calling 60k
Ce dataset contient 60 000 exemples de requêtes textuelles avec appels API fonctionnels associés, vérifiés automatiquement par exécution et validation sémantique, couvrant 21 catégories d’API. Il est conçu pour le développement de modèles fonction-calling capables d’interpréter et d’exécuter des fonctions à partir de texte naturel.
60 000 exemples JSON, format structuré : requête, outils, paramètres, réponses
CC-BY 4.0
Description
Le dataset xLAM Function Calling 60k comprend 60 000 exemples de requêtes en langage naturel, associées à des appels fonctionnels d’API validés via trois étapes : contrôle de format, exécution réelle et vérification sémantique. Les données couvrent 21 catégories API diverses et sont générées par deux pipelines automatiques.
À quoi sert ce dataset ?
- Entraîner des modèles capables d’appeler des fonctions API à partir d’instructions en langage naturel
- Évaluer la précision des modèles dans la compréhension des paramètres et exécution correcte
- Benchmarker les agents fonction-calling dans des contextes variés
Peut-on l’enrichir ou l’améliorer ?
Ce dataset peut être enrichi par l’ajout de nouveaux types d’API, l’intégration de logs d’exécution, ou la création de versions multilingues. Une annotation plus fine des erreurs mineures détectées pourrait également améliorer la robustesse.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP
- Développeurs d’assistants API
- Ingénieurs ML fonction-calling
🔧 Outils compatibles
- Hugging Face Datasets
- LangChain
- OpenAI Function Calling
- FastAPI
💡 Astuce
Utilisez la validation sémantique comme filtre pour détecter et corriger les erreurs dans vos propres données.
Questions fréquemment posées
Qu’est-ce qu’un agent function-calling dans le contexte de ce dataset ?
Un agent function-calling interprète des instructions en langage naturel pour exécuter automatiquement des appels à des fonctions API avec les paramètres appropriés.
Le dataset contient-il des exemples d’erreurs ou de données incorrectes ?
Oui, environ 5 % des exemples présentent de petites erreurs détectées lors de la validation, comme des arguments inexactes, mais globalement la qualité est supérieure à 95 %.
Peut-on utiliser ce dataset pour des applications commerciales ?
Oui, la licence CC-BY 4.0 permet un usage commercial à condition de mentionner l’attribution.




