SNLI
El conjunto de datos SNLI ofrece 570 000 pares de oraciones en inglés anotadas manualmente para clasificarlas en melosas, contradictorias o neutrales, algo esencial para la inferencia textual en la PNL.
Descripción
SNLI es un corpus importante para la tarea de inferencia del lenguaje natural (NLI). Cada ejemplo contiene una oración de «premisa» y una oración de «hipótesis» anotadas con una etiqueta que indica si la segunda implica la primera, la contradice o es neutral.
¿Para qué sirve este conjunto de datos?
- Entrene y evalúe modelos de inferencia textual
- Mejorar la comprensión semántica en los sistemas de PNL
- Probar la capacidad de los modelos para razonar sobre las relaciones lógicas entre oraciones
¿Se puede enriquecer o mejorar?
Sí, añadiendo ejemplos en otros idiomas, enriqueciendo las anotaciones o integrando las explicaciones de las decisiones para un aprendizaje más transparente.
🔎 En resumen
🧠 Recomendado para
- Investigadores de PNL
- Desarrolladores de IA
- Estudiantes de aprendizaje profundo
🔧 Herramientas compatibles
- Hugging Face Transformers
- PyTorch
- TensorFlow
- AllenNLP
💡 Consejo
Utilice SNLI junto con otros conjuntos de datos de NLI para mejorar la solidez del modelo.
Preguntas frecuentes
¿Qué tipo de anotaciones contiene el conjunto de datos SNLI?
Etiquetas manuales que indican si la segunda oración implica, contradice o es neutral con respecto a la primera oración.
¿El conjunto de datos es adecuado para uso comercial?
Sí, la licencia CC-BY-SA 4.0 permite el uso comercial con la condición de compartir la misma.
¿Cuál es el tamaño promedio de las oraciones en SNLI?
En promedio, la oración «premisa» contiene 14,1 fichas y la «hipótesis» 8,3 fichas.




