Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Texto

SNLI

El conjunto de datos SNLI ofrece 570 000 pares de oraciones en inglés anotadas manualmente para clasificarlas en melosas, contradictorias o neutrales, algo esencial para la inferencia textual en la PNL.

Obtén el dataset
Tamaño

570.000 pares frase-premisa e hipótesis, formato JSON

Licencia

CC-BY-SA 4.0

Descripción

‍

SNLI es un corpus importante para la tarea de inferencia del lenguaje natural (NLI). Cada ejemplo contiene una oración de «premisa» y una oración de «hipótesis» anotadas con una etiqueta que indica si la segunda implica la primera, la contradice o es neutral.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene y evalúe modelos de inferencia textual
  • Mejorar la comprensión semántica en los sistemas de PNL
  • Probar la capacidad de los modelos para razonar sobre las relaciones lógicas entre oraciones

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, añadiendo ejemplos en otros idiomas, enriqueciendo las anotaciones o integrando las explicaciones de las decisiones para un aprendizaje más transparente.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Formato simple y ampliamente soportado)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Muy bajo, datos listos para usar)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno, con tres labels equilibrados)
📜 Licencia comercial✅ Sí (CC-BY-SA 4.0)
👨‍💻 Ideal para principiantes🌟 Sí, usado frecuentemente como dataset de referencia
🔁 Reutilizable para fine-tuning🎯 Perfecto para fine-tuning en tareas de comprensión textual
🌍 Diversidad cultural⚡ Inglés, textos de usuarios de Flickr y Amazon Mechanical Turk

‍

‍

🧠 Recomendado para

  • Investigadores de PNL
  • Desarrolladores de IA
  • Estudiantes de aprendizaje profundo

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • PyTorch
  • TensorFlow
  • AllenNLP

‍

‍

💡 Consejo

Utilice SNLI junto con otros conjuntos de datos de NLI para mejorar la solidez del modelo.

Preguntas frecuentes

¿Qué tipo de anotaciones contiene el conjunto de datos SNLI?

Etiquetas manuales que indican si la segunda oración implica, contradice o es neutral con respecto a la primera oración.

¿El conjunto de datos es adecuado para uso comercial?

Sí, la licencia CC-BY-SA 4.0 permite el uso comercial con la condición de compartir la misma.

¿Cuál es el tamaño promedio de las oraciones en SNLI?

En promedio, la oración «premisa» contiene 14,1 fichas y la «hipótesis» 8,3 fichas.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.