Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Ambig QA
Texto

Ambig QA

Conjunto de datos de Ambig QA que incluye 14.042 preguntas extraídas de NQ-Open, anotadas para reflejar las diversas ambigüedades detectadas en las preguntas abiertas. Este conjunto de datos ayuda a entrenar modelos que pueden gestionar preguntas con respuestas múltiples o ambiguas en contextos amplios.

Obtén el dataset
Tamaño

Aproximadamente 14 000 preguntas en JSON con varias anotaciones, formato estructurado para control de calidad abierto

Licencia

CC BY-SA 3.0

Descripción

‍

Ambig QA es un conjunto de datos de aproximadamente 14 000 preguntas de NQ-Open, anotadas específicamente para las ambigüedades que aparecen en las preguntas abiertas en lenguaje natural. Estas anotaciones permiten comprender mejor los diferentes tipos de ambigüedad y preparar los modelos de respuesta adaptados a las múltiples interpretaciones posibles.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos de preguntas y respuestas para gestionar la ambigüedad en las preguntas abiertas
  • Evalúe la solidez y la capacidad de eliminar la ambigüedad de los sistemas de control de calidad
  • Mejore los chatbots para interpretar mejor las consultas inexactas

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, el conjunto de datos puede enriquecerse con anotaciones adicionales sobre la naturaleza de las ambigüedades o ampliarse a otros idiomas y dominios para mejorar la diversidad de casos de uso. También es posible mezclarlos con otros conjuntos de datos de control de calidad.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Formato JSON estándar, requiere comprensión de anotaciones)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – dataset bien limpio y estructurado)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Rico – anotaciones detalladas sobre ambigüedad)
📜 Licencia comercial⚡ Sí, pero bajo Share-Alike (CC BY-SA 3.0)
👨‍💻 Ideal para principiantes⚠️ Medio – útil para quienes conocen bases de NLP QA
🔁 Reutilizable para fine-tuning🎯 Sí, perfecto para entrenamientos QA especializados
🌍 Diversidad cultural⚠️ Inglés, preguntas abiertas variadas

‍

‍

🧠 Recomendado para

  • Investigadores de control de calidad
  • Desarrolladores de chatbots
  • Ingenieros de PNL

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • SpaCy
  • AllenNLP
  • Herramientas de anotación JSON

‍

‍

💡 Consejo

Utilice anotaciones de ambigüedad para crear modelos que puedan generar varias respuestas relevantes.

Preguntas frecuentes

¿Qué hace que este conjunto de datos sea único para las preguntas abiertas?

Está anotado específicamente para capturar y representar diferentes formas de ambigüedad en las preguntas abiertas, lo cual es poco frecuente en otros conjuntos de datos de control de calidad.

¿Se puede usar este conjunto de datos para tareas multilingües?

No, solo está en inglés, pero el formato se puede adaptar a otros idiomas mediante traducción y anotación.

¿Qué licencia se aplica y cuáles son las restricciones?

Licencia CC BY-SA 3.0, lo que significa que cualquier uso derivado debe compartirse bajo la misma licencia, lo que promueve el intercambio abierto.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.