DROP — Punto de referencia de comprensión con razonamiento
DROP es un conjunto de datos de comprensión de textos avanzada, diseñado para evaluar la capacidad de un sistema para responder preguntas complejas mediante operaciones discretas (contar, ordenar, calcular) basadas en párrafos largos.
Aproximadamente 86.000 ejemplos, formato JSON con párrafos, preguntas y respuestas
CC-BY-SA 4.0
Descripción
DROP (Razonamiento discreto sobre párrafos) es un punto de referencia de lectura compuesto por más de 86 000 preguntas en inglés. Desafía los modelos lingüísticos al pedirles que lean párrafos y respondan a preguntas que requieren un razonamiento simbólico: contar, comparar, extraer entidades o sumar. Los datos son el resultado de un proceso colaborativo y contradictorio para aumentar la dificultad del conjunto de datos.
¿Para qué sirve este conjunto de datos?
- Evalúe o entrene modelos de control de calidad complejos basados en párrafos
- Pon a prueba la capacidad de un LLM para realizar razonamientos discretos (números, fechas, cantidades, etc.)
- Fortalecimiento de la comprensión contextual en los sistemas de IA
¿Se puede enriquecer o mejorar?
Sí El conjunto de datos se puede traducir o adaptar a otros idiomas. Se pueden agregar nuevos tipos de preguntas (clasificación, cálculos de tiempo, reformulaciones) para enriquecer la variedad. Los metadatos (por ejemplo, el nivel de dificultad o el tipo de pregunta) también pueden mejorar su uso en el aprendizaje supervisado o autosupervisado.
🔎 En resumen
🧠 Recomendado para
- Investigadores de control de calidad
- Perfeccionamiento de los LLM
- Evaluación de lógica simbólica
🔧 Herramientas compatibles
- Hugging Face Transformers
- T5
- DeBERTa
- OpenAI GPT
💡 Consejo
Utilice modelos capaces de encadenar varios pasos de razonamiento para obtener mejores resultados (por ejemplo, T5 con indicaciones en varias rondas).
Preguntas frecuentes
¿En qué se diferencia DROP de otros conjuntos de datos de control de calidad?
A diferencia de los QA simples, DROP requiere cálculos, conteo u clasificación a partir del texto, lo que lo convierte en un punto de referencia más exigente.
¿Podemos usar este conjunto de datos para aprender con pocos intentos?
Sí, al seleccionar ejemplos de varios tipos de preguntas, DROP se puede usar en configuraciones de pocos disparos o en cadena de ideas.
¿Es adecuado para modelos multilingües?
El conjunto de datos solo está en inglés, pero se puede traducir o adaptar a otros idiomas para experimentos multilingües.




