Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
BullshitEval: evaluación de la confiabilidad de los asistentes de IA
Texto

BullshitEval: evaluación de la confiabilidad de los asistentes de IA

Punto de referencia de 2400 escenarios repartidos en 100 modelos de asistentes de IA, utilizados para detectar y medir la «máquina de tonterías».

Obtén el dataset
Tamaño

2.400 ejemplos de texto en formato JSON

Licencia

MIT

Descripción

Bullshiteval es un punto de referencia compuesto por 2.400 escenarios que abarcan 100 asistentes de IA. Permite evaluar la calidad de las respuestas proporcionadas por estos modelos a través de varios tipos de consultas: preguntas generales, pruebas halagadoras, preocupaciones negativas, etc. El conjunto de datos incluye el contexto, la pregunta del sistema, la pregunta y el tipo de prueba.

¿Para qué sirve este conjunto de datos?

  • Medir la capacidad de los LLM para evitar respuestas inconsistentes o erróneas
  • Evalúe el comportamiento de las IA frente a diferentes tipos de indicaciones
  • Creación de puntos de referencia sólidos para la investigación de confiabilidad de la IA

¿Se puede enriquecer o mejorar?

Sí, BullshitEval puede adaptarse a otros idiomas o ampliarse con nuevos tipos de pruebas (por ejemplo, alucinaciones, sesgos culturales). También es posible añadir anotaciones humanas sobre la calidad de las respuestas o incluir otros modelos de IA en la evaluación.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Muy fácil vía Hugging Face Datasets)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ninguna limpieza requerida – datos listos para usar)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Anotado por tipo de pregunta y tipo de prompt del sistema)
📜 Licencia comercial✅ Sí (MIT)
👨‍💻 Ideal para principiantes🌟 Sí, simple de explorar y usar
🔁 Reutilizable para fine-tuning⚠️ No diseñado para fine-tuning, pero útil para evaluación
🌍 Diversidad cultural⚠️ A enriquecer – actualmente centrado en inglés

🧠 Recomendado para

  • Investigadores de IA
  • Ingenieros de LLM
  • Creadores de referencia

🔧 Herramientas compatibles

  • Hugging Face Datasets
  • Pandas
  • Jupyter
  • Frameworks de evaluación LLM

💡 Consejo

Úselo con varios LLM en paralelo para comparar el rendimiento en las mismas condiciones.

Preguntas frecuentes

¿Podemos usar BullshitEval para evaluar modelos de código abierto como Mistral o LLama?

Sí, el formato es universal. Puede probar cualquier modelo utilizando las mismas instrucciones que se proporcionan en la prueba de rendimiento.

¿El conjunto de datos incluye calificaciones humanas de alta calidad?

No, las respuestas del modelo no se califican. Más bien, sirve como base estandarizada para realizar sus propias evaluaciones.

¿El conjunto de datos es adecuado para probar los asistentes de IA de habla francesa?

El contenido está en inglés, pero los escenarios se pueden traducir y adaptar para los asistentes de IA francófonos.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.