DAIGT Proper Train Dataset
Conjunto de datos de texto compuesto por varios miles de ejemplos diseñados para entrenar modelos para detectar texto generado por IA. Incluye textos generados por varios modelos lingüísticos principales (ChatGPT, LLama, Falcon, Claude, Mistral), así como ensayos oficiales. Este corpus es adecuado para ajustar y evaluar los modelos de detección de IA.
Descripción
El DAIGT Proper Train Dataset es un rico corpus textual que incluye varios miles de ejemplos de ensayos generados por varios modelos de lenguaje de IA, así como ensayos en humanos. Contiene metadatos, como el identificador de la prueba y la solicitud de generación, si están disponibles. Este conjunto de datos está diseñado para concursos y proyectos de detección de texto generados por IA.
¿Para qué sirve este conjunto de datos?
- Entrene modelos de clasificación para distinguir el texto humano del texto de la IA
- Evalúe la solidez de los detectores de IA en una variedad de datos
- Ajustes para mejorar la detección en diferentes contextos
¿Se puede enriquecer o mejorar?
Sí, es posible añadir textos generados por nuevos modelos o integrar anotaciones adicionales (por ejemplo, dificultad, tema). El conjunto de datos también se puede estratificar por fuente o por mensaje para realizar análisis detallados.
🔎 En resumen
🧠 Recomendado para
- Investigadores de PNL
- Equipos de detección de IA
- Competidores de IA generativa
🔧 Herramientas compatibles
- Hugging Face Transformers
- Scikit-learn
- PyTorch
- TensorFlow
💡 Consejo
Usa los metadatos para crear conjuntos de entrenamiento equilibrados y variados.
Preguntas frecuentes
¿Este conjunto de datos solo contiene texto generado por IA?
No, también contiene ensayos en humanos para permitir un aprendizaje equilibrado.
¿Cuál es la licencia del conjunto de datos?
La licencia es MIT, que permite el uso gratuito, incluido el uso comercial.
¿Se puede usar este conjunto de datos para entrenar detectores de plagio o similitud?
Sí, se puede usar para estas tareas, especialmente como complemento de otros corpus.




