Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
DAIGT Proper Train Dataset
Texto

DAIGT Proper Train Dataset

Conjunto de datos de texto compuesto por varios miles de ejemplos diseñados para entrenar modelos para detectar texto generado por IA. Incluye textos generados por varios modelos lingüísticos principales (ChatGPT, LLama, Falcon, Claude, Mistral), así como ensayos oficiales. Este corpus es adecuado para ajustar y evaluar los modelos de detección de IA.

Obtén el dataset
Tamaño

Varios miles de ensayos de texto en texto plano o formato JSON

Licencia

MIT

Descripción

El DAIGT Proper Train Dataset es un rico corpus textual que incluye varios miles de ejemplos de ensayos generados por varios modelos de lenguaje de IA, así como ensayos en humanos. Contiene metadatos, como el identificador de la prueba y la solicitud de generación, si están disponibles. Este conjunto de datos está diseñado para concursos y proyectos de detección de texto generados por IA.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos de clasificación para distinguir el texto humano del texto de la IA
  • Evalúe la solidez de los detectores de IA en una variedad de datos
  • Ajustes para mejorar la detección en diferentes contextos

¿Se puede enriquecer o mejorar?

Sí, es posible añadir textos generados por nuevos modelos o integrar anotaciones adicionales (por ejemplo, dificultad, tema). El conjunto de datos también se puede estratificar por fuente o por mensaje para realizar análisis detallados.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Dataset listo para usar, metadatos útiles)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos bien organizados)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno – metadatos sobre fuente y prompts)
📜 Licencia comercial✅ Sí (MIT)
👨‍💻 Ideal para principiantes🌟 Adecuado para usuarios principiantes y avanzados
🔁 Reutilizable para fine-tuning🎯 Excelente para detección y clasificación de texto IA
🌍 Diversidad cultural📖 Textos variados producidos por varios modelos LLM

🧠 Recomendado para

  • Investigadores de PNL
  • Equipos de detección de IA
  • Competidores de IA generativa

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • Scikit-learn
  • PyTorch
  • TensorFlow

💡 Consejo

Usa los metadatos para crear conjuntos de entrenamiento equilibrados y variados.

Preguntas frecuentes

¿Este conjunto de datos solo contiene texto generado por IA?

No, también contiene ensayos en humanos para permitir un aprendizaje equilibrado.

¿Cuál es la licencia del conjunto de datos?

La licencia es MIT, que permite el uso gratuito, incluido el uso comercial.

¿Se puede usar este conjunto de datos para entrenar detectores de plagio o similitud?

Sí, se puede usar para estas tareas, especialmente como complemento de otros corpus.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.