Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
PolyGuard
Texto

PolyGuard

Conjunto de datos de texto que incluye instrucciones o indicaciones anotadas para detectar sesgos, contenido confidencial y seguridad del modelo.

Obtén el dataset
Tamaño

Aproximadamente 136.800 ejemplos de texto anotados como líneas en formato JSON/texto

Licencia

CC-BY 4.0

Descripción

‍

PolyGuard es un conjunto de datos textuales compuesto por instrucciones e indicaciones anotadas de acuerdo con su naturaleza sesgada o peligrosa. Cada ejemplo contiene texto y una etiqueta como «inseguro» para denunciar contenido problemático.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos para detectar sesgos y contenidos delicados en la PNL
  • Mejorar la moderación automatizada del contenido generado por IA
  • Contribuir a la ética y la seguridad en los sistemas de IA conversacional

‍

‍

¿Se puede enriquecer o mejorar?

‍

Es posible enriquecer este conjunto de datos añadiendo nuevos tipos de sesgos o contenido confidencial, así como refinando las anotaciones para subcategorías específicas. La diversidad lingüística y cultural también se puede aumentar para lograr una mayor solidez.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐✩ (Datos textuales simples de manipular)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos ya anotados)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno – anotaciones sobre sesgos y seguridad)
📜 Licencia comercial✅ Sí (CC-BY 4.0)
👨‍💻 Ideal para principiantes🌟 Sí – accesible para novatos en NLP
🔁 Reutilizable para fine-tuning⚡ Adecuado para moderación y clasificación
🌍 Diversidad cultural⚠️ Moderado – principalmente anglófono, a ampliar

‍

‍

🧠 Recomendado para

  • Investigadores de PNL
  • Equipos de IA éticos
  • Desarrolladores de moderación

‍

‍

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • SpaCy
  • FastText

‍

‍

💡 Consejo

Utilice técnicas de aumento de datos para mejorar la solidez del modelo frente a sesgos sutiles.

Preguntas frecuentes

¿Qué tipo de contenido ayuda a detectar este conjunto de datos?

Su objetivo es la detección de contenido sesgado, peligroso o inapropiado en las indicaciones de texto.

¿Qué licencia cubre este conjunto de datos?

Está licenciado bajo CC-BY 4.0, lo que permite su uso comercial y gratuito.

¿Este conjunto de datos es adecuado para principiantes en PNL?

Sí, su estructura simple y sus anotaciones claras facilitan su uso para los principiantes.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.