Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Persona - 100k
Texto

Persona - 100k

Conjunto de datos masivo de 100 000 perfiles sintéticos realistas, estructurado para entrenar a los modelos de IA en tareas de personalización, equidad o interacción conversacional.

Obtén el dataset
Tamaño

100 000 entradas en formato JSONL (504 MB)

Licencia

Apache 2.0

Descripción

‍

Persona - 100k es un conjunto de datos textuales que contiene 100 000 perfiles sintéticos, cada uno descrito por más de 70 atributos. Estas personas abarcan varios aspectos, como los datos personales, la profesión, las preferencias culturales, el estilo de vida o los rasgos de personalidad. El conjunto de datos está completamente en inglés, en el formato .json.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos LLM personalizados, capaces de generar respuestas adaptadas a un perfil de usuario determinado
  • Evalúe la imparcialidad de los modelos basados en datos demográficos simulados
  • Simule usuarios realistas en chatbots o agentes conversacionales

‍

‍

¿Se puede enriquecer o mejorar?

‍

Absolutamente. Es posible añadir capas de anotación (etiquetas emocionales, intenciones, puntuaciones de participación), adaptar las personas a otros idiomas o enriquecer cada perfil con textos simulados (reseñas, diálogos, biografías). Este conjunto de datos es una base excelente para la generación aumentada o la alineación del comportamiento.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Muy fácil – formato JSONL legible y estructurado)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Ninguno – datos listos para usar)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐⭐ (Excelente – más de 70 campos por persona)
📜 Licencia comercial✅ Sí (Apache 2.0)
👨‍💻 Ideal para principiantes🌟 Sí – accesible e inmediatamente utilizable
🔁 Reutilizable para fine-tuning🎯 Ideal para entrenar modelos personalizados
🌍 Diversidad cultural⚡ Bueno – perfiles variados simulados según datos demográficos

‍

‍

🧠 Recomendado para

  • Desarrolladores de IA
  • Investigadores de renta variable algorítmica
  • Diseñadores de chatbots

‍

‍

🔧 Herramientas compatibles

  • Transformers (Hugging Face)
  • LangChain
  • Pipelines RAG
  • Frameworks de recomendación

‍

‍

💡 Consejo

Filtra las personas por una característica específica (por ejemplo, edad, ubicación, interés) para generar indicaciones condicionales enriquecidas.

Preguntas frecuentes

¿Estos perfiles corresponden a personas reales?

No, los perfiles son 100% sintéticos, generados de forma aleatoria pero representativos, sin ningún enlace a personas reales.

¿Se puede usar para probar sistemas de recomendación?

Sí, es un excelente juego de prueba para simular a varios usuarios en sistemas de sugerencias o personalización.

¿Se puede usar este conjunto de datos en un chatbot?

Absolutamente. Permite condicionar a los agentes conversacionales para que reaccionen según perfiles realistas, simulando varios escenarios.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.