Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Letterbox Movie Classification Dataset
Texto

Letterbox Movie Classification Dataset

Un conjunto de datos estructurados que incluye 10 002 películas, con metadatos completos (títulos, géneros, directores, duración, idioma, etc.) y descripciones textuales que se pueden utilizar en PNL.

Obtén el dataset
Tamaño

10.002 películas, archivo CSV con 15 columnas (textos, categorías, numéricos)

Licencia

CC0: Dominio público

Descripción

El Letterbox Movie Classification Dataset contiene los metadatos de más de 10 000 películas, incluida información como el título, los géneros, el idioma, la duración, el director y las métricas de participación de los usuarios (me gusta, reproducciones, listas). Cada película también incluye una descripción en texto, ideal para aplicaciones de PNL.

¿Para qué sirve este conjunto de datos?

  • Crea sistemas de recomendación de películas basados en el contenido o la popularidad
  • Analice las tendencias de género, estudio o clasificación a lo largo del tiempo
  • Realice la clasificación o agrupamiento de películas según los comportamientos o temas de los usuarios

¿Se puede enriquecer o mejorar?

Sí, el conjunto de datos se puede enriquecer con enlaces a tráilers, imágenes o incluso mediante una clasificación temática más avanzada. También es posible mejorar las columnas de texto mediante incrustaciones o análisis semánticos.

🔎 En resumen

Criterio Evaluación
🧩Facilidad de uso ⭐⭐⭐⭐☆ (CSV listo para usar, bien estructurado)
🧼Necesidad de limpieza ⭐☆☆☆☆ (datos ya limpios y coherentes)
🏷️Riqueza de anotaciones ⭐⭐⭐⭐☆ (con descripciones, géneros, calificaciones, métricas de usuario)
📜Licencia comercial ✅ Sí (CC0)
👨‍💻Ideal para principiantes 👨‍🎓 Muy accesible para proyectos de NLP o EDA
🔁Reutilizable para fine-tuning 🔥 Adecuado para LLMs ligeros y modelos de recomendación
🌍Diversidad cultural 🌍 Películas variadas en idiomas y orígenes

🧠 Recomendado para

  • Analistas de datos cinematográficos
  • Desarrolladores de motores de recomendación
  • Estudiantes de PNL

🔧 Herramientas compatibles

  • Pandas
  • Scikit-learn
  • TensorFlow
  • Hugging Face Transformers

💡 Consejo

Combine las descripciones de texto con los géneros y las métricas de participación para crear un motor de recomendaciones híbrido más preciso.

Preguntas frecuentes

¿Se pueden usar las descripciones de las películas para la PNL?

Sí, cada película tiene una descripción de texto, lo que permite aplicar tareas como el análisis de sentimientos o el modelado de temas.

¿Se puede usar para un motor de recomendaciones personalizado?

Por supuesto, las numerosas columnas permiten enfoques tanto colaborativos como basados en el contenido.

¿El conjunto de datos solo cubre películas recientes?

No, incluye películas de una variedad de períodos, idiomas y géneros, que abarcan una amplia gama de diversidad cinematográfica.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.