ScanNet
Conjunto de datos RGB-D para interiores compuesto por 1513 escaneos 3D anotados vóxel por vóxel. Abarca 20 clases de objetos para la segmentación semántica 3D y está diseñado para la reconstrucción de escenas interiores, la percepción robótica y el aprendizaje profundo con múltiples vistas.
1513 escaneos RGB-D anotados, formatos 2D/3D (imágenes, vóxeles, mallas, mapas de profundidad)
MIT
Descripción
ScanNet es un conjunto de datos de visión artificial dedicado al modelado de interiores en 3D. Contiene más de 1500 escenas escaneadas con sensores RGB-D, cada una anotada con etiquetas semánticas 3D en forma de vóxeles.
¿Para qué sirve este conjunto de datos?
- Segmentación semántica 3D
- Reconstrucción de escenas interiores
- Detección y seguimiento de objetos en entornos cerrados
- Percepción robótica y navegación interior
¿Se puede enriquecer o mejorar?
Sí, el conjunto de datos se puede combinar con otros sensores, como LiDAR o cámaras térmicas. También es posible anotar subclases más precisas o convertirlas a formato de nube de puntos si es necesario.
🔎 En resumen
🧠 Recomendado para
- Investigadores de percepción 3D
- Visión robótica
- Reconstrucción de escenas
🔧 Herramientas compatibles
- PyTorch3D
- Open3D
- MeshLab
- MinkowskiEngine
- Kaolin
💡 Consejo
Utilice archivos de profundidad para crear nubes de puntos con alineación RGB para entrenar modelos PointNet o KPConv.
Preguntas frecuentes
¿ScanNet solo proporciona imágenes 2D?
No, incluye imágenes RGB, mapas de profundidad, mallas y volúmenes 3D voxelizados con anotaciones.
¿Cuál es el formato de las anotaciones para la segmentación 3D?
Las anotaciones se realizan a nivel de vóxeles, con 20 clases de objetos semánticos en las escenas interiores.
¿Se puede usar ScanNet para proyectos de robótica?
Sí, se usa ampliamente para la navegación autónoma, la detección de obstáculos y el modelado de entornos cerrados.




