ScanNet
Dataset RGB-D intérieur composé de 1513 scans 3D annotés voxel par voxel. Il couvre 20 classes d’objets pour la segmentation sémantique 3D et est conçu pour la reconstruction de scènes intérieures, la perception robotique et l’apprentissage profond multivue.
1513 scans RGB-D annotés, formats 2D/3D (images, voxels, meshes, depth maps)
MIT
Description
ScanNet est un dataset de vision par ordinateur dédié à la modélisation intérieure en 3D. Il contient plus de 1 500 scènes scannées à l’aide de capteurs RGB-D, chacune étant annotée avec des labels sémantiques 3D sous forme de voxels.
À quoi sert ce dataset ?
- Segmentation sémantique 3D
- Reconstruction de scènes intérieures
- Détection et suivi d’objets dans des environnements fermés
- Perception robotique et navigation en intérieur
Peut-on l’enrichir ou l’améliorer ?
Oui, le dataset peut être combiné avec d'autres capteurs, comme le LiDAR ou des caméras thermiques. Il est aussi possible d’annoter des sous-classes plus fines ou de le convertir en format point cloud si nécessaire.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en perception 3D
- Vision robotique
- Reconstruction de scènes
🔧 Outils compatibles
- PyTorch3D
- Open3D
- MeshLab
- MinkowskiEngine
- Kaolin
💡 Astuce
Utilisez les fichiers de profondeur pour créer des nuages de points avec alignement RGB pour l'entraînement de modèles type PointNet ou KPConv.
Questions fréquemment posées
Est-ce que ScanNet fournit uniquement des images 2D ?
Non, il inclut des images RGB, des cartes de profondeur, des maillages, et des volumes 3D voxelisés annotés.
Quel est le format des annotations pour la segmentation 3D ?
Les annotations sont faites au niveau des voxels, avec 20 classes d’objets sémantiques dans les scènes intérieures.
Peut-on utiliser ScanNet pour des projets en robotique ?
Oui, il est largement utilisé pour la navigation autonome, la détection d’obstacles et la modélisation d’environnements fermés.




