Le gaussian splatting est une technologie de reconstruction 3D photoréaliste qui transforme un ensemble de photos ou de séquences vidéo en une scène navigable en temps réel. Elle constitue une alternative à la photogrammétrie et aux NeRF, avec des avantages précis sur le pipeline technique et la visualisation 3D, mais aussi des limites à anticiper avant de lancer un projet.

Comprendre le Gaussian Splatting en 3D

Introduite en août 2023 par une équipe de chercheurs européens issue de l’INRIA, cette technologie 3D s’inscrit dans la continuité directe des Neural Radiance Fields apparus en 2020, les NeRF. Elle propose une alternative plus rapide pour la visualisation 3D en temps réel, sans sacrifier le réalisme visuel sur les matières complexes comme le verre, l’eau ou la végétation. La rupture technique est précise : la scène n’est plus un maillage fixe, mais un nuage de primitives gaussiennes optimisées dynamiquement.

C’est quoi le gaussian splatting ? Technologie de rendu 3D, une personne assise devant un écran d’ordinateur.

Une scène composée de gaussiennes

Le gaussian splatting repose sur une primitive unique : la gaussienne 3D. Une scène complexe peut en contenir plusieurs millions, chacune décrivant localement la matière et la lumière avec une précision que les polygones peinent à atteindre sur les surfaces réfléchissantes ou transparentes.

  • Position XYZ : chaque gaussienne est ancrée dans l’espace 3D par ses coordonnées, ce qui permet de distribuer les primitives exactement là où la scène contient de l’information visuelle utile.
  • Matrice de covariance 3×3 : elle définit l’étirement, l’orientation et la mise à l’échelle de la gaussienne dans l’espace, ce qui lui permet d’épouser des formes allongées, aplaties ou sphériques selon la surface à restituer.
  • Couleur RVB : la composante colorimétrique encode l’apparence visuelle de la primitive, avec une dépendance au point de vue qui restitue les effets de lumière directionnelle et de reflets.
  • Valeur alpha : le paramètre d’opacité contrôle la transparence de chaque gaussienne, ce qui permet de modéliser des matières semi-transparentes comme le verre ou la fumée sans artefacts géométriques.

Contrairement à un maillage polygonal dont la géométrie est figée, l’apparence de la scène 3D à partir de ces gaussiennes est générée dynamiquement en fonction du point de vue de l’observateur. Le résultat restitue des détails visuels, des reflets, de la profondeur et des matières sombres que les approches polygonales classiques traitent difficilement sans passer par des shaders complexes et coûteux en calcul.

Le principe du rendu par splatting

Le terme « splatting » désigne la projection des primitives 3D sur un plan image 2D pour produire la vue finale perçue par l’utilisateur. Les gaussian splats sont triés selon leur profondeur par rapport à la caméra, puis projetés et composités dans l’ordre pour former l’image complète avec la bonne gestion des transparences et des superpositions.

Cette projection n’est pas calculée globalement sur l’ensemble de l’écran : le rendu repose sur une rastérisation par tuiles de 16 × 16 pixels, ce qui permet au GPU de traiter plusieurs blocs en parallèle. C’est cette architecture qui rend possible la 3D en temps réel sur du matériel grand public, sans infrastructure de rendu dédiée ni serveur de calcul distant.

Pour créer des scènes 3D navigables et les diffuser en ligne, le modèle final est exporté dans des formats légers comme le format PLY ou des formats propriétaires, puis intégré dans un visualiseur web compatible. Un directeur de projet peut ainsi partager un lien vers une scène photoréaliste accessible directement depuis un navigateur, sans installation ni plugin, ce qui change la façon de présenter un espace industriel, un patrimoine bâti ou un produit à haute valeur perçue.

Comment fonctionne la reconstruction 3D

Le pipeline du gaussian splatting repose sur quatre étapes enchaînées : acquisition des images, génération d’un nuage de points par Structure from Motion, optimisation itérative des gaussiennes, puis rendu en temps réel. Chaque étape conditionne la qualité finale : une capture bâclée en amont ne peut pas être compensée par l’optimisation en aval, quel que soit le temps de calcul investi.

C'est quoi le gaussian splatting : diagramme illustrant acquisition d'images, structure from motion, optimisation des gaussiennes et rendu en 3D.

Capturer les images du sujet

La base de tout modèle 3D de qualité, c’est la diversité angulaire des prises de vue. La photogrammétrie, qui désigne la technique consistant à déduire la géométrie 3D d’un objet ou d’un espace à partir d’un ensemble de photos prises sous différents angles, partage avec le gaussian splatting cette même exigence fondamentale : couvrir le sujet sous toutes ses faces, avec un éclairage stable et des zones de recouvrement suffisantes entre les photos.

  • Smartphone : suffisant pour des objets de taille moyenne en intérieur, à condition de maintenir une exposition constante et d’éviter les mouvements flous entre les prises.
  • Tablette LiDAR : elle apporte une information de profondeur initiale qui stabilise l’alignement des poses de caméra, particulièrement utile dans les environnements peu texturés comme les murs blancs ou les sols uniformes.
  • Appareil photo reflex : recommandé pour les projets exigeants, patrimoine, architecture de prestige ou produit de luxe, où la résolution et la qualité optique font une différence visible sur les reflets et les détails fins.
  • Séquence vidéo ou caméra 360° : elle permet une couverture rapide d’espaces larges, notamment en chantier ou en milieu industriel, avec une extraction de trames qui alimente directement le pipeline de reconstruction.

Les poses de caméra extraites à cette étape servent à initialiser un nuage de points épars via Structure from Motion. Ce nuage constitue le point de départ géométrique sur lequel les gaussiennes vont être distribuées avant l’optimisation. La qualité de cet alignement initial conditionne directement la cohérence globale de la reconstruction : un scan mal aligné génère des artefacts que l’optimisation ne peut pas corriger.

Optimiser les points Gaussian

L’optimisation procède par descente de gradient stochastique : à chaque itération, les paramètres de chaque gaussienne, position, forme, couleur et opacité, sont ajustés pour réduire l’écart entre l’image reconstruite et les photos sources. Ce processus est répété des milliers de fois, ce qui peut nécessiter plusieurs heures de calcul GPU selon la densité de la scène et la résolution des images d’entrée.

La densification adaptative affine automatiquement la représentation : les gaussiennes trop grandes sont divisées pour augmenter le niveau de détail dans les zones complexes, les trop petites sont clonées pour renforcer la couverture, et celles dont l’opacité est insuffisante sont supprimées pour alléger le modèle. Ce mécanisme de nettoyage itératif permet au modèle final d’être à la fois léger à diffuser et précis visuellement, sans explosion du volume de données.

Afficher la scène en temps réel

Une fois l’optimisation terminée, le rendu en temps réel s’appuie sur la rastérisation par tuiles de 16 × 16 pixels déjà évoquée. Le GPU traite ces blocs en parallèle, ce qui permet d’atteindre entre 30 et 135 images par seconde selon la complexité de la scène et le matériel utilisé, une plage qui couvre à la fois les usages de visualisation sur écran standard et les expériences de réalité augmentée sur des équipements récents.

Le modèle peut être exporté en.PLY ou dans un format propriétaire selon la plateforme cible, puis intégré dans un visualiseur web ou une application dédiée. Grâce au gaussian splatting, une scène photoréaliste de plusieurs millions de gaussiennes devient consultable directement dans un navigateur sans plugin ni installation côté client, ce qui simplifie le déploiement pour des cas d’usage comme la visite de site industriel, la présentation d’un logement ou la médiation culturelle.

Les scènes photoréalistes apprises par le modèle conservent toute la richesse visuelle des matières difficiles, reflets métalliques, transparences et végétation dense, que les méthodes de rendu polygonal restituent mal sans shaders dédiés. Pour un responsable formation qui veut documenter une installation existante sans la reconstruire manuellement en 3D, ce pipeline représente un gain de temps mesurable dès la première scène produite.

Usages et avantages du rendu Gaussian

Le rendu gaussian répond à des cas d’usage précis où les méthodes classiques montrent leurs limites. Architecture, immobilier, BTP, patrimoine culturel, jeux vidéo, effets spéciaux et catalogues produits : la capacité à générer une scène photoréaliste navigable à partir de simples photos représente un avantage opérationnel direct, pas une promesse abstraite.

Salon moderne lumineux avec vue sur montagnes et lac, décor chaleureux et points colorés qui donnent un effet d’optique. c'est quoi le gaussian splatting, intégré naturellement.

Les atouts du Gaussian Splatting face aux méthodes classiques

La photogrammétrie produit des maillages polygonaux précis pour les objets aux contours nets, mais échoue sur le ciel, les miroirs, les surfaces réfléchissantes et les détails éloignés. Le gaussian splatting traite ces éléments nativement, sans recourir à des solutions géométriques de contournement. Quant aux NeRF, qui incarnent la technologie Neural Radiance Fields, ils offrent un réalisme comparable, mais au prix d’un coût de calcul bien supérieur et d’une lenteur de rendu qui les exclut des usages de production en temps réel.

  • Surfaces complexes : verre, eau, végétation, peau et matières sombres sont restitués avec une fidélité visuelle que la photogrammétrie polygonale ne peut pas atteindre sans un traitement manuel long et coûteux.
  • Vitesse de rendu : là où certaines scènes nécessitaient plusieurs minutes de calcul avec d’autres méthodes, le gaussian splatting les ramène à moins d’une minute, voire à un flux temps réel fluide selon le matériel disponible.
  • Accessibilité de capture : un smartphone suffit pour initier un pipeline complet, sans équipement de scan laser professionnel ni infrastructure lourde, ce qui réduit le coût d’entrée pour les équipes terrain.

La photogrammétrie reste pertinente dès que la précision métrique au millimètre est un impératif : relevé de chantier, contrôle qualité industriel ou jumeau numérique à forte contrainte géométrique. Le scan laser LiDAR conserve également sa place pour les relevés métriques de référence. Le gaussian splatting s’impose en revanche dès que l’objectif est la communication visuelle, la médiation ou la formation : il produit des contenus 3D photoréalistes consultables sans équipement spécialisé.

Critère Photogrammétrie NeRF Gaussian Splatting
Rendu temps réel Oui (maillage) Non Oui (30–135 fps)
Surfaces réfléchissantes Faible Élevée Élevée
Précision métrique Élevée Moyenne Moyenne
Coût de calcul Modéré Élevé Modéré
Diffusion web sans plugin Partielle Non Oui

Applications des scènes 3D immersives

La navigation libre dans l’espace distingue le gaussian splatting d’une visite virtuelle 360° classique : au lieu de se téléporter entre des points fixes, l’utilisateur se déplace librement dans la scène 3D reconstituée, comme dans un environnement temps réel.

  • Architecture et immobilier : présenter un bien existant ou un projet livré en navigation libre, sans modélisation 3D manuelle, à partir de quelques centaines de photos prises sur site.
  • Patrimoine et culture : numériser un monument, une salle de musée ou un objet archéologique pour une médiation en ligne accessible depuis n’importe quel navigateur, sans casque ni application dédiée.
  • Formation et industrie : documenter une installation industrielle existante pour créer un support de formation opérateur navigable, sans reconstruction 3D manuelle de l’environnement.

Les jeux vidéo, les effets spéciaux et les catalogues produits de luxe constituent d’autres débouchés naturels : la technologie permet de capturer un objet physique et de le restituer dans un environnement interactif avec une fidélité visuelle proche du rendu 3D photoréaliste classique, mais à partir de simples photos plutôt que d’une modélisation longue et coûteuse.

Limites à anticiper

La qualité du modèle dépend directement de celle des images d’entrée : un éclairage variable entre les prises, un mauvais recouvrement angulaire ou des poses de caméra mal alignées produisent du scintillement, des zones floues ou des éléments visuellement flottants dans la scène. Un traitement post-capture est néanmoins souvent nécessaire pour supprimer les gaussiens isolés ou incohérents et stabiliser le rendu final avant diffusion.

La précision métrologique n’est pas garantie au millimètre : pour un relevé de chantier ou un contrôle qualité industriel, le scan laser LiDAR reste la référence. Sur des appareils modestes, smartphones anciens ou tablettes sans GPU dédié, la fluidité de visualisation peut aussi se dégrader sensiblement, ce qui impose de qualifier le matériel cible avant de choisir ce format de diffusion.

Foire aux questions

Quelle est la différence entre le gaussian splatting et les NeRF ?

Les deux technologies reconstruisent une scène 3D à partir de photos, mais leurs architectures divergent sur un point clé : la vitesse. Les NeRF, qui s’appuient sur des réseaux de neurones pour encoder la radiance volumétrique, produisent des rendus lents, inadaptés à un usage en temps réel. Le gaussian splatting, lui, représente la scène par des primitives explicites, les gaussiennes, qui s’affichent à 30 à 135 images par seconde sur GPU standard, ce qui le rend directement utilisable en production.

Quels appareils suffisent pour capturer une scène ?

Un smartphone récent suffit pour initier un pipeline de gaussian splatting sur un objet ou un espace de taille standard. Une tablette LiDAR améliore la stabilité de l’alignement dans les environnements peu texturés. Pour des projets exigeants (patrimoine, produit de luxe, architecture de prestige), un appareil photo reflex apporte une résolution et une qualité optique qui se traduisent directement par une meilleure fidélité de l’image sur les reflets et les détails fins.

Le gaussian splatting peut-il remplacer une visite virtuelle 360° ?

Pour une diffusion rapide sur navigateur, sans budget de reconstruction important, la visite 360° reste le choix le plus simple. Le gaussian splatting s’impose dès que vous avez besoin d’une navigation libre dans l’espace plutôt que d’une téléportation entre points fixes, présentation immobilière, médiation patrimoniale ou documentation industrielle. La différence se joue sur la liberté de déplacement et le réalisme des matières, pas uniquement sur le réalisme visuel global : choisissez le gaussian splatting pour une scène 3D navigable en temps réel et la visite 360° pour une diffusion sans reconstruction préalable.