Le workflow de production du Gaussian splatting, de la captation à la publication
Un Gaussian splat est le bout d’une chaîne. À un bout, on entre des photos ; à l’autre, on obtient un fichier assez léger pour s’ouvrir sur un téléphone, depuis un lien ou un QR code, avec le réalisme d’une photographie. Entre les deux, six étapes, chacune avec ses outils et ses façons de mal tourner : captation, poses des caméras, entraînement, nettoyage, compression et publication.
Cet article les parcourt une par une, telles qu’on les pratique en 2026, avec les poids que nous avons mesurés sur une vraie scène. Si la technique elle-même est nouvelle pour vous, commencez par ce qu’est le Gaussian splatting : ici, on suppose acquis qu’un splat est un nuage de petites ellipsoïdes douces et colorées, apprises à partir de photos.
Des photos au splat publié
Captation
Photographier ou filmer le sujet sous tous ses angles, avec beaucoup de recouvrement et des réglages qui ne bougent jamais.
- Entrée
- Le sujet, sur un plateau tournant ou avec de la place pour en faire le tourUne pièce à l’éclairage stableUn bâtiment ou un site, et une autorisation de vol
- Sortie
- 50 à 200 photos pour un petit objet — 427 pour notre cactus200 à 500 photos ou plus, ou une vidéo lenteDes milliers de photos aériennes — 20 169 pour un campus de 3,7 km²
- Outils
- Hybride ou téléphone, exposition verrouillée ; un plateau tournantAppareil photo, caméra 360 ou scanner LiDAR portatifDrone de cartographie en plan de vol automatique, plus des photos au sol des façades
- Durée
- Environ 30 minutes1 à 2 heuresUne demi-journée ou plus
Poses des caméras
Retrouver d’où chaque photo a été prise, et un premier nuage de points 3D, clairsemé.
- Entrée
- Les photosLes photos ou les images de la vidéoLes photos aériennes, les positions GPS/RTK, les points de contrôle au sol
- Sortie
- Positions des caméras et nuage de points clairseméPositions des caméras et nuage de points clairseméPositions des caméras géoréférencées
- Outils
- COLMAP, RealityScan, MetashapeCOLMAP, RealityScan — ou la trajectoire du scanner lui-mêmeDJI Terra, RealityScan, Metashape
- Durée
- Quelques minutesDe quelques minutes à une heureQuelques heures
Entraînement
Optimiser les gaussiennes — position, forme, couleur, opacité — jusqu’à ce que leur rendu corresponde à chaque photo.
- Entrée
- Photos et positions des camérasPhotos et positions des camérasPhotos et positions des caméras
- Sortie
- Un splat brut : 139 410 gaussiennes, un PLY de 32,9 Mo pour notre cactus1 à quelques millions de gaussiennes, des centaines de MoDes dizaines de millions de gaussiennes — 110 millions sur ce campus
- Outils
- Postshot, LichtFeld Studio, Brush, gsplatLes mêmes, avec un modèle d’exposition pour la lumière qui varieDJI Terra, Varjo Teleport, XGRIDS LCC Studio
- Durée
- 15 à 40 minutes sur une carte graphique récenteUne à plusieurs heuresDe quelques heures à quelques jours
Nettoyage
Supprimer les floaters et tout ce qui n’est pas le sujet ; régler l’échelle, l’orientation, la couleur.
- Entrée
- Le splat brutLe splat brut, parfois plusieurs captationsLe splat brut
- Sortie
- Le sujet seul, droit et à l’échelleUne pièce propre : floaters et voiles supprimés, captations fusionnéesUn site recadré et géoréférencé
- Outils
- SuperSplat dans le navigateur, SplatTransform en ligne de commandeSuperSplat, SplatTransformFiltres de SplatTransform, SuperSplat, le logiciel du drone
- Durée
- De 15 minutes à une heure1 à 3 heuresQuelques heures
Compression
Rendre le fichier assez léger pour être diffusé : moins de détail de couleur, valeurs quantifiées, parfois des niveaux de détail.
- Entrée
- Le PLY nettoyéLe PLY nettoyéLe PLY nettoyé
- Sortie
- SPZ, 3,6 Mo, ou SOG, 4,4 Mo — mesurés sur notre cactusQuelques dizaines de Mo en SOG ou SPZDes niveaux de détail diffusés en continu : Streamed SOG, RAD de Spark, 3D Tiles, LCC
- Outils
- SplatTransform, SuperSplat, PostshotSplatTransform, SuperSplatSplatTransform, Spark, Cesium, LCC Studio
- Durée
- Quelques secondesDe quelques secondes à quelques minutesDe quelques minutes à quelques heures
Publication
Mettre la scène devant le public : une page web, une application, un casque, un moteur de jeu.
- Entrée
- Un fichier SOG ou SPZUn fichier compresséDes tuiles diffusées en continu
- Sortie
- Une visionneuse ouverte depuis un lien ou un QR codeUne visite avec points d’intérêt, dans le navigateur ou un casqueUn jumeau numérique dans une carte ou un moteur
- Outils
- PlayCanvas et SuperSplat, Spark (three.js), Babylon.jsLes mêmes, plus Unreal Engine ou Apple RealityKitCesiumJS, Cesium for Unreal, glTF
- Durée
- Quelques heuresQuelques joursDe quelques jours à quelques semaines
Les six étapes d’une production en Gaussian splatting, chacune avec un dessin animé et quatre informations — ce qui entre, ce qui sort, les outils, la durée — pour trois types de projet : un objet, un intérieur, un site survolé en drone.
Choisissez un type de projet, puis parcourez les étapes : les chiffres changent avec l’échelle. Ceux de l’objet sont ceux de notre scène du cactus, captée par Steam Studio et publiée sous licence CC0 ; ceux du campus viennent d’une démonstration de Cesium ; les nombres de photos suivent le guide de prise de vue de PlayCanvas. Les durées sont des ordres de grandeur tirés de ces sources et de nos propres productions : elles varient beaucoup avec le matériel et le soin apporté.
1. La captation : tout se joue ici
Aucune étape suivante ne peut inventer ce que les photos n’ont pas vu. C’est donc à la captation que se décident l’essentiel de la qualité — et l’essentiel des problèmes.
Les règles sont celles de la photogrammétrie. Le recouvrement : chaque photo doit partager 70 à 80 % de son contenu avec sa voisine sur la même couronne, et 60 à 70 % avec la couronne du dessus ou du dessous. Plusieurs hauteurs : au moins trois couronnes de prises de vue, du bas vers le haut, pour que le dessus et le dessous du sujet soient vus. Des réglages fixes : exposition, ouverture, ISO, balance des blancs et mise au point restent les mêmes de la première à la dernière photo, donc en mode manuel. La netteté : une vitesse d’obturation assez rapide pour exclure le flou de bougé ; selon les guides, les recommandations vont de 1/125 s à 1/500 s. Et une lumière douce et régulière : un ciel couvert en extérieur, des lumières diffusées en intérieur.
Combien de photos ? PlayCanvas propose 50 à 100 pour un petit objet, 100 à 200 pour un objet moyen, 200 à 500 ou plus pour une grande scène. Plus n’est pas toujours mieux : ce qui compte, c’est la variété des points de vue, pas le nombre d’images presque identiques. La vidéo fonctionne aussi, à condition d’en extraire les images et d’écarter les floues.
La version la plus extrême d’une captation : une cage d’appareils photo et de lumières synchronisés, qui prend tous les points de vue à la fois. Pour la plupart des projets, un seul appareil déplacé patiemment autour du sujet fait le même travail, une photo après l’autre.
Image : ESPER HQ, CC BY 2.0, via Wikimedia Commons (redimensionnée, convertie en WebP).Le choix de l’appareil — téléphone, appareil photo, caméra 360, scanner LiDAR portatif, drone — mérite un article à lui seul : c’est le sujet du prochain volet de cette série. Il compte surtout pour ce que la captation garantit, comme une échelle exacte ; nous l’avons traité dans iPhone, caméra 360 ou LiDAR : ce que votre captation garantit.
Pour un bâtiment ou un site, l’appareil prend de la hauteur. Les logiciels de cartographie par drone envoient désormais les photos directement à l’entraînement du splat — DJI Terra depuis sa version 5.0, en juillet 2025 — et Varjo Teleport, depuis mai 2026, fait même voler le drone selon un plan automatique.
Image : C.Stadler/Bwag, CC BY-SA 4.0, via Wikimedia Commons (redimensionnée, convertie en WebP).2. Les poses des caméras : où chaque photo a-t-elle été prise ?
Avant d’apprendre quoi que ce soit, l’entraînement doit savoir, pour chaque photo, où se trouvait l’appareil et vers où il visait. C’est le travail de la structure from motion (SfM, « structure par le mouvement ») : le logiciel retrouve les mêmes détails sur plusieurs photos, puis calcule à la fois les positions des caméras et un nuage clairsemé de points 3D. Ce nuage est le point de départ du splat : chaque point devient une première gaussienne.
L’outil de référence est COLMAP, open source, qui a beaucoup changé en 2026 : la version 4.0 (mars) a intégré GLOMAP, une méthode « globale » que ses auteurs ont trouvée environ dix fois plus rapide que la méthode incrémentale classique, ainsi que des descripteurs appris ; la 4.1 (juin) a ajouté l’ajustement de faisceaux sur carte graphique et les cartes AMD. Des outils commerciaux comme RealityScan d’Epic (ex-RealityCapture) et Agisoft Metashape résolvent le même problème et exportent leur résultat au format COLMAP, que tous les outils d’entraînement savent lire.
Ce que produit la structure from motion, ici dans le logiciel libre Regard3D : 33 des 36 photos placées, et 5 925 points qui dessinent la façade d’un château. C’est peu — mais assez pour commencer l’entraînement.
Image : Engelbert Niehaus, CC BY 4.0, via Wikimedia Commons (recadrée, convertie en WebP).Une famille de méthodes plus récente, menée par VGGT (Meta et Oxford, CVPR 2025), estime les caméras en une seule passe d’un réseau de neurones, en moins d’une seconde. En 2026, on les trouve surtout dans des pipelines de recherche et pour des captations à peu de photos ; en production, les solveurs de type COLMAP restent la règle.
Un scanner LiDAR portatif ou un drone à positionnement RTK simplifie cette étape : l’appareil connaît déjà sa trajectoire, et le solveur ne fait que l’affiner.
3. L’entraînement : les gaussiennes apprennent
L’entraînement part du nuage clairsemé et ajuste, sur des dizaines de milliers d’itérations, la position, la forme, la couleur et l’opacité de chaque gaussienne, jusqu’à ce que le rendu depuis chaque caméra corresponde à sa photo. En chemin, il clone et divise des gaussiennes là où le détail manque, et supprime celles qui ne servent à rien ; le premier article de cette série le montre pas à pas.
Les outils de bureau les plus utilisés en 2026 :
- Postshot (Jawset), commercial, Windows avec une carte NVIDIA ; sorti de bêta en août 2025, avec des plugins pour Unreal Engine et After Effects.
- LichtFeld Studio, open source, NVIDIA ; gère les objectifs très déformants et les changements d’exposition.
- Brush, open source, qui tourne presque partout — Mac, AMD, Android, et même le navigateur — grâce à WebGPU.
- gsplat, la bibliothèque derrière Nerfstudio, pour qui écrit son propre pipeline.
Sur téléphone, Scaniverse entraîne le splat sur l’appareil lui-même, en moins de 90 secondes, et Polycam le fait dans le cloud. Pour les drones et les scanners, les logiciels des fabricants (DJI Terra, XGRIDS LCC Studio) ou des plateformes cloud (Varjo Teleport) enchaînent poses et entraînement.
Combien de temps faut-il ? Sur les scènes de référence Mip-NeRF 360, la bibliothèque gsplat entraîne les 30 000 itérations standard en 36 minutes environ sur une carte graphique TITAN RTX, avec 5,7 Go de mémoire, et une scène plafonnée à un million de gaussiennes en 15 minutes sur une A100 (mesures de gsplat). Les réglages qui comptent le plus sont le nombre maximal de gaussiennes — les entraîneurs « MCMC », plus récents, permettent de le fixer directement, ce qui fixe à l’avance le poids du fichier —, le nombre d’itérations (autour de 7 000 pour un aperçu, 30 000 pour le résultat final) et le degré des harmoniques sphériques, qui codent la façon dont la couleur change avec l’angle de vue.
La version de mai 2026 de Postshot, présentée par son éditeur (en anglais) : profils d’entraînement, entraînement sur une région d’intérêt et formats d’export.
Vidéo : Jawset, sur YouTube.4. Le nettoyage : ce que l’entraînement a raté
Un splat brut n’est jamais prêt à montrer. Autour du sujet flottent des floaters, des taches que l’entraînement a créées pour expliquer une zone qu’il a mal vue ; l’arrière-plan, le sol, les pieds de l’opérateur sont encore là ; la scène est penchée, décentrée, à une échelle arbitraire.
L’outil de référence de cette étape est SuperSplat, l’éditeur de PlayCanvas, gratuit, open source et qui tourne dans le navigateur. On y sélectionne des gaussiennes au pinceau, au lasso, avec une boîte ou une sphère, on les supprime sans perdre l’historique d’annulation, on fusionne plusieurs captations, on corrige la couleur et on règle l’orientation. La version 3.0, en septembre 2026, a été reconstruite sur WebGPU : elle ouvre des scènes de dizaines de millions de splats, et applique une correction de couleur à une simple sélection.
SuperSplat 3.0, présenté par PlayCanvas en septembre 2026 (en anglais).
Vidéo : PlayCanvas, sur YouTube.Pour le travail en série, SplatTransform, du même éditeur, fait la même chose en ligne de commande : recadrer dans une boîte ou une sphère, filtrer par opacité ou par taille, supprimer automatiquement les floaters et les amas isolés, fusionner, décimer. C’est l’outil avec lequel nous avons mesuré les poids ci-dessous.
5. La compression : de cent mégaoctets à quelques-uns
Le fichier brut qui sort de l’entraînement est un PLY : 59 nombres par gaussienne, chacun stocké sur 4 octets, soit 236 octets par splat. Sur ces 59 nombres, 45 décrivent la façon dont la couleur change avec l’angle (les harmoniques sphériques de degré 3). Un million de splats pèsent 236 Mo : bien trop pour un téléphone.
Deux familles de formats règlent le problème. SPZ, publié par Niantic sous licence MIT, quantifie chaque valeur sur quelques bits puis compresse l’ensemble ; sa version 4, en mai 2026, encode trois à cinq fois plus vite. SOG, publié en open source par PlayCanvas en septembre 2025, range les gaussiennes dans des images WebP que la carte graphique lit directement, avec une palette pour les couleurs. Plutôt que de répéter les ratios des éditeurs, nous les avons mesurés.
Ce que pèse la scène, format par format
Mesuré : notre cactus, 139 410 splats
La même scène convertie avec SplatTransform de PlayCanvas (v2.7.1). « SH 3 » garde toute la couleur qui change avec l’angle ; « SH 0 » garde une seule couleur par splat.
À titre de comparaison, les 427 photos d’origine pèsent environ 7,8 Go — 236 fois le PLY brut.
Estimation : votre scène
Extrapolé à partir de nos deux versions mesurées de la scène (139 410 et 204 684 splats). PLY et glTF sont exacts ; SPZ et SOG sont des estimations.
Dans le million de splats que PlayCanvas recommande sur téléphone.
Diagramme en barres des poids mesurés d’une même scène de 139 410 gaussiennes dans six formats, puis un calculateur qui estime le poids de chaque format pour un nombre de splats et un niveau de détail de couleur choisis.
Sur notre cactus, SPZ divise le PLY brut par 9 et SOG par 7 avec tout le détail de couleur ; en abandonnant la couleur qui change avec l’angle (SH 0), SOG descend à 1,8 Mo, 18 fois moins. SOG gagne moins sur une petite scène à cause de sa palette de couleurs, d’environ 2,3 Mo dans nos mesures, qui ne grossit pas avec le nombre de splats : à l’échelle des millions, le ratio remonte vers les « 15 à 20 fois » annoncés par PlayCanvas. Les formats compressés perdent un peu de précision ; le gain en vaut presque toujours la peine.
Au-delà de quelques millions de gaussiennes — un bâtiment, une rue, un site —, un seul fichier ne suffit plus, quel que soit son format. On découpe alors la scène en niveaux de détail diffusés en continu selon le point de vue, comme les tuiles d’une carte : Streamed SOG chez PlayCanvas, le format RAD de Spark 2.0 (World Labs, avril 2026), le format ouvert LCC de XGRIDS, ou les 3D Tiles de Cesium, qui diffusent 110 millions de splats sur 3,7 km².
Et pour échanger des fichiers entre outils, le standard est désormais glTF : son extension KHR_gaussian_splatting, portée par le Khronos Group avec notamment Cesium, Esri, Niantic, NVIDIA et XGRIDS, a été ratifiée en 2026. Elle définit où vont les données, pas comment les compresser ; une extension de compression SPZ est encore en cours de rédaction.
6. La publication : là où le public la verra
La dernière étape dépend de l’endroit où la scène va vivre.
- Sur le web, sans application : le moteur PlayCanvas et sa visionneuse SuperSplat, Spark pour three.js, Babylon.js et CesiumJS affichent tous des splats dans le navigateur, sur téléphone comme sur ordinateur. WebXR ajoute la réalité augmentée et virtuelle sur Android et dans les casques.
- Dans un moteur de jeu : Unreal Engine via des plugins (celui de Postshot, Volinga, XScene), Cesium for Unreal pour les scènes géoréférencées.
- Sur les appareils Apple : depuis la WWDC 2026, RealityKit affiche nativement les splats sur iPhone, iPad, Mac et Vision Pro.
C’est ici que le budget compte : PlayCanvas recommande environ un million de splats sur téléphone, et trois millions ou plus sur ordinateur. Une scène qui dépasse doit être diffusée en continu, ou entraînée avec un budget plus petit dès le départ — d’où l’intérêt de fixer le plafond de gaussiennes dès l’étape 3.
Combien de temps dure un projet ?
Peu de chiffres indépendants existent. Les studios qui en publient s’accordent sur des ordres de grandeur : environ une journée pour un objet, une semaine pour un intérieur, deux à trois semaines pour un grand extérieur, et plusieurs semaines de plus quand il faut développer une visionneuse sur mesure (Utsubo, qui vend ces services : à prendre comme des estimations). Le temps machine est devenu la plus petite part : l’essentiel part dans la préparation de la captation, le nettoyage et l’intégration.
Contrôle qualité : les six défauts les plus fréquents
Diagnostiquer un défaut
Floaters
- Ce qu’on voit
- Des taches ou des voiles suspendus dans l’air, surtout devant le trajet de la caméra et en intérieur.
- Pourquoi
- Trop peu de vues d’une zone, ou une surface que l’entraînement n’a pas su expliquer : il la « peint » avec des gaussiennes égarées.
- Évité à l’étape
- Captation, puis nettoyage
- Correction
- Plus de recouvrement à la prise de vue ; ensuite, les sélectionner et les supprimer (SuperSplat), ou les filtrer automatiquement (filtres floaters et clusters de SplatTransform).
Flou hors trajectoire
- Ce qu’on voit
- Net depuis là où les photos ont été prises, flou dès qu’on s’écarte de cette trajectoire.
- Pourquoi
- Un splat ne connaît que les points de vue qu’il a vus. Entre eux ou au-delà, il devine.
- Évité à l’étape
- Captation
- Correction
- Photographier à plusieurs hauteurs et sur tout le tour ; dans la visionneuse, garder la caméra dans la zone captée.
Fantômes
- Ce qu’on voit
- Des personnes, des voitures ou des feuillages semi-transparents.
- Pourquoi
- Quelque chose a bougé pendant la captation : il est sur certaines photos et pas sur d’autres.
- Évité à l’étape
- Captation
- Correction
- Photographier quand le lieu est vide ; masquer les objets mobiles sur les photos avant l’entraînement ; supprimer ce qui reste.
Taches
- Ce qu’on voit
- Des plages de couleur ou de luminosité qui changent d’un angle à l’autre.
- Pourquoi
- L’exposition ou la balance des blancs a changé entre les photos, ou la lumière elle-même.
- Évité à l’étape
- Captation, puis entraînement
- Correction
- Verrouiller exposition, balance des blancs et mise au point ; entraîner avec un modèle d’apparence (par exemple la grille bilatérale de LichtFeld Studio et gsplat).
Verre et miroirs
- Ce qu’on voit
- Des reflets qui flottent à l’intérieur de l’objet, des surfaces transparentes pleines de brouillard.
- Pourquoi
- Un reflet bouge avec le point de vue ; l’entraînement l’explique en plaçant des gaussiennes derrière la surface.
- Évité à l’étape
- Captation, puis nettoyage
- Correction
- Atténuer les reflets (filtre polarisant, spray matifiant quand c’est permis) ou masquer les zones à problème ; c’est encore un sujet de recherche.
Trous
- Ce qu’on voit
- Des parties absentes : le dessus d’un objet, un plafond, le dessous d’une table.
- Pourquoi
- Aucune photo n’a jamais vu ces surfaces.
- Évité à l’étape
- Captation
- Correction
- Ajouter une couronne de prises de vue par le haut (ou par le bas) ; pour un site, ajouter des passages obliques en drone et des photos au sol.
Six défauts fréquents d’un Gaussian splat, chacun avec un dessin animé et quatre informations : ce qu’on voit, pourquoi, l’étape où on l’évite, et la correction.
Presque tous les défauts s’évitent à la captation, et presque aucun ne se répare complètement après coup : le nettoyage enlève ce qui est faux, il n’ajoute pas ce qui manque. D’où l’intérêt de vérifier les photos — netteté, recouvrement, exposition — avant de quitter les lieux.
Avant la livraison, une courte liste de contrôle : le nombre de splats face au budget de l’appareil visé ; le poids du fichier et le temps avant la première image ; le détail de couleur conservé (SH 0 à 3) ; les floaters, depuis tous les angles que permet la visionneuse ; et, pour les grandes scènes, le comportement des niveaux de détail quand on se déplace vite.
Chez ARGO
Tout ce que nous construisons tourne dans le navigateur, sans application à installer : les deux dernières étapes pèsent donc le plus lourd pour nous. Un splat n’est utile que s’il s’ouvre en quelques secondes sur le téléphone du visiteur, depuis un QR code sur un packaging, un imprimé ou un stand. Concrètement, cela veut dire fixer le budget de gaussiennes dès la captation, nettoyer à la main, et livrer dans un format compressé adapté aux téléphones visés.
FAQ
Questions fréquentes
Sources et pour aller plus loin
- PlayCanvas, Taking photos for Gaussian splatting · Performance et budgets de splats · Format SOG · SuperSplat 3.0 · SplatTransform
- Historique des versions de COLMAP · Pan et al., Global Structure-from-Motion Revisited (GLOMAP), arXiv:2407.20219 · Wang et al., VGGT, arXiv:2503.11651
- Kerbl et al., 3D Gaussian Splatting for Real-Time Radiance Field Rendering, SIGGRAPH 2023 — arXiv:2308.04079 · Mesures de gsplat · Kheradmand et al., 3D Gaussian Splatting as Markov Chain Monte Carlo, arXiv:2404.09591
- Niantic Spatial, SPZ 4 · Khronos Group, KHR_gaussian_splatting · World Labs, Spark 2.0 · Cesium, 3D Gaussian splats with levels of detail
- La scène mesurée dans cet article : Steam Studio, données d’exemple du cactus, CC0 — steam-studio.jp
Chiffres et statuts vérifiés en septembre 2026. Poids de fichiers mesurés le 30 septembre 2026.