Quand une marque commande de « l’animation 3D » aujourd’hui, elle peut recevoir deux choses bien différentes. D’un côté, des actifs numériques : un produit modélisé ou une mascotte articulée qu’on peut poser, éclairer et rendre sous n’importe quel angle, autant de fois qu’il le faut. De l’autre, une vidéo générée qui ressemble à un film d’animation de studio et qui ne contient aucune 3D. Les deux se vendent sous le même nom, et l’IA intervient dans les deux.
En novembre 2023, le cofondateur de DreamWorks, Jeffrey Katzenberg, déclarait lors d’un panel de Bloomberg qu’un long métrage d’animation qui exigeait jadis 500 artistes pendant cinq ans en demanderait moins de 10 % d’ici trois ans, selon Cartoon Brew. C’était une prévision, et son horizon de trois ans arrive à échéance en novembre 2026. Peu importe le verdict, l’IA est entrée dans la chaîne 3D une étape à la fois, et savoir où elle se trouve dit à une marque ce qu’elle achète vraiment.
Six étapes, chacune un fichier qu’on peut rouvrir
Un film 3D de studio passe par une chaîne de départements. Les modeleurs construisent les formes en maillages. Les spécialistes du rigging leur donnent un squelette et des contrôles. La mise en place positionne la caméra virtuelle et bloque chaque plan. Les animateurs font jouer les personnages, pose après pose. L’éclairage et les effets fixent le look, puis le rendu calcule les images finales.
C’est au rendu que les chiffres s’envolent. GamesBeat rapportait en 2013 que chaque image d’Université des monstres avait demandé 29 heures de rendu, sur une ferme de 2 000 ordinateurs et plus de 24 000 cœurs, pour plus de 100 millions d’heures-processeur au total. Un reportage de befores & afters sur Élémentaire (2023) compte plus de 151 000 cœurs, contre 294 pour Histoire de jouets.
Ce coût achète quelque chose de précis : chaque étape laisse un fichier derrière elle. Si le client veut que la mascotte salue de l’autre main, un animateur modifie l’animation, et le modèle, le rig et les lumières ne bougent pas. Cette séparation, c’est ce qu’une marque doit protéger quand l’IA entre dans la chaîne, et c’est justement ce que la vidéo générée abandonne.
Là où l’apprentissage automatique travaille déjà
L’IA est d’abord arrivée par la dernière étape. Le rendu par lancer de chemins laisse du grain dans l’image, à moins de calculer un nombre énorme d’échantillons de lumière. Dans un article présenté à SIGGRAPH en 2017, des chercheurs de Disney Research et de Pixar ont entraîné un réseau de neurones sur des images de Trouver Doris pour retirer ce bruit, avec des résultats montrés sur Les Bagnoles 3. Moins d’échantillons plus un débruiteur appris, ça donne moins d’heures par image.
Pixar est allé plus loin avec Élémentaire. Ses personnages de feu étaient simulés comme de vrais volumes, puis poussés vers des images peintes par les artistes du studio grâce à un transfert de style neuronal volumétrique, calculé sur une ferme de processeurs graphiques achetée pour l’occasion. Le superviseur des effets visuels Sanjay Bakshi a confié à befores & afters que le résultat était « plus organisé, plus illustratif ». Les cibles de style étaient les propres peintures du studio.
La chaîne 3D, et où l’IA donne un coup de main
Six étapes d’une production 3D de studio, avec le travail d’apprentissage automatique documenté à chacune
| Étape | Aide de l’IA |
|---|---|
| Modélisation | Maillages préliminaires générés à partir de texte ou d’images |
| Rigging | Squelette et poids de peau prédits |
| Mise en place | Scénarimages générés et blocage sommaire |
| Animation | Mouvement extrait d’une vidéo ; intervalles remplis entre les poses clés |
| Éclairage et effets | Transfert de style sur les simulations |
| Rendu | Débruitage appris avec moins d’échantillons |
| Vidéo générée au look 3D | De la consigne aux images, sans maillage, rig ni fichier de scène |
Les étapes du milieu sont celles où la recherche retire le travail répétitif. Un article de SIGGRAPH 2020 de l’Université du Massachusetts à Amherst prédisait un squelette et des poids de peau directement à partir du maillage d’un personnage, la première tâche du spécialiste du rigging. La même année, La Forge, le groupe de recherche d’Ubisoft, présentait un réseau qui remplit le mouvement entre les poses clés d’un animateur, dans le but d’alléger sa charge de travail. En mai 2024, Autodesk a acheté une jeune pousse dont le logiciel extrait la capture de mouvement d’une vidéo ordinaire et l’applique à un personnage de synthèse.
Chacun de ces outils redonne son résultat à une étape modifiable : un rig qu’un animateur peut corriger, des clés qu’on peut déplacer, une image débruitée tirée d’une scène qui existe toujours.
Générer le modèle lui-même
C’est en modélisation que la génération va le plus loin. En 2022, des chercheurs de Google Research et de UC Berkeley ont présenté une méthode qui construit un objet 3D à partir d’une consigne texte en se servant seulement d’un modèle d’images 2D, sans aucune donnée d’entraînement 3D, puis l’exporte en maillage pour les logiciels 3D courants. Des méthodes image-vers-3D ont suivi. Dans son rapport de septembre 2024, The Animation Guild estimait qu’on pouvait générer des modèles 3D à partir d’images et de concepts « à un niveau de base ».
Pour une marque, l’écart entre « de base » et « prêt pour la production », c’est tout le travail. Un maillage généré arrive souvent avec une géométrie brouillonne, des pièces fusionnées et un éclairage incrusté dans les textures, ce qui complique le rig ou un nouvel éclairage. Un produit a aussi des dimensions exactes : une bouteille générée peut avoir l’air juste et rater le filet du bouchon ou la courbe de l’étiquette. La voie la plus sûre part des données CAO du fabricant et réserve les maillages générés aux accessoires, aux arrière-plans et aux premières ébauches.
De la vidéo qui a l’air 3D sans l’être
L’autre branche saute toute la chaîne. Si on lui demande une mascotte animée bien lustrée, un modèle vidéo produit des images qui ont l’air rendues, avec des ombres douces et des textures moelleuses, mais il ne construit jamais de maillage, de rig ni de lumière. Il prédit des pixels, et il ne reste rien à rouvrir.
La vitesse, elle, est bien réelle. Un extrait de concept, un test d’ambiance ou un court contenu social peut exister en une journée. Mais un nouvel angle de caméra exige une nouvelle génération, et le personnage peut revenir avec un bouton de plus ou une oreille plus longue. D’un plan à l’autre, il faut fournir des images de référence au modèle chaque fois pour garder le design, et le produit dans la main de la mascotte est redessiné à chaque image.
Les deux branches peuvent se rejoindre. Une équipe peut rendre la vraie mascotte ou le vrai produit 3D dans des poses clés et se servir de ces images comme références ou comme premières images de génération, ou encore intégrer un produit rendu dans une scène générée. L’actif 3D ancre ce qui doit être exact, et la génération apporte la vitesse au reste.
Ce qu’ont signé les animateurs
Les gens qui font tourner la chaîne traditionnelle ont inscrit l’IA dans leur convention collective. En décembre 2024, les membres de The Animation Guild, le syndicat hollywoodien de l’animation, ont ratifié une entente 2024-2027 à 76,1 %, rapportait Cartoon Brew. Sa définition de l’IA générative inclut explicitement les modèles 3D, aux côtés du texte, de la vidéo et des images.
Les clauses laissent de la latitude aux studios. Un producteur « peut exiger des employés qu’ils utilisent tout système d’IA » pour le travail couvert, mais doit donner un préavis écrit quand l’IA générative risque d’être exigée, et consulter l’employé qui le demande, y compris sur d’autres approches possibles. Les consignes rédigées par un employé ne peuvent servir à déplacer un travailleur couvert, et un arbitre ne peut pas interdire l’usage de l’IA. Le réalisateur Michael Rianda, cité par Cartoon Brew, jugeait les protections contre l’IA et la sous-traitance « pas assez fortes ». Le rapport 2024 du syndicat range la modélisation 3D, le rigging et l’animation parmi les métiers les plus exposés.
Une marque qui embauche un studio 3D peut donc acheter un travail fait avec l’IA selon des règles qu’elle ne voit jamais. Demander quelles étapes y ont eu recours est une question juste et normale.
Choisir la bonne sorte de 3D
Partez de la durée de vie de l’actif. Un produit qui apparaîtra pendant des années dans des pubs, des vues 360° de boutique en ligne et des maquettes d’emballage mérite un vrai modèle 3D, construit à partir de la CAO si possible, parce que chaque plan futur le réutilisera. Une mascotte appelée à porter des campagnes et à jouer de nouveaux scénarios mérite un modèle et un rig, et l’IA peut accélérer son rigging, ses intervalles et son rendu sans qu’on perde le contrôle. Un extrait social ponctuel ou un concept de présentation peut être de la vidéo générée, idéalement guidée par des rendus de l’actif réel.
Avant de signer, posez quatre questions. Allez-vous livrer les fichiers sources (maillage, rig, textures), et à qui appartiennent-ils ? Quelles parties ont été générées, et qui les a nettoyées ? Pouvez-vous rendre un nouvel angle sans régénérer le plan ? La géométrie du produit vient-elle de nos propres données ? Un vrai actif 3D se réutilise ; un extrait généré est une suite d’images terminée. Les deux ont leur place quand l’acheteur sait lequel figure sur la facture.
Sources
- AI Will Cut Animation Labor And Production Time By 90% Says Former Dreamworks Animation CEO Jeffrey Katzenberg (Jamie Lang, Cartoon Brew, 9 novembre 2023, en anglais)
- How Pixar made Monsters University, its latest technological marvel (Dean Takahashi, GamesBeat, 24 avril 2013, en anglais)
- The AI, volumetric and animation tools that helped make Pixar’s ‘Elemental’ possible (Ian Failes, befores & afters, 30 juin 2023, en anglais)
- How Disney and Pixar’s ‘Elemental’ Utilizes New Technology to Bring Its Complex Characters to Life (The Walt Disney Company, 2023, en anglais)
- Kernel-Predicting Convolutional Networks for Denoising Monte Carlo Renderings (Bako et al., Disney Research, ACM SIGGRAPH 2017, en anglais)
- RigNet: Neural Rigging for Articulated Characters (Xu et al., Université du Massachusetts à Amherst, SIGGRAPH 2020, en anglais)
- Robust Motion In-betweening (Harvey et al., Ubisoft La Forge, SIGGRAPH 2020, en anglais)
- Autodesk acquires AI-powered VFX startup (Devin Coldewey, TechCrunch, 21 mai 2024, en anglais)
- Text-to-3D using 2D Diffusion (Poole, Jain, Barron, Mildenhall, Google Research et UC Berkeley, 2022, en anglais)
- Critical Crossroads: The Impact of Generative AI and the Importance of Protecting the Animation Workforce (The Animation Guild, septembre 2024, en anglais)
- Memorandum of Agreement, Local 839 TAG et AMPTP, point 14 : intelligence artificielle (The Animation Guild, signé en décembre 2024, en anglais)
- Despite A Large Number Of Detractors, Animation Guild Members Ratify New Contract (Cartoon Brew, 23 décembre 2024, en anglais)