Sur un plateau, on éclaire l’espace une fois, puis on tourne le large, le moyen, les plans isolés et l’insert à l’intérieur de ce même dispositif. On triche les lampes entre les installations, mais on ne brise jamais la logique : la fenêtre est encore à gauche caméra dans le champ inverse.
La vidéo IA n’a pas d’équivalent. Chaque génération est un échantillon indépendant. Le modèle ne garde pas votre scène en mémoire entre les appels, il redéduit chaque fois un état d’éclairage plausible à partir de votre prompt. Tout ce que vous n’avez pas épinglé est retiré au hasard, et l’éclairage est très dimensionnel et rarement spécifié : il dérive fort.
Lightricks le dit dans sa propre documentation, à propos des coupes à l’intérieur d’une même génération : « Répétez l’échelle, l’angle, le cadrage et tout changement d’éclairage à la coupe. Le modèle n’hérite pas du dispositif du plan précédent. » Entre des générations séparées, c’est strictement pire.
Le vocabulaire du métier est l’outil, pas les lampes
Aucun des termes classiques de direction photo ne perd son utilité. Ce qui change, c’est leur fonction. Vous n’instruisez pas un chef électricien, vous bâtissez un vocabulaire contrôlé que vous pouvez répéter à l’identique d’un prompt à l’autre.
- Principale, déboucheuse, contre-jour. Pas des lampes qu’on installe, mais trois rôles assez précis pour être resservis mot pour mot.
- Motivation. Chaque lumière explicable par une source dans la scène. C’est l’idée la plus transférable, parce que la motivation est un fait du monde qu’on écrit une fois. « Ambiance sombre » est un fait sur vos émotions et ne se répète pas.
- Température de couleur en kelvins. Lampes tungstène autour de 2700 à 3200 K, lumière du jour autour de 5600 K. C’est le mélange de températures qui fait qu’un intérieur se lit comme réel.
- Direction, relative à la caméra. Gauche caméra, droite caméra. Le repère caméra est celui qui survit à l’écriture dans un prompt.
- Qualité. Dure ou douce, gouvernée par la taille de la source par rapport au sujet.
- Rapport de contraste. Nommer un 3:1 ou un 8:1 est plus reproductible que nommer une ambiance.
Remarquez que lorsque les laboratoires écrivent leurs propres bons exemples, c’est exactement ce qu’ils écrivent. Le guide de Sora 2 chez OpenAI oppose un vague « bien éclairé » à « lumière douce de fenêtre avec déboucheuse chaude de lampe et un liseré froid venant du couloir ». C’est une principale, une déboucheuse et un liseré, en français clair. Les exemples Veo de Google nomment « des néons crus au plafond et la lueur verte du moniteur monochrome », soit un intérieur à sources multiples décrit par source et par couleur.
Le meilleur exemple de chaque laboratoire nomme une source, une direction et une couleur. Aucun ne nomme un adjectif.
Où l’éclairage se place dans un prompt
C’est devenu un champ à part entière dans plusieurs structures de prompt publiées. Le gabarit de Sora 2 porte une ligne dédiée : Lighting + palette : [qualité, direction, sources de couleur précises]. La structure de Seedance 2.5 a un bloc LIGHTING étiqueté, spécifié par source motivée, direction et comportement sur les surfaces. La formule publiée de Kling nomme l’éclairage explicitement, même si son vocabulaire documenté est mince et reste au niveau de l’ambiance.
Une exception notable, et elle va à l’encontre de la pratique courante. Le guide vidéo Gen-4 de Runway ne contient aucun vocabulaire d’éclairage, au motif déclaré que l’image d’entrée porte déjà la couleur et la lumière et que le texte devrait décrire le mouvement. Il va plus loin : répéter des éléments déjà présents dans l’image « peut mener à un mouvement réduit ou à des résultats inattendus ». En image-vers-vidéo chez Runway, répéter votre bloc d’éclairage n’est pas redondant, ça peut activement coûter en qualité de mouvement. Il n’y a pas de règle universelle unique ici.
Ce qui tient réellement la continuité
Par ordre décroissant de qualité de documentation.
- L’extension, conditionnée sur de vraies images. Le mécanisme le plus solide disponible, parce que le modèle regarde des images plutôt que de les réimaginer. L’extension de Veo 3.1 se conditionne sur la dernière seconde de vidéo. La limite est fondamentale : l’extension achète de la continuité le long d’un plan, pas à travers une coupe. Elle ne règle pas la couverture.
- Le conditionnement première et dernière image. Documenté, étroit, efficace pour les transitions.
- Les images de référence. Elles aident clairement en pratique. Mais soyez précis sur ce qui est documenté : les ingrédients de Veo, les références de Runway, les éléments de Kling et les rôles de référence de Seedance sont tous documentés pour les sujets, personnages, objets et styles. Le texte de Runway annonce lui-même le maintien d’un personnage à travers des conditions d’éclairage différentes, ce qui est l’inverse de maintenir l’éclairage. Aucun fournisseur ne documente la persistance de l’éclairage entre des clips générés séparément comme un comportement pris en charge. Vous détournez un mécanisme de style pour faire un travail d’éclairage.
- Répéter un bloc d’éclairage identique mot pour mot. Aucun modèle n’expose un verrou d’éclairage : c’est donc une pratique de praticien plutôt qu’une fonctionnalité. Mais c’est une pratique que l’architecture de prompt des fournisseurs est faite pour accommoder, ce qui est une façon juste de le dire.
Les seeds ne font pas ce que les gens croient
Le folklore persistant veut que garder un seed constant d’un prompt à l’autre maintienne l’éclairage d’un plan à l’autre. Rien ne l’appuie. Un seed indexe l’échantillon de bruit, pas la scène. Changez le prompt et vous changez la trajectoire.
Pire, les seeds ne sont même pas fiablement déterministes sur les modèles hébergés. La référence API de Runway dit qu’une requête identique avec le même seed « produira des résultats similaires ». Similaires, pas identiques. Et aucun fournisseur ne promet qu’un seed survive à une mise à jour de modèle. Les seeds servent à comparer un prompt à lui-même. Ce ne sont pas un outil de continuité.
Le piège du champ inverse
Celui-ci relève du raisonnement plutôt que d’une source, et c’est ce qui risque le plus d’attraper quelqu’un qui connaît déjà la direction photo.
Votre bloc d’éclairage est relatif à la caméra. Sur un vrai plateau, un champ inverse inverse la direction à l’écran : une principale à gauche caméra dans l’amorce devient une principale à droite caméra dans l’inverse, parce que la lampe n’a pas bougé, la caméra oui. Collez votre bloc tel quel dans l’inverse et la principale reste à gauche caméra, brisant silencieusement la géographie de la pièce.
Deux sorties. Inverser la direction à la main sur chaque champ inverse, ou écrire le bloc en repère monde, la fenêtre est à gauche caméra dans le large et derrière la caméra dans l’inverse, en acceptant de tenir une petite fiche de continuité d’éclairage à la main. Dans les deux cas c’est du travail délibéré, et le sauter est là où la plupart des séquences s’effondrent.
L’heure du jour, et une astuce à voler
Attachez la lumière à un fait plutôt qu’à un look. La documentation de Seedance formule bien la raison : l’heure dorée garde la lumière identique sur tous les segments sans décrire la position du soleil dans chacun. Une heure du jour nommée est une contrainte compacte pour laquelle le modèle a un énorme a priori. Une élévation de soleil décrite est une longue instruction qu’il peut ignorer discrètement.
Pour les lampes de décor, exploitez ce qui est documenté. Les fonctions de référence et d’élément verrouillent bien mieux les objets que l’illumination. Décrivez donc une lampe pratique comme un objet physique avec une position et un état fixes (« la lampe de bureau en laiton à droite du bureau, abat-jour incliné vers le mur, allumée, chaude à 2700 K ») et vous recrutez la machinerie de cohérence d’objet pour faire un travail d’éclairage.
Où ça casse le plus fort
L’extérieur jour avec une source dominante unique est le plus facile : une condition nommée contraint presque tout. Les intérieurs sont plus durs parce qu’ils sont à sources multiples, et c’est là que les échecs documentés se concentrent. La nuit est le pire cas, peu de signal et dominée par les lampes de décor.
Il y a de vraies preuves publiées ici, même si elles demandent de la prudence. PhyWorldBench, un banc d’essai de 2026 avec 12 modèles et 12 600 vidéos annotées par des humains, inclut « Éclairage et ombres » parmi ses dix catégories physiques, ce qui est en soi un fait citable sur l’endroit où le domaine situe les problèmes. Ses échecs nommés incluent une lampe de poche traversant une pièce sombre sans éclairer ce qui l’entoure, et de la lumière qui ne se réfracte pas. Environ un quart seulement des vidéos satisfaisaient à la fois la justesse sémantique et physique. Physics-IQ arrive à une conclusion plus brutale : le réalisme visuel n’implique pas la compréhension physique.
Aucun des deux bancs d’essai ne publie de score d’éclairage isolé, alors personne ne devrait en citer un.
Mais il existe un contrepoids qui recadre tout le problème. Un article de 2026 de l’Université de Pékin, de la BAAI et d’OpenBayes soutient que les modèles de diffusion vidéo encodent implicitement une physique, une géométrie et une optique des matériaux complexes, assez pour que les auteurs en extraient des cartes d’environnement HDR utilisables. Si ça tient, la continuité d’éclairage n’est pas un défaut de connaissance de ces modèles. C’est un défaut de contrôle. Ils en savent plus sur la lumière que ce que vous pouvez adresser dans un prompt aujourd’hui.
Générer le look, étalonner l’équilibre
Le partage pratique, et la contrainte qui le décide. Direction, qualité, contraste et motivation sont cuits dans les pixels et ne se récupèrent pas à l’étalonnage. Aucune correction de couleur ne déplace une lumière principale. Ces éléments doivent être justes à la génération.
La température de couleur, l’équilibre général et les retouches d’un plan à l’autre sont du travail d’étalonnage, et les poursuivre dans le prompt coûte des regénérations pour quelque chose qu’un coloriste règle en minutes.
À quel point cette deuxième étape est indulgente dépend de la profondeur de bits, et voici le chiffre à connaître : la plupart des outils vidéo IA sortent en 8 bits par défaut, 256 niveaux par canal contre 1024 en 10 bits, ce qui veut dire du banding et de la postérisation dès que quelqu’un relève les noirs. Une sortie EXR scene-linear 16 bits commence à apparaître, et là où elle existe, on peut générer plus lâche et étalonner plus fort. Là où elle n’existe pas, plus de choses doivent être justes à la prise, pour ainsi dire.
La plupart des outils vidéo IA sortent en 8 bits par défaut
Niveaux par canal, 8 bits contre 10 bits
| Profondeur | Niveaux par canal |
|---|---|
| 8 bits | 256 |
| 10 bits | 1024 |
Une couche intermédiaire existe aussi maintenant, qui n’existait pas avant. Le rééclairage vidéo-vers-vidéo peut changer l’heure du jour ou adoucir une principale trop dure après la génération. C’est une regénération avec son propre risque de dérive, alors la règle opérationnelle de la documentation s’applique : épinglez tout le reste explicitement, sinon ça bougera.
Les modes d’échec, nommés
Seul le premier est un terme établi. Les autres forment un vocabulaire de travail, offert comme tel, pas revendiqué comme standard.
- Scintillement. Instabilité d’intensité et de couleur d’une image à l’autre dans un même clip. Pire la nuit et en fort contraste. Défilez lentement pour l’attraper.
- Rééclairage à la coupe. Deux plans qui devraient partager un dispositif arrivent éclairés différemment. L’échec central, directement attribuable au fait que le modèle n’hérite pas du dispositif précédent.
- Inversion de direction d’ombre. La forme la plus visible du précédent, et l’échec que votre propre bloc répété mot pour mot provoque sur un champ inverse.
- Changement d’état d’une lampe. Une lampe allumée dans un plan et éteinte dans le suivant, ou déplacée, ou d’une autre couleur. Les modèles traitent les lampes de décor comme de l’habillage plutôt que comme des accessoires critiques pour la continuité.
- Pompage d’exposition. La luminosité générale qui dérive dans un plan pendant que le sujet bouge, comme une exposition automatique qui cherche. Basse fréquence, suit l’action, distinct du scintillement.
- Ombre de contact absente. Aucune ombre là où le sujet touche le sol. L’indice le plus rapide qu’un plan est généré, et la raison pour laquelle un composite a l’air collé même quand rien d’autre ne cloche.
- Source non motivée. De la lumière arrivant d’un endroit que la scène n’explique pas. La violation directe du principe de motivation, et la raison d’écrire la motivation dans le prompt comme un fait.
- Source qui n’éclaire pas. L’inverse : une lumière est rendue mais n’affecte pas ce qui l’entoure. L’échec caractéristique des intérieurs de nuit, documenté dans la littérature des bancs d’essai.
La version courte
Écrivez l’éclairage une fois, comme un bloc nommant source, direction, qualité, température de couleur et rapport de contraste. Répétez-le mot pour mot sur chaque plan, sauf en image-vers-vidéo chez Runway, et inversez la direction à la main sur chaque champ inverse. Utilisez l’extension quand vous le pouvez, parce qu’une continuité conditionnée par des images bat toujours une continuité décrite par un prompt. Ayez la direction et la motivation justes à la génération, parce que l’étalonnage ne les corrige pas, et laissez l’équilibre à l’étalonnage. Puis surveillez les huit échecs ci-dessus, parce que connaître leur nom, c’est l’essentiel pour les attraper.
Sources
- Guide multi-plans Lightricks LTX-2.5 Pro (11 août 2026)
- OpenAI, guide de prompt Sora 2
- Google Cloud, guide de prompt pour Veo 3.1 (16 octobre 2025)
- Runway, guide de prompt vidéo Gen-4
- Runway, création avec les références d’image Gen-4
- Higgsfield, guide de prompt Seedance 2.5 (13 août 2026)
- Kling, guide de prompt texte-vers-vidéo
- Luma, prompts vidéo cinématographiques (13 août 2026)
- PhyWorldBench (arXiv:2507.13428, ICLR 2026)
- Physics-IQ, « Do Generative Video Models Understand Physical Principles? » (WACV 2026)
- « Video Generation Models Are Inherent Lighting Estimators » (Université de Pékin, BAAI, OpenBayes)
- Lightricks, la vidéo IA pour la diffusion et la contrainte du 8 bits (12 mars 2026)
- Runway, Aleph 2 et Edit Studio (21 mai 2026)