Une pub en vidéo IA est assemblée à partir de générations séparées, et le modèle qui crée le sixième plan ne garde aucun souvenir du cinquième. Si un foulard, l’étiquette d’une bouteille ou le café dans une tasse change entre les deux, rien dans le modèle ne s’en aperçoit. La première question à poser à tout projet de vidéo IA est donc une vieille question : qui surveille les raccords ?

Les équipes de tournage vivent avec ce problème depuis plus d’un siècle. Les scènes se tournent dans le désordre, les prises sont séparées par des heures, et le public s’attend quand même à ce qu’un verre reste à moitié plein d’un plan à l’autre. Les plateaux professionnels comptent une personne dont c’est le métier de remarquer : la scripte, longtemps appelée script girl à Hollywood.

REC UNE SCÈNE, DEUX PRISES COUPE PRISE 1 · 09:12 PRISE 7 · 15:40
Deux prises d’un même moment : le verre, la cigarette et un gobelet égaré ne raccordent plus.

Un métier inventé en 1918

Dans le magazine Script, Rosanne Welch attribue à la scénariste Sarah Y. Mason l’invention, pour l’essentiel, de ce métier en 1918, alors qu’elle assurait la continuité d’Arizona, une production de Douglas Fairbanks. Le reportage de NPR situe le besoin au moment où D.W. Griffith a rapproché la caméra et où l’on s’est mis à tourner avec plusieurs caméras. Dès qu’une scène était couverte sous plusieurs angles, tous les angles devaient concorder.

On confiait souvent la tâche à quelqu’un du secrétariat, d’où le nom de script girl. Darren Paul Fisher, responsable de la réalisation à l’Université Bond, écrit dans The Conversation qu’aux débuts d’Hollywood, ce rôle revenait généralement à des femmes. En 2008, NPR rapportait que le métier était encore exercé surtout par des femmes.

La vidéo générée n’a pas de scripte intégrée. Chaque génération repart de zéro, à partir de sa consigne et des images qu’on lui fournit, sans la moindre idée de l’allure du plan précédent. Dans un projet IA, le travail de la scripte revient à la personne qui dirige le projet, et il faut l’attribuer clairement.

Ce qu’on note

Une description de poste de l’IATSE énumère les tâches : suivre la continuité des coiffures, du maquillage, des costumes, des accessoires et des décors, revérifier les accessoires scène par scène, prendre des photos de continuité, et aider le réalisateur et le directeur photo pour les regards et la direction à l’écran. ScreenSkills ajoute le minutage de chaque prise et les pages de scénario annotées, remises chaque jour, pour que le monteur sache ce qui a été tourné et ce qui se raccordera. Les outils ont changé, note Fisher : des notes et des croquis aux Polaroid, puis aux téléphones.

Les regards et la direction à l’écran sont la partie invisible du métier. Un personnage qui sort du cadre par la droite doit entrer dans le plan suivant par la gauche, sinon sa marche se lit comme un demi-tour. Dans deux gros plans séparés d’une conversation, un comédien regarde juste à gauche de l’objectif et l’autre juste à droite, sinon ils semblent regarder à côté l’un de l’autre.

La nourriture est le piège classique. « Les gens n’arrêtent pas de manger la nourriture », confiait le scripte Steve Gehrke à NPR, et quelqu’un doit savoir si l’assiette contenait 23 petits pois ou 14. D’après son expérience, la plupart des faux raccords surviennent quand le tournage reprend après le dîner. Le même reportage énumère des erreurs restées à l’écran : le croissant de Julia Roberts qui devient crêpe dans Pretty Woman, le col de Sean Connery qui s’ouvre et se ferme dans Les Incorruptibles, et la robe de Dorothy impeccable juste après une chute dans un enclos à cochons boueux dans Le Magicien d’Oz.

Cette liste sert aussi de carte des endroits où la vidéo générée flanche. D’une génération à l’autre, une veste gagne une poche, une bague change de main, ou un comédien qui marche de gauche à droite entre dans le plan suivant du mauvais côté. À l’intérieur d’une même génération, une étiquette peut se déformer quand la bouteille tourne. Les catégories de la scripte forment une grille toute faite pour réviser des extraits IA, plan par plan.

Quand personne ne l’attrape

En mai 2019, des téléspectateurs du quatrième épisode de la dernière saison de Game of Thrones ont repéré un gobelet de café pour emporter sur une table de banquet, entre les coupes et les cornes à boire. Beaucoup y ont vu un gobelet Starbucks. HBO a répondu par une blague : « Daenerys avait commandé une tisane. » Selon CBS News, HBO a ensuite effacé le gobelet de l’épisode, et deux semaines plus tard, des fans ont trouvé des bouteilles d’eau en plastique aux pieds de Samwell Tarly dans l’épisode final.

Fisher rappelle des classiques plus anciens : un soldat impérial de Star Wars qui se cogne la tête contre une porte de l’Étoile de la mort, et des impacts de balles déjà dans le mur de Pulp Fiction avant que quiconque tire. Il décrit aussi une chandelle qui semble faire le « trombone », plus courte puis plus longue d’une prise à l’autre.

Bien des faux raccords sont des choix. Le réalisateur et le monteur, explique Fisher, se fient d’abord à la qualité du jeu : un comédien peut trouver le bon regard à la fin d’une prise alors qu’il convient au début de la scène, et le plan est déplacé, tant pis si l’arrière-plan ne concorde plus. Avec le budget, on peut changer une horloge en numérique ou faire disparaître un gobelet. Souvent, l’équipe encaisse, et la plupart des erreurs passent inaperçues au premier visionnement.

La vidéo générée commet un autre genre de faux raccord. Sur un plateau, l’erreur typique est un objet égaré ; dans un plan généré, c’est l’objet lui-même qui se transforme. Selon Il Sole 24 Ore, la pub des Fêtes 2025 de Coca-Cola, produite par IA, a été critiquée pour des camions qui changeaient de forme sur la route enneigée, et Business Insider relevait que le nombre de roues semblait varier au fil de la pub.

Un cahier de continuité pour une machine

La plupart des modèles de vidéo construisent un extrait à partir d’un bruit aléatoire, guidés par une consigne et par les images qu’on leur donne. Rien de l’extrait précédent n’est conservé à moins qu’on le réinjecte : deux consignes qui demandent « une femme en manteau rouge » donneront le plus souvent deux femmes différentes.

En mai 2026, un banc d’essai appelé EntityBench, conçu par Ruozhen He et ses collègues, a suivi les personnages, les objets et les lieux sur 2 491 plans tirés de vraies œuvres narratives. Dans les méthodes de génération existantes, la cohérence se dégrade fortement avec la distance entre deux apparitions : plus un personnage ou un accessoire reste longtemps hors champ, plus il risque de revenir changé. Les meilleurs résultats pour les personnages venaient d’images de référence vérifiées, stockées pour chacun avant le début de la génération.

Le cahier de continuité, hier et aujourd’hui

Les tâches de la scripte sur le plateau et leurs équivalents en vidéo générée

SUR LE PLATEAUEN VIDÉO GÉNÉRÉEPhotos de continuité de chaque plan : Références figées, réutilisées partoutPhotos de continuitéde chaque planRéférences figées,réutilisées partoutNotes de costumes et d’accessoires : Fiches personnages et produitsNotes de costumeset d’accessoiresFiches personnageset produitsRaccord de geste d’un plan à l’autre : Fin d’un extrait reprise au début du suivantRaccord de gested’un plan à l’autreFin d’un extrait repriseau début du suivantRegards et direction à l’écran : Regard et déplacement fixés à chaque planRegards etdirection à l’écranRegard et déplacementfixés à chaque planRapport au monteur et scénario ligné : Journal de chaque génération approuvéeRapport au monteuret scénario lignéJournal de chaquegénération approuvée
Tâches de la scripte et leurs équivalents en vidéo générée
Sur le plateauEn vidéo générée
Photos de continuité de chaque planImages de référence figées, réutilisées dans chaque plan
Notes de costumes et d’accessoires, scène par scèneFiches de référence des personnages et des produits
Raccord de geste d’un plan à l’autreDernière image d’un extrait reprise comme première image du suivant
Regards et direction à l’écranRegard et sens du déplacement fixés pour chaque plan
Rapport au monteur et scénario lignéJournal de chaque génération et de la version approuvée
Colonne de gauche : tâches tirées des descriptions de poste de l’IATSE (2023) et de ScreenSkills. Colonne de droite : pratique courante dans les projets de vidéo IA.

C’est la méthode de la scripte, refaite pour la génération. Chaque personnage récurrent, chaque costume, chaque produit et chaque lieu reçoit sa fiche de référence, approuvée une fois et fournie à chaque plan qui en a besoin. Bien des modèles acceptent une première image, et certains une dernière : l’image finale d’un extrait peut donc ouvrir le suivant et garder une main ou un verre à sa place. La chaîne transporte aussi les défauts, alors chaque maillon est vérifié. Un produit qui doit être exact est souvent plus sûr filmé, puis intégré. Un journal consigne pour chaque extrait les références, la consigne, la version approuvée et des notes comme bague à la main gauche, et les extraits sont comparés côte à côte à chaque coupe avant le suréchantillonnage, pendant qu’une correction coûte encore une seule génération.

Ce qu’il faut exiger de tout projet vidéo IA

Demandez qui est responsable des raccords, nommément. Demandez à voir les fiches de référence de chaque personne, produit et lieu récurrents avant le début de la génération, et vérifiez que chaque plan s’en sert. Demandez le journal de continuité, et révisez des images fixes des deux côtés de chaque coupe : costumes, mains, accessoires, regards et sens du déplacement. Vérifiez votre produit dans chaque image où il apparaît, jusqu’au logo, à l’étiquette et au nombre de pièces. Un gobelet de café a échappé à l’équipe d’une série suivie par des millions de téléspectateurs ; en vidéo IA, le gobelet peut en plus changer de forme d’un plan à l’autre.

Sources

Gabriel Brien

Gabriel Brien

Fondateur de l’Agence Crimson Spark. Réalisateur IA et technologue créatif, qui écrit à partir de ce qu’il pratique chaque jour.

En savoir plus sur Gabriel →