Une pub générée de quinze secondes peut sembler facile. Derrière, il y a une liste de problèmes que tout cinéaste IA rencontre à chaque projet, peu importe le modèle : des visages qui changent, des étiquettes qui fondent, un son à reconstruire, des droits à libérer.

Aucun ne justifie de fuir la vidéo générée. Chacun a une cause, et chacun a une réponse que les professionnels traitent désormais comme de la routine. Voici les dix qui comptent le plus pour une marque, regroupés selon l’endroit où ils apparaissent.

REC DIX DÉFIS, UNE SEULE CHAÎNE 01VISAGE02ÉTIQUETTE03POIDS04SYNCHRO05SON06DURÉE07300:108RETOUCHE09DROITS10IADIVULGATION CHACUN A UNE CAUSE ET UNE RÉPONSE CONNUE
Les dix défis abordés plus bas, dans l’ordre.

Dans le cadre : ce que le modèle dessine

1. Le même visage, d’un plan à l’autre

Chaque génération repart de zéro. Le modèle ne garde aucun souvenir du plan précédent : un visage, un veston ou une tasse de café sont redessinés à partir de la description et des images qu’on lui fournit. Quand le studio torontois Shy Kids a réalisé le court métrage Air Head en 2024 avec un modèle vidéo en accès anticipé, son héros à tête de ballon refusait de rester jaune d’un plan à l’autre. L’équipe a dû isoler le ballon et le recolorer en postproduction, rapporte Mike Seymour dans fxguide.

Les pros verrouillent l’identité avant la production : une fiche personnage, les mêmes images de référence à chaque génération, et une image fixe du dernier plan approuvé comme première image du suivant. La méthode est détaillée dans Fiche personnage 101, et les accessoires dérivent pour la même raison, comme le montre le métier de la scripte.

2. Produits, texte et logos

Un modèle dessine les lettres comme des formes déjà vues, sans les épeler. Une étiquette, un prix ou un logo n’est qu’une texture de plus à imiter : l’emballage sort souvent presque juste, le pire résultat pour une marque. T2VTextBench, un banc d’essai noté par des humains en 2025, a testé dix modèles vidéo et conclu que la plupart peinent à produire un texte lisible et stable. VidScribe, un autre banc d’essai mis en ligne en septembre 2026, constate que le texte tient le mieux quand la génération part d’une image, et le moins bien quand on retouche une vidéo existante.

La parade : laisser le vrai produit mener. On part d’une photo produit approuvée comme première image, on garde l’étiquette grande et stable, et on ajoute logos, surimpressions et cartons de fin au montage plutôt que de les générer.

3. Poids, physique et mains

Les modèles vidéo apprennent à quoi ressemble un mouvement, pas pourquoi il se produit. Dans une étude de 2024, des chercheurs dirigés par Bingyi Kang ont entraîné des modèles vidéo sur une physique simulée toute simple. Dans des situations familières, les modèles prédisaient bien le mouvement. Ailleurs, ils échouaient en imitant l’exemple d’entraînement le plus proche plutôt qu’en appliquant une règle. Les mains ajoutent leurs propres ennuis, avec leurs nombreuses articulations souvent cachées derrière l’objet tenu. Une main qui saisit une bouteille, c’est là que les doigts fusionnent.

La réponse : choisir des gestes que le modèle a vus mille fois, garder chaque mouvement simple, réviser image par image et filmer de vraies mains quand la manipulation du produit compte. Les symptômes visibles sont recensés dans Pourquoi votre vidéo a l’air faite par IA.

En mouvement : jeu, son et durée

4. Le jeu et la synchro labiale

Un visage généré peut bouger correctement et sonner creux, et une bouche doit placer chaque consonne au bon moment. La marge est mince. La recommandation BT.1359 de l’Union internationale des télécommunications, publiée en 1998, situe le seuil de détection à environ 45 millisecondes quand le son devance l’image, et à 125 millisecondes quand il la suit. À 24 images par seconde, une image dure environ 42 millisecondes.

Les pros enregistrent ou conçoivent donc la voix en premier et génèrent l’image en fonction d’elle, vérifient la synchro image par image et écrivent des scènes qui en demandent moins : narration hors champ, personnage de profil ou hors cadre. Pourquoi les visages presque humains dérangent, on l’explique dans Pourquoi les visages presque humains nous mettent mal à l’aise.

5. Le son

Bien des extraits générés arrivent muets, et les modèles qui produisent du son le font plan par plan : l’ambiance de la pièce change à chaque coupe. Le public entend ces coutures. La solution : traiter le son comme une production à part entière, avec une seule ambiance sur toute la séquence, du bruitage, un vrai mixage et une musique sous licence, en ne gardant le son généré que s’il survit à ce mixage. L’argument complet se trouve dans La vidéo IA a un problème de son.

6. Des plans courts pour des pubs longues

Une génération dure de quelques secondes à, tout au plus, une demi-minute environ, et plus elle s’allonge, plus l’image a le temps de dériver. Un message de 30 secondes reste une suite de plans qui doivent se raccorder. Les pros planifient le montage avant de générer quoi que ce soit : une liste de plans avec leurs durées, quelques images de plus à chaque bout pour couper, des coupes sur le mouvement et des coutures cachées comme le cinéma l’a toujours fait, ce qu’explique Le plan-séquence, le plus beau mensonge du cinéma.

Dans le budget : sélection et retouches

7. Le taux de sélection

Un réalisateur ne peut pas demander au modèle une prise de plus avec un sourire un peu moins appuyé. Chaque génération est un nouveau tirage, et la plupart finissent à la poubelle. Pour Air Head, Patrick Cederberg, de Shy Kids, estimait à environ 300 pour 1 le rapport entre le matériel généré et ce qui a abouti dans le film, selon fxguide. Chaque extrait rejeté coûte du calcul, et le temps de quelqu’un pour le visionner.

Les bonnes équipes suivent ce ratio par type de plan et le dépensent avec soin : brouillons peu coûteux pour tester le mouvement, images fixes approuvées avant toute animation, rendus en qualité finale seulement pour les plans déjà verrouillés.

8. Des retouches qui font tout recommencer

Sur un tournage, « un peu plus chaud » est une note d’étalonnage. En vidéo générée, changer la consigne relance tout le plan, et la nouvelle version peut perdre des détails que le client avait déjà approuvés. L’outil lui-même peut changer en cours de projet. La documentation infonuagique de Google indique que les versions stables des modèles sortent habituellement avec une date de retrait, après laquelle les requêtes vers un modèle retiré échouent. Un grand produit vidéo a d’ailleurs déjà fermé ses portes.

Les pros font approuver par étapes (scénario, premières images, mouvement, finition), figent ce qui est approuvé, archivent chaque consigne, chaque référence et chaque version de modèle, et définissent par écrit ce qui compte comme une ronde de retouches.

En public : droits et confiance

9. Propriété et consentement

Le droit d’auteur suit l’auteur humain. Le U.S. Copyright Office a conclu en janvier 2025 que des consignes seules ne font pas de quelqu’un un auteur, alors que la sélection, l’agencement et la modification humaine d’un matériel généré peuvent être protégés. Le 2 mars 2026, la Cour suprême des États-Unis a refusé d’entendre l’affaire Thaler c. Perlmutter, ce qui laisse en place l’exigence d’un auteur humain. Au Canada, un rapport de consultation fédéral de février 2025 note que la jurisprudence attribue la qualité d’auteur à un être humain qui fait preuve de talent et de jugement, sans annoncer de changement à la loi.

Les visages et les voix exigent leur propre consentement. Les conventions publicitaires de SAG-AFTRA, en vigueur depuis le 1er avril 2025, exigent le consentement écrit et clair d’un interprète à sa réplique numérique, distinct du contrat d’embauche, avec une description raisonnablement précise de l’usage prévu. Les pros documentent le travail créatif humain, utilisent des références qui leur appartiennent, évitent de solliciter de vraies personnes ou des personnages protégés, et obtiennent un consentement écrit pour tout visage ou toute voix réels. Pour aller plus loin : Ce qui rend un porte-parole IA crédible.

10. Divulgation et confiance

Certains marchés exigent maintenant une mention, comme l’Union européenne, et les données sur ce qu’elle coûte sont partagées. Une étude parue dans le Journal of Retailing and Consumer Services a montré qu’étiqueter une pub comme générée par IA en dégradait la perception, par un sentiment d’étrangeté, un effet atténué pour une marque plus forte. Un test de MediaScience portant sur quatre formats de mention auprès de 900 participants américains, rapporté par Marketing Dive en juin 2026, n’a trouvé aucune baisse de la mémorisation de la marque. Il a aussi montré que même une mention affichée pendant toute la pub laissait seulement 49 % des spectateurs conscients de l’usage de l’IA. Une icône n’atteignait que 38 %.

Les pros règlent la divulgation dès le brief, préfèrent un texte clair à une icône et ne laissent jamais une personne générée se faire passer pour une vraie cliente ou un vrai client.

Ce qu’une marque doit vérifier

La plupart de ces problèmes se préviennent avant la génération ou se rattrapent après. Peu se règlent par le modèle seul.

Où chaque défi se règle

Les dix défis répartis sur quatre étapes d’un projet vidéo IA

Prévenu avant ou pendant la générationCorrigé ou repéré après la générationPréparerPréparer: 1. Même visage1Préparer: 2. Produit et texte2Préparer: 4. Synchro labiale4Préparer: 6. Durée des plans6Préparer: 8. Retouches8Préparer: 9. Droits, consentement9GénérerGénérer: 3. Physique et mains3Générer: 7. Taux de sélection7Monter, sonoriserMonter, sonoriser: 2. Produit et texte2Monter, sonoriser: 5. Son5Monter, sonoriser: 6. Durée des plans6Réviser, diffuserRéviser, diffuser: 1. Même visage1Réviser, diffuser: 3. Physique et mains3Réviser, diffuser: 4. Synchro labiale4Réviser, diffuser: 8. Retouches8Réviser, diffuser: 10. Divulgation101. Même visage2. Produit et texte3. Physique et mains4. Synchro labiale5. Son6. Durée des plans7. Taux de sélection8. Retouches9. Droits, consentement10. Divulgation
Les dix défis répartis sur quatre étapes de projet
ÉtapeDéfis traités
Préparer1 Même visage, 2 Produit et texte, 4 Synchro labiale, 6 Durée des plans, 8 Retouches, 9 Droits et consentement
Générer3 Physique et mains, 7 Taux de sélection
Monter et sonoriser2 Produit et texte, 5 Son, 6 Durée des plans
Réviser et diffuser1 Même visage, 3 Physique et mains, 4 Synchro labiale, 8 Retouches, 10 Divulgation
Synthèse des pratiques courantes en production vidéo IA, telles que décrites dans cet article. Les numéros renvoient aux dix défis.

Avant d’approuver un projet vidéo IA, demandez à l’équipe lesquels de ces dix défis elle prévoit rencontrer, puis vérifiez :

  • les références de personnages et de produits, et les premières images, avant qu’on génère le moindre mouvement ;
  • d’où viennent le vrai produit, le logo et le texte à l’écran, et s’ils sont ajoutés au montage ;
  • comment se comptent les rondes de retouches, et si les consignes, les références et les versions de modèle sont archivées ;
  • le consentement écrit pour tout visage ou toute voix réels, et le plan de divulgation avant la mise en ligne.

Sources

Gabriel Brien

Gabriel Brien

Fondateur de l’Agence Crimson Spark. Réalisateur IA et technologue créatif, qui écrit à partir de ce qu’il pratique chaque jour.

En savoir plus sur Gabriel →