À la fin de mars 2023, un utilisateur de Reddit publie un montage de Will Smith en train de manger des spaghettis. Rien n’y a été filmé. Un modèle de recherche gratuit avait généré des fragments d’une ou deux secondes, que l’auteur a ensuite montés bout à bout, rapportait Vice, avec le filigrane d’une banque d’images encore visible sur les images. Le visage fondait, les nouilles se mêlaient aux mains, et le tout était muet.

Trois ans plus tard, on propose aux marques de la vidéo IA pour de vraies campagnes. Un responsable marketing qui se demande s’il doit en acheter a besoin d’un portrait clair : ce que les modèles ont gagné depuis ce clip, et le travail qui revient encore à des humains. Le voici, daté et sourcé.

REC DE 2023 À 2026 2023 2 S SANS SON 2026 30 S SON PLUS LONG, PLUS NET, AVEC LE SON. TOUJOURS UN PLAN À LA FOIS.
Trois ans de progrès, tous mesurés à l’intérieur d’un seul plan.

Le clip devenu étalon de mesure

Le montage aux spaghettis était typique de son époque. Le tour d’horizon du texte-vidéo publié par Gizmodo en mars 2023 décrivait le modèle de recherche ouvert qui l’avait produit comme générant des extraits de deux secondes, et un outil commercial, alors en démonstration seulement, comme en générant de trois. Quand cet outil s’est ouvert au public en juin 2023, Tom’s Hardware a constaté qu’il produisait des extraits de quatre secondes « sans aucun son » et avec très peu de mouvement. Les versions en plus haute résolution étaient réservées aux comptes payants.

Le clip a survécu à sa technologie. Chaque fois qu’un nouveau modèle vidéo sortait, des internautes lui soumettaient la même consigne, et à la fin de 2024, TechCrunch y voyait à la fois « un mème et un banc d’essai ». Will Smith lui-même l’a parodié sur Instagram en février 2024. Le test fonctionne parce qu’il est difficile : un visage qui doit rester la même personne, deux mains, une fourchette et de la nourriture qui change de forme à mesure qu’on la mange.

Ce que les modèles ont appris en trois ans

La durée a bougé en premier. En février 2024, OpenAI publiait des travaux sur un modèle capable, selon l’entreprise, de générer une minute de vidéo haute fidélité, jusqu’à 1920x1080 pixels. En juillet 2026, l’équipe de recherche Seed de ByteDance annonçait un modèle qui génère des plans uniques allant jusqu’à 30 secondes, le double de sa limite précédente de 15 secondes, et qui peut les prolonger en plusieurs passes.

Le son est arrivé en mai 2025, quand Google a présenté un modèle qui génère l’audio en même temps que l’image : bruits de circulation, chants d’oiseaux, et même dialogues entre personnages, avec une synchronisation labiale que l’entreprise qualifiait de précise. Les modèles de pointe lancés depuis génèrent eux aussi le son : celui de juillet 2026 produit l’audio et la vidéo ensemble, et la documentation actuelle de Google pour les développeurs indique que l’audio est toujours activé.

Le contrôle compte le plus pour les marques, et c’est lui qui est arrivé en dernier. En 2023, une consigne, c’était du texte et de l’espoir. Les modèles actuels acceptent des références : des images d’un produit, d’un visage ou d’un décor que la génération doit respecter. La documentation de Google permet jusqu’à trois images de référence par extrait. Le modèle de juillet 2026 accepte jusqu’à 30 images, 10 extraits vidéo et 10 extraits audio dans une seule requête. La résolution a suivi. En 2023, l’outil commercial faisait payer la version suréchantillonnée ; la même documentation de Google mentionne aujourd’hui une sortie en 4K.

Trois ans de vidéo IA, dates à l’appui

Jalons tirés de reportages et de la documentation des fournisseurs

MARS 2023MARS 2023: Clip viral, modèle de recherche, Fragments de 1 à 2 s, montés Sans son, filigrane visibleClip viral, modèle de rechercheFragments de 1 à 2 s, montésSans son, filigrane visibleJUIN 2023JUIN 2023: Un outil commercial ouvre, Extraits de 4 s, sans son Suréchantillonnage payantUn outil commercial ouvreExtraits de 4 s, sans sonSuréchantillonnage payantFÉVR. 2024FÉVR. 2024: Résultats de recherche, Jusqu’à une minute de vidéo Jusqu’à 1920x1080Résultats de rechercheJusqu’à une minute de vidéoJusqu’à 1920x1080MAI 2025MAI 2025: Son généré avec l’image, Effets, ambiance, dialogues Synchro labiale dite préciseSon généré avec l’imageEffets, ambiance, dialoguesSynchro labiale dite préciseJUIL. 2026JUIL. 2026: Plans uniques jusqu’à 30 s, Contre 15 s ; références : 30 images, 10 extraits, 10 audioPlans uniques jusqu’à 30 sContre 15 s ; références : 30images, 10 extraits, 10 audioOCT. 2026OCT. 2026: Modèle de pointe, doc actuelle, Plans de 8 s jusqu’en 4K, son Prolongés à 148 s, en 720pModèle de pointe, doc actuellePlans de 8 s jusqu’en 4K, sonProlongés à 148 s, en 720p
Jalons des capacités de la vidéo IA, de 2023 à 2026
DateJalonDuréeRésolutionSon
Mars 2023Clip viral de Will Smith tiré d’un modèle de recherche gratuit1 à 2 secondes par fragmentNon préciséeAucun
Juin 2023Un outil commercial texte-vidéo s’ouvre à tous4 secondesVersion suréchantillonnée pour les comptes payantsAucun
Février 2024Résultats de recherche d’un laboratoireJusqu’à une minuteJusqu’à 1920x1080Non décrit
Mai 2025Un modèle génère le son avec l’imageNon préciséeNon préciséeEffets, ambiance, dialogues, synchronisation labiale
Juillet 2026Modèle à plan unique avec de nombreuses référencesJusqu’à 30 secondes (contre 15)Non préciséeGénéré conjointement avec la vidéo
Octobre 2026Documentation actuelle d’un modèle de pointe4, 6 ou 8 secondes ; prolongations jusqu’à 148 secondesJusqu’en 4K (plans de 8 secondes) ; 720p pour les prolongationsToujours activé
Sources : Vice et Gizmodo (mars 2023), Tom’s Hardware (juin 2023), OpenAI (février 2024), Google (mai 2025), ByteDance Seed (juillet 2026), documentation de Google AI for Developers (consultée le 1er octobre 2026). Les chiffres des fournisseurs sont leurs propres affirmations.

Les petits caractères de « plus long » et « plus net »

À lire les fiches techniques, le problème semble réglé. La documentation est plus prudente. Sur le modèle actuel de Google, une génération dure encore 4, 6 ou 8 secondes, et la 4K n’est offerte qu’à 8 secondes. Les séquences plus longues passent par la prolongation : le modèle ajoute sept secondes à la fois, jusqu’à 20 fois, pour un maximum de 148 secondes, et seulement en 720p.

La durée qu’un modèle peut atteindre et la qualité qu’il maintient sur cette durée sont donc deux chiffres distincts. Un plan unique de 30 secondes est un vrai progrès pour une scène qui demande un seul mouvement continu. Un film de marque reste fait de nombreux plans, et chacun est une génération distincte qui doit raccorder avec les autres.

Ce que trois ans n’ont pas réglé

L’histoire s’écrit toujours à la main. Chaque jalon ci-dessus porte sur un seul plan : plus long, plus net, avec du son. Aucun ne décide de ce que dit la pub, du plan qui ouvre ou de l’endroit où tombe la coupe. Un modèle montrera une personne en train de manger aussi longtemps qu’on le lui demande. Quelqu’un doit encore décider pourquoi le public continuerait de regarder.

La continuité d’un plan à l’autre reste un travail de réalisation. Parmi les limites de son propre modèle, OpenAI notait en 2024 que manger de la nourriture ne la modifiait pas toujours correctement. À l’intérieur d’un plan, les modèles ont beaucoup progressé depuis. Entre des plans générés séparément, un visage, l’étiquette d’un produit ou la lumière peuvent encore changer. Les références réduisent cette dérive ; il faut quand même que quelqu’un vérifie chaque coupe.

Le jugement sonore n’est pas venu avec le son. Quand des utilisateurs ont fait passer le test des spaghettis au nouveau modèle de Google en mai 2025, PetaPixel a décrit un Will Smith convaincant qui faisait des bruits de croquant et de succion en mâchant ses pâtes. L’audio était synchronisé, et faux pour la scène. Décider ce que le spectateur entend, ce qu’on laisse de côté et la place du produit par rapport à la voix reste une décision de mixage, et une partie de l’audio généré est habituellement remplacée en postproduction.

Les droits ont bougé, mais pas vers les raccourcis

Le clip de 2023 utilisait un visage célèbre pour lequel personne n’avait obtenu de licence. Les modèles ont changé, la question demeure. En février 2026, Axios rapportait que Disney avait envoyé à ByteDance une mise en demeure au sujet de son nouveau modèle vidéo, l’accusant de reproduire des personnages de Disney et d’en tirer des œuvres dérivées sans autorisation.

La propriété du résultat n’est pas réglée non plus. En janvier 2025, le Copyright Office des États-Unis concluait que « la simple fourniture de consignes » ne fait pas de quelqu’un l’auteur de ce que produit un modèle. La protection peut quand même s’appliquer lorsqu’une personne détermine assez d’éléments expressifs, par exemple en modifiant le résultat ou en l’intégrant à une œuvre plus large. Pour une marque, la contribution humaine à une vidéo IA devient donc quelque chose à documenter.

Ce qu’une marque peut attendre aujourd’hui, et ce qu’elle doit encore vérifier

Une marque peut désormais s’attendre à des plans uniques propres de plusieurs secondes, à un son synchronisé, à une meilleure résolution et à un produit ou un visage fidèle à sa référence à l’intérieur de chaque plan. Elle doit quand même vérifier :

  • La résolution à laquelle chaque plan final a été généré, et si les plans longs ont été prolongés en basse résolution, puis suréchantillonnés.
  • Comment le produit, les visages et le décor sont restés cohérents d’un plan à l’autre.
  • Qui a conçu le son, et quelles parties de l’audio généré ont été conservées.
  • Quelles références ont servi, à qui elles appartiennent, et si une personne réelle, un personnage ou une marque apparaît sans autorisation.
  • Quel travail créatif humain est documenté, au cas où la propriété du film serait un jour contestée.

Sources

Gabriel Brien

Gabriel Brien

Fondateur de l’Agence Crimson Spark. Réalisateur IA et technologue créatif, qui écrit à partir de ce qu’il pratique chaque jour.

En savoir plus sur Gabriel →