À la fin de mars 2023, un utilisateur de Reddit publie un montage de Will Smith en train de manger des spaghettis. Rien n’y a été filmé. Un modèle de recherche gratuit avait généré des fragments d’une ou deux secondes, que l’auteur a ensuite montés bout à bout, rapportait Vice, avec le filigrane d’une banque d’images encore visible sur les images. Le visage fondait, les nouilles se mêlaient aux mains, et le tout était muet.
Trois ans plus tard, on propose aux marques de la vidéo IA pour de vraies campagnes. Un responsable marketing qui se demande s’il doit en acheter a besoin d’un portrait clair : ce que les modèles ont gagné depuis ce clip, et le travail qui revient encore à des humains. Le voici, daté et sourcé.
Le clip devenu étalon de mesure
Le montage aux spaghettis était typique de son époque. Le tour d’horizon du texte-vidéo publié par Gizmodo en mars 2023 décrivait le modèle de recherche ouvert qui l’avait produit comme générant des extraits de deux secondes, et un outil commercial, alors en démonstration seulement, comme en générant de trois. Quand cet outil s’est ouvert au public en juin 2023, Tom’s Hardware a constaté qu’il produisait des extraits de quatre secondes « sans aucun son » et avec très peu de mouvement. Les versions en plus haute résolution étaient réservées aux comptes payants.
Le clip a survécu à sa technologie. Chaque fois qu’un nouveau modèle vidéo sortait, des internautes lui soumettaient la même consigne, et à la fin de 2024, TechCrunch y voyait à la fois « un mème et un banc d’essai ». Will Smith lui-même l’a parodié sur Instagram en février 2024. Le test fonctionne parce qu’il est difficile : un visage qui doit rester la même personne, deux mains, une fourchette et de la nourriture qui change de forme à mesure qu’on la mange.
Ce que les modèles ont appris en trois ans
La durée a bougé en premier. En février 2024, OpenAI publiait des travaux sur un modèle capable, selon l’entreprise, de générer une minute de vidéo haute fidélité, jusqu’à 1920x1080 pixels. En juillet 2026, l’équipe de recherche Seed de ByteDance annonçait un modèle qui génère des plans uniques allant jusqu’à 30 secondes, le double de sa limite précédente de 15 secondes, et qui peut les prolonger en plusieurs passes.
Le son est arrivé en mai 2025, quand Google a présenté un modèle qui génère l’audio en même temps que l’image : bruits de circulation, chants d’oiseaux, et même dialogues entre personnages, avec une synchronisation labiale que l’entreprise qualifiait de précise. Les modèles de pointe lancés depuis génèrent eux aussi le son : celui de juillet 2026 produit l’audio et la vidéo ensemble, et la documentation actuelle de Google pour les développeurs indique que l’audio est toujours activé.
Le contrôle compte le plus pour les marques, et c’est lui qui est arrivé en dernier. En 2023, une consigne, c’était du texte et de l’espoir. Les modèles actuels acceptent des références : des images d’un produit, d’un visage ou d’un décor que la génération doit respecter. La documentation de Google permet jusqu’à trois images de référence par extrait. Le modèle de juillet 2026 accepte jusqu’à 30 images, 10 extraits vidéo et 10 extraits audio dans une seule requête. La résolution a suivi. En 2023, l’outil commercial faisait payer la version suréchantillonnée ; la même documentation de Google mentionne aujourd’hui une sortie en 4K.
Trois ans de vidéo IA, dates à l’appui
Jalons tirés de reportages et de la documentation des fournisseurs
| Date | Jalon | Durée | Résolution | Son |
|---|---|---|---|---|
| Mars 2023 | Clip viral de Will Smith tiré d’un modèle de recherche gratuit | 1 à 2 secondes par fragment | Non précisée | Aucun |
| Juin 2023 | Un outil commercial texte-vidéo s’ouvre à tous | 4 secondes | Version suréchantillonnée pour les comptes payants | Aucun |
| Février 2024 | Résultats de recherche d’un laboratoire | Jusqu’à une minute | Jusqu’à 1920x1080 | Non décrit |
| Mai 2025 | Un modèle génère le son avec l’image | Non précisée | Non précisée | Effets, ambiance, dialogues, synchronisation labiale |
| Juillet 2026 | Modèle à plan unique avec de nombreuses références | Jusqu’à 30 secondes (contre 15) | Non précisée | Généré conjointement avec la vidéo |
| Octobre 2026 | Documentation actuelle d’un modèle de pointe | 4, 6 ou 8 secondes ; prolongations jusqu’à 148 secondes | Jusqu’en 4K (plans de 8 secondes) ; 720p pour les prolongations | Toujours activé |
Les petits caractères de « plus long » et « plus net »
À lire les fiches techniques, le problème semble réglé. La documentation est plus prudente. Sur le modèle actuel de Google, une génération dure encore 4, 6 ou 8 secondes, et la 4K n’est offerte qu’à 8 secondes. Les séquences plus longues passent par la prolongation : le modèle ajoute sept secondes à la fois, jusqu’à 20 fois, pour un maximum de 148 secondes, et seulement en 720p.
La durée qu’un modèle peut atteindre et la qualité qu’il maintient sur cette durée sont donc deux chiffres distincts. Un plan unique de 30 secondes est un vrai progrès pour une scène qui demande un seul mouvement continu. Un film de marque reste fait de nombreux plans, et chacun est une génération distincte qui doit raccorder avec les autres.
Ce que trois ans n’ont pas réglé
L’histoire s’écrit toujours à la main. Chaque jalon ci-dessus porte sur un seul plan : plus long, plus net, avec du son. Aucun ne décide de ce que dit la pub, du plan qui ouvre ou de l’endroit où tombe la coupe. Un modèle montrera une personne en train de manger aussi longtemps qu’on le lui demande. Quelqu’un doit encore décider pourquoi le public continuerait de regarder.
La continuité d’un plan à l’autre reste un travail de réalisation. Parmi les limites de son propre modèle, OpenAI notait en 2024 que manger de la nourriture ne la modifiait pas toujours correctement. À l’intérieur d’un plan, les modèles ont beaucoup progressé depuis. Entre des plans générés séparément, un visage, l’étiquette d’un produit ou la lumière peuvent encore changer. Les références réduisent cette dérive ; il faut quand même que quelqu’un vérifie chaque coupe.
Le jugement sonore n’est pas venu avec le son. Quand des utilisateurs ont fait passer le test des spaghettis au nouveau modèle de Google en mai 2025, PetaPixel a décrit un Will Smith convaincant qui faisait des bruits de croquant et de succion en mâchant ses pâtes. L’audio était synchronisé, et faux pour la scène. Décider ce que le spectateur entend, ce qu’on laisse de côté et la place du produit par rapport à la voix reste une décision de mixage, et une partie de l’audio généré est habituellement remplacée en postproduction.
Les droits ont bougé, mais pas vers les raccourcis
Le clip de 2023 utilisait un visage célèbre pour lequel personne n’avait obtenu de licence. Les modèles ont changé, la question demeure. En février 2026, Axios rapportait que Disney avait envoyé à ByteDance une mise en demeure au sujet de son nouveau modèle vidéo, l’accusant de reproduire des personnages de Disney et d’en tirer des œuvres dérivées sans autorisation.
La propriété du résultat n’est pas réglée non plus. En janvier 2025, le Copyright Office des États-Unis concluait que « la simple fourniture de consignes » ne fait pas de quelqu’un l’auteur de ce que produit un modèle. La protection peut quand même s’appliquer lorsqu’une personne détermine assez d’éléments expressifs, par exemple en modifiant le résultat ou en l’intégrant à une œuvre plus large. Pour une marque, la contribution humaine à une vidéo IA devient donc quelque chose à documenter.
Ce qu’une marque peut attendre aujourd’hui, et ce qu’elle doit encore vérifier
Une marque peut désormais s’attendre à des plans uniques propres de plusieurs secondes, à un son synchronisé, à une meilleure résolution et à un produit ou un visage fidèle à sa référence à l’intérieur de chaque plan. Elle doit quand même vérifier :
- La résolution à laquelle chaque plan final a été généré, et si les plans longs ont été prolongés en basse résolution, puis suréchantillonnés.
- Comment le produit, les visages et le décor sont restés cohérents d’un plan à l’autre.
- Qui a conçu le son, et quelles parties de l’audio généré ont été conservées.
- Quelles références ont servi, à qui elles appartiennent, et si une personne réelle, un personnage ou une marque apparaît sans autorisation.
- Quel travail créatif humain est documenté, au cas où la propriété du film serait un jour contestée.
Sources
- AI Will Smith Eating Spaghetti Will Haunt You For the Rest of Your Life (Samantha Cole, Vice, 28 mars 2023, en anglais)
- Text to Video Generative AI Is Finally Here and It’s Weird as Hell (Kyle Barr, Gizmodo, 22 mars 2023, en anglais)
- Outil texte-vidéo désormais offert gratuitement à tous (Avram Piltch, Tom’s Hardware, 8 juin 2023, en anglais)
- Will Smith eating spaghetti and other weird AI benchmarks that took off in 2024 (Kyle Wiggers, TechCrunch, 31 décembre 2024, en anglais)
- Video generation models as world simulators (OpenAI, 15 février 2024, en anglais)
- Fuel your creativity with new generative media models and tools (Eli Collins, Google, 20 mai 2025, en anglais)
- Le nouveau modèle vidéo de Google et le test de Will Smith qui mange des spaghettis (PetaPixel, mai 2025, en anglais)
- One-take Creation, Flexible Referencing : annonce de modèle (ByteDance Seed, 31 juillet 2026, en anglais)
- Documentation pour développeurs sur la génération vidéo (Google AI for Developers, consultée le 1er octobre 2026, en anglais)
- Scoop: Disney sends cease and desist letter to ByteDance (Sara Fischer, Axios, 13 février 2026, en anglais)
- Copyright Office Releases Part 2 of Artificial Intelligence Report (U.S. Copyright Office, 29 janvier 2025, en anglais)