Auteur: Elena Volkov · Publié: 2026-09-07 · 8 min de lecture
Garder des visages cohérents en transformant des photos en vidéo avec Vivify AI
Un guide pratique pour animer des photos fixes avec Vivify AI tout en préservant les traits du visage, avec des instructions étape par étape, des conseils de prompt et des réponses aux questions courantes sur les clips sociaux courts, les avatars et les présentations de produits.

Pourquoi la cohérence du visage compte en image-vers-vidéo
Quand vous téléversez un portrait, une photo de produit ou un avatar dans un outil image-vers-vidéo, le modèle doit inventer le mouvement. Les yeux clignent, les lèvres bougent, les cheveux se déplacent, la lumière change. Le risque est que le visage dérive : la mâchoire s'adoucit, le nez se rétrécit, les yeux changent de couleur, ou la personne commence à ressembler à un inconnu. Pour les clips sociaux courts, les avatars parlants et les présentations de produits, cette dérive fait la différence entre un clip qui semble réel et un clip qui semble bizarre.
Vivify AI est conçu pour la vidéo courte, donc la cohérence du visage est traitée comme un problème de premier plan plutôt que comme une réflexion après coup. Le pipeline image-vers-vidéo ancre la première image à votre photo téléversée, puis utilise les moteurs sous-jacents (Veo, Kling, Sora, et FLUX pour les images fixes) pour ajouter du mouvement par-dessus cette ancre. Le résultat est un clip où le sujet ressemble toujours au sujet, juste en mouvement.
Comment Vivify AI aborde la préservation du visage
Trois éléments fonctionnent ensemble quand vous animez une image fixe dans Vivify AI :
- Ancrage d'image. La première image de la vidéo générée est verrouillée à votre image téléversée. Le modèle n'est pas libre de redessiner le visage à partir de zéro ; il doit étendre les pixels existants en mouvement.
- Conditionnement d'identité. En coulisses, le pipeline extrait un embedding facial de votre photo. Cet embedding agit comme un identifiant de référence, indiquant au modèle quelle structure faciale, quel teint et quelles proportions garder stables d'une image à l'autre.
- Budget de mouvement. Au lieu de demander au modèle d'inventer de grands mouvements de caméra et de grandes expressions en même temps, Vivify AI vous permet de séparer le mouvement de l'identité. Vous choisissez combien le sujet bouge (subtil, moyen, expressif) et combien la caméra bouge (statique, panoramique lent, dolly). Des budgets de mouvement plus petits et plus contrôlés tendent à produire des visages plus cohérents.
Vous n'avez pas besoin de comprendre l'aspect technique pour en bénéficier. Vous avez juste besoin de fournir à l'outil une image source propre et d'écrire un prompt qui ne lutte pas contre l'ancre.
Avant de commencer : choisir la bonne photo source
Le plus grand facteur de cohérence du visage est la photo que vous téléversez. Une bonne image source facilite le travail du modèle ; une mauvaise le force à deviner.
Utilisez une photo qui est :
- Nette et bien éclairée. Un éclairage doux et uniforme aide le modèle à lire la structure du visage. Un éclairage latéral dur peut projeter des ombres que le modèle peut « corriger » pendant l'animation, ce qui change le visage.
- De face ou presque de face. Les angles trois-quarts fonctionnent, mais les profils extrêmes sont plus difficiles à ancrer. Si vous avez le choix, prenez l'angle le plus neutre.
- Haute résolution. Visez au moins 1024x1024. Vivify AI accepte les formats courants (JPG, PNG, WebP) et réduira l'échelle en interne si nécessaire, mais commencer net donne au modèle plus de matière à exploiter.
- Dégagée. Pas de mains sur le visage, pas de lunettes de soleil, pas de cheveux couvrant les yeux. Tout ce qui cache une partie du visage donne au modèle la permission d'inventer ce qui se trouve en dessous.
- Sujet unique. Les photos de groupe rendent le conditionnement d'identité plus difficile parce que le modèle doit choisir quel visage verrouiller. Recadrez sur une seule personne si possible.
Si vous créez un avatar pour une marque ou un personnage récurrent, construisez une petite bibliothèque de photos sources approuvées dans le même style d'éclairage. La cohérence de vos entrées est le moyen le plus simple d'obtenir la cohérence de vos sorties.
Étape par étape : animer une photo dans Vivify AI
Voici un flux de travail qui tient la route dans la plupart des cas d'usage, d'un clip Instagram de 5 secondes à une présentation de produit plus longue.
Étape 1 : Ouvrez l'outil image-vers-vidéo. Sur iOS, Android ou le web, le point d'entrée est généralement étiqueté « Image to Video » ou « Animate Photo ». Appuyez dessus.
Étape 2 : Téléversez votre image source. Glissez-déposez ou choisissez depuis votre pellicule. Attendez que l'aperçu confirme que le visage a été détecté. Si l'outil signale l'image (faible lumière, plusieurs visages, occlusion importante), envisagez de la remplacer par une photo plus propre.
Étape 3 : Choisissez un moteur. Vivify AI route les tâches image-vers-vidéo vers différents moteurs selon le style souhaité. Pour un mouvement humain réaliste, Veo et Kling tendent à être de bons choix. Pour des looks stylisés ou animés, les chemins basés sur Sora et FLUX peuvent donner des résultats plus picturaux. Vous pouvez faire passer la même image dans plusieurs moteurs et comparer.
Étape 4 : Définissez la durée. Les clips courts vivent généralement dans la plage de 3 à 8 secondes. Les clips plus courts sont plus faciles à garder cohérents parce qu'il y a moins d'images où la dérive peut s'accumuler. Si vous avez besoin d'une vidéo plus longue, prévoyez d'assembler plusieurs générations courtes plutôt que de demander une seule longue prise.
Étape 5 : Choisissez un format d'image. 9:16 pour TikTok, Reels et Shorts. 1:1 pour les publications dans le fil. 16:9 pour YouTube ou les clips web intégrés. Choisissez le format avant d'écrire votre prompt afin de cadrer le mouvement correctement.
Étape 6 : Écrivez un prompt de mouvement, pas une description. La plus grande erreur que les gens font est d'écrire un prompt qui décrit la photo (« une femme en chemise rouge debout dans un parc »). Le modèle a déjà la photo. Ce dont il a besoin de votre part, c'est le mouvement. Les bons prompts décrivent :
- Ce que le sujet fait (sourit, tourne légèrement la tête, cligne, parle)
- Ce que la caméra fait (statique, push-in lent, parallaxe doux)
- Ce que l'environnement fait (les feuilles bruissent, les lumières scintillent, la vapeur monte)
Un prompt simple et fiable pour un portrait ressemble à : « Sourire subtil, les yeux clignent une fois, push-in caméra doux, vent léger dans les cheveux. » C'est suffisant. Ajouter plus d'adjectifs ajoute généralement plus de dérive.
Étape 7 : Réglez l'intensité du mouvement. Si Vivify AI expose un curseur, commencez au milieu. Un mouvement subtil préserve mieux les visages qu'un mouvement expressif. Vous pouvez toujours relancer avec une intensité plus élevée si le premier résultat semble trop statique.
Étape 8 : Générez et examinez. Regardez le clip entier, pas seulement la première image. Faites attention à la dernière seconde. C'est là que la dérive apparaît le plus souvent. Si le visage change vers la fin, baissez l'intensité du mouvement ou raccourcissez le clip.
Étape 9 : Affinez. Si quelque chose ne va pas, ne recommencez pas à zéro. Essayez une variable à la fois : changez de moteur, raccourcissez la durée, ou élaguez le prompt. Tout changer en même temps rend impossible de savoir ce qui a aidé.
Modèles de prompt qui gardent les visages stables
Quelques modèles de prompt tendent à produire des résultats plus cohérents dans Vivify AI :
- Ancrez les yeux. Des expressions comme « les yeux restent fixés sur la caméra » ou « le regard reste stable » réduisent le risque que le modèle invente de nouvelles directions du regard en milieu de clip.
- Limitez les expressions. « Sourire doux » est plus sûr que « grand rire ». Les mouvements musculaires plus petits sont plus faciles à garder fidèles au modèle.
- Séparez sujet et caméra. Au lieu de « la caméra tourne autour du sujet », essayez « le sujet tourne lentement la tête tandis que la caméra reste statique ». Le mouvement composé est là où les visages se déforment.
- Décrivez l'état final. « Revient à une expression neutre à la fin » donne au modèle une cible sur laquelle atterrir, ce qui réduit la dérive résiduelle.
Cas d'usage courants
Avatars parlants. Téléversez une photo de tête propre, demandez un mouvement subtil de la bouche et un contact visuel, gardez la caméra statique. Cela fonctionne bien pour les clips d'intro, les miniatures de cours et les présentateurs générés par IA.
Présentations de produits avec un élément humain. Si votre photo de produit inclut un modèle tenant ou portant l'article, animez le modèle avec un très petit mouvement (un léger tour de tête, une respiration) et laissez le produit rester immobile. Les visages restent cohérents et le produit reste précis.
Clips sociaux à partir d'une seule photo. Un portrait fixe peut devenir une boucle de 4 secondes pour Reels ou Shorts. Gardez la boucle courte, gardez le mouvement subtil, et vous obtenez un clip qui semble vivant sans avoir l'air généré par IA.
Cohérence de personnage à travers une série. Si vous construisez un personnage récurrent, sauvegardez l'image source et le prompt exact qui a fonctionné. Relancer les mêmes entrées dans Vivify AI tend à produire des sorties très similaires, ce qui est exactement ce que vous voulez pour une série.
Dépannage de la dérive du visage
Si le visage dans votre clip généré ne correspond pas à la source :
- Vérifiez la source. Les visages flous ou à faible contraste dérivent davantage. Re-photographiez ou ré-exportez à une qualité plus élevée.
- Raccourcissez le clip. La dérive s'accumule au fil des images. Un clip de 4 secondes est plus stable qu'un clip de 10 secondes.
- Baissez l'intensité du mouvement. Des mouvements plus petits laissent moins de place au modèle pour improviser.
- Changez de moteur. Différents moteurs ont différentes forces. Si l'un dérive, essayez-en un autre.
- Simplifiez le prompt. Les prompts longs et chargés d'adjectifs donnent au modèle plus de liberté. Épurez à l'essentiel.
- Recadrez plus serré. Un visage qui remplit plus de cadre est plus facile à verrouiller pour le modèle qu'un petit visage dans une scène large.
FAQ
Quel est le meilleur format d'image pour la cohérence du visage dans Vivify AI ? PNG ou JPG haute qualité à 1024x1024 ou plus. Évitez les images fortement compressées, les captures d'écran ou les photos avec des filtres lourds, car ceux-ci réduisent le détail dont le modèle a besoin pour ancrer le visage.
Puis-je animer plus d'un visage dans la même photo ? Vous pouvez, mais les résultats sont plus cohérents avec un seul sujet. Si vous téléversez une photo de groupe, le modèle doit choisir un visage principal à verrouiller, et les visages secondaires peuvent bouger davantage. Pour les scènes multi-personnes, recadrez sur une seule personne ou générez des clips séparés et composez-les.
Quelle durée doit avoir mon clip image-vers-vidéo pour les visages les plus cohérents ? Plus court est plus sûr. La plupart des utilisateurs obtiennent la meilleure cohérence du visage dans la plage de 3 à 6 secondes. Si vous avez besoin d'une vidéo plus longue, générez plusieurs clips courts avec la même image source et le même prompt, puis assemblez-les dans un éditeur.
Conseils finaux
Traitez votre photo source comme un casting. Plus elle est propre et neutre, plus Vivify AI peut fidèlement la faire vivre. Traitez votre prompt comme une direction, pas une description. Dites au modèle ce qui bouge, pas ce qui est dans le cadre. Et traitez l'intensité du mouvement comme un bouton de volume : ne le montez que jusqu'où le visage peut aller sans dériver.
Bien fait, une photo animée dans Vivify AI ne ressemble pas à un effet IA. Elle ressemble à un moment qui se trouve avoir été capturé en vidéo.
Créer avec Vivify AI
Téléchargez l'app et transformez vos idées en vidéos en quelques minutes.