T2VA
Texte vers vidéo
Prompt textuel
Concepts ouverts, publicités et scènes cinématographiques.
Décrivez la composition initiale, une action claire, le trajet de caméra et le son.
Ouvrir ce flux de travailChoisissez le bon mode de génération, construisez un prompt avec la structure H3 officielle, attribuez les rôles des références et corrigez les échecs courants sans deviner.
01 / MODE PICKER
Commencez ici. Choisir le mauvais mode crée des conflits avant même que le modèle ne lise une seule instruction de caméra.
T2VA
Prompt textuel
Concepts ouverts, publicités et scènes cinématographiques.
Décrivez la composition initiale, une action claire, le trajet de caméra et le son.
Ouvrir ce flux de travailI2VA
Première image + prompt
Contrôle de l’identité, de la forme et de la composition du produit.
L’image fixe le cadre statique ; le prompt doit expliquer ce qui bouge ensuite.
Ouvrir ce flux de travailFL2VA
Première image + dernière image + prompt
Transformations et convergence exacte vers l’état final.
Utilisez une seule trajectoire de mouvement réalisable ; gardez les deux images compatibles sur le plan de la composition.
Ouvrir ce flux de travailL2VA
Dernière image + prompt
Révélations de logo, écrans de fin produit et conclusions conçues.
Décrivez un état antérieur plausible et comment chaque élément se met en place dans l’image fournie.
Ouvrir ce flux de travailRef2VA
Images, vidéo, audio + prompt
Transfert de l’identité, du produit, du mouvement, de la caméra ou de la voix.
Attribuez une fonction explicite à chaque élément et indiquez ce qui doit être préservé.
Ouvrir ce flux de travailCONTROL RULES
Appliquez ces règles avant d’ajouter des détails cinématographiques. Plus de mots ne résoudront pas un brief contradictoire.
Le type d’entrée détermine ce que le prompt doit contrôler. N’écrivez pas un prompt universel pour chaque workflow.
Les clips courts nécessitent un événement facile à comprendre. Ajoutez un nouveau plan uniquement lorsque les informations visuelles changent réellement.
Séparez les rôles d’identité, de produit, de mouvement, de caméra et de voix afin que les références ne se concurrencent pas.
Remplacez les négations vagues par des états explicites : caméra fixe, lèvres fermées, visage identique, tenue inchangée.
02 / PROMPT BUILDER
Le générateur adapte son instruction d’alignement, ses libellés de référence et les rôles de contenu API au mode H3 sélectionné.
Mode de génération
10s. A matte-red portable speaker remains geometrically consistent. A rim light traces the silhouette, then the speaker settles into a clean hero frame. Minimal dark studio, soft haze, precise reflections and generous negative space. The camera performs a Push In with small amplitude at slow speed. One soft dial click, restrained room tone and a synchronized low-frequency pulse. Minimal electronic percussion, moderate tempo, ending cleanly on the hero frame.Le résultat se met à jour pendant la saisie. Gardez les prompts structurels en anglais ; utilisez la langue cible pour les dialogues et le texte à l’écran.
462/700003 / OFFICIAL ANATOMY
Utilisez les noms de champs comme système de réflexion : visuels et plans d’abord, son diégétique ensuite, musique destinée uniquement au public en dernier.
T2VA / I2VA / FL2VA / L2VA
{I2VA / FL2VA / L2VA alignment instruction when applicable}
integrated_multimodal_description:
[Shot 1] {initial composition}. {subject action}.
[Shot 2] At 00:04.000, {new visual information}.
overall_soundscape:
{ambience + physical sounds}
non_diegetic_music:
{instrumentation + tempo + dynamics}; or N/ARef2VA
subject_definitions:
<Subject 1> is the product shown in <Picture 1>; preserve its geometry, material, color and logo.
<Video 1> is the camera-path and pacing reference.
summary:
[reference generation] {creative goal using Subject 1}
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - {exact attributes}
<Video 1> (camera and pacing structure): weak_reference - {relationship}
detailed_description:
{style sentence}
[Shot 1] <Subject 1> ...
overall_soundscape:
...
non_diegetic_music:
...tracking shot + medium amplitude + slow speed(S1) says <d>[Chinese] 原句</d>instrumentation + tempo + dynamics; or N/A04 / REFERENCE ROLES
Une cartographie claire des rôles est plus utile que l'ajout de références. Répétez les détails à préserver absolument dans le texte.
<Subject 1>Identité : visage, cheveux, tenue
<Subject 2>Produit de l'image 2 : géométrie, matériau, couleur
<Picture 3>Ancrage concret au premier, principal ou dernier plan
<Video 1>Mouvement : rythme de marche et trajectoire de caméra
<Audio 1>Voix : timbre uniquement
Contrat de préservation
In Video 1, change only the original package to the exact product from Picture 1.
Preserve the actor identity, hands, timing, camera path, background and lighting.
Keep the product geometry, color and logo from Picture 1 unchanged.PROMPT RECIPES
Il s’agit de modèles pédagogiques originaux, et non de garanties de résultat. Adaptez une variable à la fois.
10s premium product film. A matte-red speaker in clean negative space. Slow push-in as rim light traces the exact silhouette; cut once to a macro texture shot, then settle into a stable hero frame. One soft dial click, restrained room tone, minimal electronic percussion.
Utiliser ce promptPicture 1 anchors 0.00s and Picture 2 anchors 8.00s. Use one continuous shot. The hand pulls the ribbon and the paper unfolds in observable stages. Every moving element gradually settles into the exact composition, lighting and hand position of Picture 2.
Utiliser ce promptIn Video 1, change only the package to the exact product from Picture 1. Preserve actor identity, hands, timing, camera path, background, lighting and all other motion. Keep product geometry, color and logo unchanged.
Utiliser ce prompt05 / TROUBLESHOOTING
Ne modifiez qu’une variable de contrôle par nouvelle tentative afin d’identifier l’instruction qui a amélioré le résultat.
| Symptôme | Cause probable | Modifier la suivante |
|---|---|---|
| Le visage ou le produit dérive | Le rôle de référence est implicite ou partagé avec le style et le mouvement. | Attribuez l’identité à une image nette et indiquez les caractéristiques exactes à préserver. |
| Conflits de mouvement de caméra | La référence vidéo et le texte décrivent des trajectoires de caméra différentes. | Laissez la référence définir la trajectoire ; utilisez le texte uniquement pour la vitesse ou l’amplitude. |
| Le dialogue est précipité ou mal synchronisé | La ligne est trop longue, le locuteur change ou le timing n’est pas défini. | Raccourcissez la réplique, conservez un seul identifiant de locuteur et placez-le dans le plan correspondant. |
| Sauts entre la première et la dernière image | Les images diffèrent par l’angle de caméra, l’échelle ou comportent trop d’objets indépendants. | Créez le dernier plan à partir du premier, modifiez un état atteignable et décrivez une trajectoire continue. |
06 / CONTRACT BOUNDARIES
Associez chaque durée, résolution, paramètre et identifiant de modèle à l’interface qui le fournit réellement.
Durée officielle de API
4–15s
Résolution officielle
768P / 2K
Format du mode image
adaptive
Format T2V
21:9 → 9:16
Utilisez le schéma de requête officiel, la chaîne de modèle et la documentation des fonctionnalités comme source de vérité.
Guide officiel APIUtilisez uniquement les modes, commandes, prix et limites visibles dans l’espace de travail actuel.
Ouvrir l'espace de travailSélectionnez le workflow et les pondérations adaptés à la génération T2V, à partir d’une image-clé ou de références.
Guide ComfyUIFAQ
Le mode, les références, les dialogues et les contrats de plateforme doivent être définis avant les finitions stylistiques.
Utilisez T2VA pour les concepts uniquement textuels, I2VA lorsqu’une première image fixe la composition, FL2VA lorsque les deux extrémités comptent, L2VA pour une fin conçue et Ref2VA lorsque des images, vidéos ou audios existants doivent contrôler certains attributs.
Ne supposez pas qu’il en existe un commun à tous les fournisseurs. Écrivez plutôt des conditions positives de préservation : « la caméra reste fixe », « préserver exactement le visage et la tenue » ou « les lèvres restent fermées ».
Conservez des identifiants de locuteurs stables, indiquez la langue des dialogues, gardez des répliques assez courtes pour la durée et séparez les dialogues de l’ambiance, des sons physiques et de la musique réservée au public.
Non. Les poids du modèle, les modes d'entrée, la durée, la résolution et les paramètres peuvent différer. Lisez toujours le contrat correspondant à l'interface utilisée.
Sources et vérification
Dernière vérification du contenu : 11 août 2026. Les modèles de cette page sont des supports pédagogiques originaux fondés sur les structures liées.
Choisissez le workflow correspondant à votre contenu source, rédigez le prompt ci-dessus, puis utilisez-le dans le générateur correspondant.