T2VA
Da testo a video
Prompt testuale
Concetti aperti, annunci e scene cinematografiche.
Descrivi la composizione iniziale, un'azione chiara, il percorso della telecamera e il suono.
Apri questo flusso di lavoroScegli la modalità di generazione giusta, crea un prompt con la struttura H3 ufficiale, assegna i ruoli ai riferimenti e risolvi gli errori comuni senza andare a tentoni.
01 / MODE PICKER
Inizia da qui. Scegliere la modalità sbagliata crea conflitti prima ancora che il modello legga una singola istruzione sulla videocamera.
T2VA
Prompt testuale
Concetti aperti, annunci e scene cinematografiche.
Descrivi la composizione iniziale, un'azione chiara, il percorso della telecamera e il suono.
Apri questo flusso di lavoroI2VA
Prima immagine + prompt
Controllo di identità, forma del prodotto e composizione.
L'immagine definisce il fotogramma statico; il prompt dovrebbe spiegare cosa si muove dopo.
Apri questo flusso di lavoroFL2VA
Prima immagine + ultima immagine + prompt
Trasformazioni e convergenza esatta allo stato finale.
Usa un solo percorso di movimento realizzabile; mantieni i due fotogrammi compatibili dal punto di vista compositivo.
Apri questo flusso di lavoroL2VA
Ultima immagine + prompt
Rivelazioni del logo, schermate finali del prodotto e finali progettati.
Descrivi uno stato precedente plausibile e il modo in cui ogni elemento si stabilizza nel fotogramma fornito.
Apri questo flusso di lavoroRef2VA
Immagini, video, audio + prompt
Trasferimento di identità, prodotto, movimento, fotocamera o voce.
Assegna un compito esplicito a ogni risorsa e indica cosa deve essere preservato.
Apri questo flusso di lavoroCONTROL RULES
Usa queste regole prima di aggiungere dettagli cinematografici. Più parole non risolvono un brief conflittuale.
Il tipo di input cambia ciò che il prompt deve controllare. Non scrivere un unico prompt universale per ogni flusso di lavoro.
Le clip brevi richiedono un evento leggibile. Aggiungi una nuova inquadratura solo quando le informazioni visive cambiano davvero.
Separa i ruoli di identità, prodotto, movimento, videocamera e voce affinché i riferimenti non entrino in conflitto.
Sostituisci le negazioni vaghe con stati espliciti: videocamera statica, labbra chiuse, volto esatto, abbigliamento invariato.
02 / PROMPT BUILDER
Il builder modifica le istruzioni di allineamento, le etichette dei riferimenti e i ruoli dei contenuti API per la modalità H3 selezionata.
Modalità di generazione
10s. A matte-red portable speaker remains geometrically consistent. A rim light traces the silhouette, then the speaker settles into a clean hero frame. Minimal dark studio, soft haze, precise reflections and generous negative space. The camera performs a Push In with small amplitude at slow speed. One soft dial click, restrained room tone and a synchronized low-frequency pulse. Minimal electronic percussion, moderate tempo, ending cleanly on the hero frame.L'output si aggiorna mentre scrivi. Mantieni i prompt strutturali in inglese; usa la lingua di destinazione per dialoghi e testo sullo schermo.
462/700003 / OFFICIAL ANATOMY
Usa i nomi dei campi come sistema di ragionamento: prima immagini e riprese, poi suono diegetico, infine musica solo per il pubblico.
T2VA / I2VA / FL2VA / L2VA
{I2VA / FL2VA / L2VA alignment instruction when applicable}
integrated_multimodal_description:
[Shot 1] {initial composition}. {subject action}.
[Shot 2] At 00:04.000, {new visual information}.
overall_soundscape:
{ambience + physical sounds}
non_diegetic_music:
{instrumentation + tempo + dynamics}; or N/ARef2VA
subject_definitions:
<Subject 1> is the product shown in <Picture 1>; preserve its geometry, material, color and logo.
<Video 1> is the camera-path and pacing reference.
summary:
[reference generation] {creative goal using Subject 1}
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - {exact attributes}
<Video 1> (camera and pacing structure): weak_reference - {relationship}
detailed_description:
{style sentence}
[Shot 1] <Subject 1> ...
overall_soundscape:
...
non_diegetic_music:
...tracking shot + medium amplitude + slow speed(S1) says <d>[Chinese] 原句</d>instrumentation + tempo + dynamics; or N/A04 / REFERENCE ROLES
Una chiara mappa dei ruoli è più utile che aggiungere altri riferimenti. Ripeti nel testo i dettagli da preservare assolutamente.
<Subject 1>Identità: viso, capelli, abbigliamento
<Subject 2>Prodotto dall'immagine 2: geometria, materiale, colore
<Picture 3>Prima il concreto, ancora al fotogramma chiave o finale
<Video 1>Movimento: ritmo della camminata e traiettoria della videocamera
<Audio 1>Voce: solo timbro
Contratto di preservazione
In Video 1, change only the original package to the exact product from Picture 1.
Preserve the actor identity, hands, timing, camera path, background and lighting.
Keep the product geometry, color and logo from Picture 1 unchanged.PROMPT RECIPES
Questi sono modelli didattici originali, non dichiarazioni di output garantito. Adatta una variabile alla volta.
10s premium product film. A matte-red speaker in clean negative space. Slow push-in as rim light traces the exact silhouette; cut once to a macro texture shot, then settle into a stable hero frame. One soft dial click, restrained room tone, minimal electronic percussion.
Usa questo promptPicture 1 anchors 0.00s and Picture 2 anchors 8.00s. Use one continuous shot. The hand pulls the ribbon and the paper unfolds in observable stages. Every moving element gradually settles into the exact composition, lighting and hand position of Picture 2.
Usa questo promptIn Video 1, change only the package to the exact product from Picture 1. Preserve actor identity, hands, timing, camera path, background, lighting and all other motion. Keep product geometry, color and logo unchanged.
Usa questo prompt05 / TROUBLESHOOTING
Modifica una sola variabile di controllo per tentativo, così puoi capire quale istruzione ha migliorato il risultato.
| Sintomo | Causa probabile | Cambia successivo |
|---|---|---|
| Il volto o il prodotto cambia | Il ruolo del riferimento è implicito o condiviso con stile e movimento. | Assegna l'identità a un'immagine nitida ed elenca le caratteristiche esatte da preservare. |
| Conflitti di movimento della fotocamera | Il riferimento video e il testo descrivono percorsi della telecamera diversi. | Lascia che il riferimento definisca il percorso; usa il testo solo per velocità o ampiezza. |
| Il dialogo è affrettato o non corrisponde | La riga è troppo lunga, cambia l'oratore o la tempistica non è ancorata. | Accorcia la battuta, mantieni un solo ID parlante e inseriscila nell'inquadratura corrispondente. |
| Salti tra primo e ultimo fotogramma | I fotogrammi differiscono per angolazione della telecamera, scala o per troppi oggetti indipendenti. | Crea l'ultimo fotogramma dal primo, modifica uno stato raggiungibile e descrivi un unico percorso continuo. |
06 / CONTRACT BOUNDARIES
Etichetta ogni durata, risoluzione, parametro e ID modello in base alla superficie che lo fornisce effettivamente.
Durata ufficiale API
4–15s
Risoluzione ufficiale
768P / 2K
Proporzioni modalità fotogramma
adaptive
Rapporto T2V
21:9 → 9:16
Usa lo schema di richiesta ufficiale, la stringa del modello e la documentazione delle funzionalità come fonte di verità.
Guida ufficiale APIUsa solo le modalità, i controlli, i prezzi e i limiti visibili nello spazio di lavoro attuale.
Apri spazio di lavoroSeleziona il flusso di lavoro e i pesi adatti a T2V, generazione da fotogramma immagine o da riferimenti.
Guida ComfyUIFAQ
Modalità, riferimenti, dialoghi e contratti di piattaforma devono essere decisi prima della rifinitura dello stile.
Usa T2VA per concetti solo testo, I2VA quando il primo fotogramma definisce la composizione, FL2VA quando entrambi gli estremi sono importanti, L2VA per un finale progettato e Ref2VA quando immagini, video o audio esistenti devono controllare attributi specifici.
Non presumere che ne esista uno valido per tutti i fornitori. Scrivi invece condizioni positive di preservazione: “la telecamera mantiene un'inquadratura statica”, “preserva esattamente volto e abbigliamento” o “le labbra restano chiuse”.
Mantieni stabili gli ID dei parlanti, indica la lingua del dialogo, rendi le battute abbastanza brevi per la durata e separa i dialoghi da ambiente, suoni fisici e musica riservata al pubblico.
No. I pesi del modello, le modalità di input, la durata, la risoluzione e i parametri possono variare. Leggi sempre il contratto relativo alla piattaforma che stai utilizzando.
Fonti e verifica
Ultima verifica dei contenuti: 11 agosto 2026. I modelli in questa pagina sono materiale didattico originale basato sulle strutture collegate.
Scegli il flusso di lavoro che corrisponde al tuo materiale sorgente, crea il prompt qui sopra, quindi portalo nel generatore corrispondente.