T2VA
Text zu Video
Text-Prompt
Offene Konzepte, Anzeigen und filmische Szenen.
Beschreiben Sie die Ausgangskomposition, eine klare Handlung, Kamerapfad und Ton.
Diesen Workflow öffnenWählen Sie den richtigen Generierungsmodus, erstellen Sie einen Prompt mit der offiziellen H3-Struktur, weisen Sie Referenzrollen zu und beheben Sie häufige Fehler ohne Rätselraten.
01 / MODE PICKER
Starten Sie hier. Die Wahl des falschen Modus erzeugt Konflikte, bevor das Modell auch nur eine Kameraanweisung liest.
T2VA
Text-Prompt
Offene Konzepte, Anzeigen und filmische Szenen.
Beschreiben Sie die Ausgangskomposition, eine klare Handlung, Kamerapfad und Ton.
Diesen Workflow öffnenI2VA
Erstes Bild + Prompt
Steuerung von Identität, Produktform und Komposition.
Das Bild bestimmt den statischen Frame; der Prompt sollte erklären, was sich als Nächstes bewegt.
Diesen Workflow öffnenFL2VA
Erstes Bild + letztes Bild + Prompt
Transformationen und exakte Annäherung an den Endzustand.
Verwenden Sie einen erreichbaren Bewegungspfad; halten Sie die beiden Frames kompositorisch kompatibel.
Diesen Workflow öffnenL2VA
Letztes Bild + Prompt
Logo-Enthüllungen, Produkt-Endkarten und gestaltete Abschlüsse.
Beschreiben Sie einen plausiblen früheren Zustand und wie sich jedes Element in das bereitgestellte Bild einfügt.
Diesen Workflow öffnenRef2VA
Bilder, Video, Audio + Prompt
Übertragung von Identität, Produkt, Bewegung, Kamera oder Stimme.
Weisen Sie jedem Asset eine eindeutige Aufgabe zu und geben Sie an, was erhalten bleiben muss.
Diesen Workflow öffnenCONTROL RULES
Verwenden Sie diese Regeln, bevor Sie filmische Details hinzufügen. Mehr Wörter lösen kein widersprüchliches Briefing.
Der Eingabetyp bestimmt, was der Prompt steuern soll. Schreiben Sie keinen universellen Prompt für jeden Workflow.
Kurze Clips benötigen ein gut erkennbares Ereignis. Fügen Sie nur dann eine neue Einstellung hinzu, wenn sich die visuellen Informationen wirklich ändern.
Trennen Sie Identitäts-, Produkt-, Bewegungs-, Kamera- und Sprachrollen, damit die Referenzen nicht miteinander konkurrieren.
Ersetzen Sie vage Negativangaben durch explizite Zustände: statische Kamera, geschlossene Lippen, exaktes Gesicht, unveränderte Garderobe.
02 / PROMPT BUILDER
Der Builder ändert seine Ausrichtungsanweisung, Referenzlabels und Inhaltsrollen von API für den ausgewählten H3-Modus.
Generierungsmodus
10s. A matte-red portable speaker remains geometrically consistent. A rim light traces the silhouette, then the speaker settles into a clean hero frame. Minimal dark studio, soft haze, precise reflections and generous negative space. The camera performs a Push In with small amplitude at slow speed. One soft dial click, restrained room tone and a synchronized low-frequency pulse. Minimal electronic percussion, moderate tempo, ending cleanly on the hero frame.Die Ausgabe aktualisiert sich während der Eingabe. Halten Sie strukturelle Prompts auf Englisch; verwenden Sie die Zielsprache für Dialoge und Bildschirmtext.
462/700003 / OFFICIAL ANATOMY
Verwenden Sie die Feldnamen als Denksystem: zuerst Visuals und Einstellungen, dann diegetischer Ton, zuletzt Musik nur für das Publikum.
T2VA / I2VA / FL2VA / L2VA
{I2VA / FL2VA / L2VA alignment instruction when applicable}
integrated_multimodal_description:
[Shot 1] {initial composition}. {subject action}.
[Shot 2] At 00:04.000, {new visual information}.
overall_soundscape:
{ambience + physical sounds}
non_diegetic_music:
{instrumentation + tempo + dynamics}; or N/ARef2VA
subject_definitions:
<Subject 1> is the product shown in <Picture 1>; preserve its geometry, material, color and logo.
<Video 1> is the camera-path and pacing reference.
summary:
[reference generation] {creative goal using Subject 1}
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - {exact attributes}
<Video 1> (camera and pacing structure): weak_reference - {relationship}
detailed_description:
{style sentence}
[Shot 1] <Subject 1> ...
overall_soundscape:
...
non_diegetic_music:
...tracking shot + medium amplitude + slow speed(S1) says <d>[Chinese] 原句</d>instrumentation + tempo + dynamics; or N/A04 / REFERENCE ROLES
Eine klare Rollenübersicht ist nützlicher als weitere Referenzen. Wiederholen Sie die zwingend zu bewahrenden Details im Text.
<Subject 1>Identität: Gesicht, Haare, Kleidung
<Subject 2>Produkt aus Bild 2: Geometrie, Material, Farbe
<Picture 3>Zuerst konkret, dann Schlüssel- oder Letztbild-Anker
<Video 1>Bewegung: Gehrhythmus und Kamerapfad
<Audio 1>Stimme: nur Klangfarbe
Erhaltungsvertrag
In Video 1, change only the original package to the exact product from Picture 1.
Preserve the actor identity, hands, timing, camera path, background and lighting.
Keep the product geometry, color and logo from Picture 1 unchanged.PROMPT RECIPES
Dies sind originale Lehrvorlagen, keine Zusagen garantierter Ergebnisse. Passen Sie jeweils nur eine Variable an.
10s premium product film. A matte-red speaker in clean negative space. Slow push-in as rim light traces the exact silhouette; cut once to a macro texture shot, then settle into a stable hero frame. One soft dial click, restrained room tone, minimal electronic percussion.
Diesen Prompt verwendenPicture 1 anchors 0.00s and Picture 2 anchors 8.00s. Use one continuous shot. The hand pulls the ribbon and the paper unfolds in observable stages. Every moving element gradually settles into the exact composition, lighting and hand position of Picture 2.
Diesen Prompt verwendenIn Video 1, change only the package to the exact product from Picture 1. Preserve actor identity, hands, timing, camera path, background, lighting and all other motion. Keep product geometry, color and logo unchanged.
Diesen Prompt verwenden05 / TROUBLESHOOTING
Ändern Sie pro Wiederholung nur eine Steuerungsvariable, damit Sie erkennen können, welche Anweisung das Ergebnis verbessert hat.
| Symptom | Wahrscheinliche Ursache | Nächstes ändern |
|---|---|---|
| Gesicht oder Produkt driftet ab | Die Referenzrolle ist implizit oder wird mit Stil und Bewegung geteilt. | Weisen Sie einer klaren Abbildung eine Identität zu und nennen Sie die genauen zu bewahrenden Merkmale. |
| Konflikte bei Kamerabewegungen | Die Videoreferenz und der Text beschreiben unterschiedliche Kamerapfade. | Lassen Sie die Referenz den Verlauf bestimmen; verwenden Sie Text nur für Geschwindigkeit oder Amplitude. |
| Dialog ist zu schnell oder passt nicht | Die Zeile ist zu lang, der Sprecher wechselt oder das Timing ist nicht verankert. | Kürzen Sie die Zeile, behalten Sie eine Sprecher-ID bei und platzieren Sie sie in der passenden Einstellung. |
| Sprünge zwischen erstem/letztem Frame | Die Frames unterscheiden sich im Kamerawinkel, Maßstab oder durch zu viele unabhängige Objekte. | Erstellen Sie das letzte Bild aus dem ersten, ändern Sie einen erreichbaren Zustand und beschreiben Sie einen durchgehenden Pfad. |
06 / CONTRACT BOUNDARIES
Kennzeichnen Sie jede Dauer, Auflösung, jeden Parameter und jede Modell-ID mit der Oberfläche, die sie tatsächlich bereitstellt.
Offizielle API Dauer
4–15s
Offizielle Auflösung
768P / 2K
Seitenverhältnis im Frame-Modus
adaptive
T2V-Seitenverhältnis
21:9 → 9:16
Verwenden Sie das offizielle Anfrageschema, den Modellstring und die Fähigkeitsdokumentation als maßgebliche Quelle.
Offizieller API LeitfadenVerwenden Sie nur die Modi, Steuerelemente, Preise und Limits, die im aktuellen Arbeitsbereich sichtbar sind.
Arbeitsbereich öffnenWählen Sie den Workflow und die Gewichtungen, die zu T2V, Bild-Frame- oder Referenzgenerierung passen.
ComfyUI-LeitfadenFAQ
Modus, Referenzen, Dialog und Plattformverträge sollten vor der stilistischen Ausarbeitung festgelegt werden.
Verwenden Sie T2VA für reine Textkonzepte, I2VA, wenn ein erster Frame die Komposition bestimmt, FL2VA, wenn beide Endpunkte wichtig sind, L2VA für ein gestaltetes Ende und Ref2VA, wenn vorhandene Bilder, Videos oder Audio bestimmte Attribute steuern müssen.
Gehen Sie nicht davon aus, dass dies anbieterübergreifend existiert. Formulieren Sie stattdessen positive Bedingungen für die Beibehaltung: „Die Kamera hält eine statische Aufnahme“, „Das exakte Gesicht und die Garderobe beibehalten“ oder „Die Lippen bleiben geschlossen“.
Halten Sie Sprecher-IDs stabil, kennzeichnen Sie die Dialogsprache, halten Sie Zeilen kurz genug für die Dauer und trennen Sie Dialog von Atmosphäre, physischen Geräuschen und Musik, die nur das Publikum hört.
Nein. Modellgewichte, Eingabemodi, Dauer, Auflösung und Parameter können sich unterscheiden. Lesen Sie immer den Vertrag für die verwendete Oberfläche.
Quellen & Verifizierung
Letzte Inhaltsprüfung: 11. August 2026. Die Vorlagen auf dieser Seite sind originale Lehrmaterialien, die auf den verlinkten Strukturen basieren.
Wählen Sie den Workflow, der zu Ihrem Ausgangsmaterial passt, erstellen Sie oben den Prompt und übernehmen Sie ihn dann in den entsprechenden Generator.