T2VA
Texto a video
Indicación de texto
Conceptos abiertos, anuncios y escenas cinematográficas.
Describe la composición inicial, una acción clara, la trayectoria de cámara y el sonido.
Abrir este flujo de trabajoElige el modo de generación adecuado, crea un prompt con la estructura oficial de H3, asigna roles a las referencias y corrige los fallos comunes sin adivinar.
01 / MODE PICKER
Empieza aquí. Elegir el modo incorrecto genera conflictos antes de que el modelo lea una sola instrucción de cámara.
T2VA
Indicación de texto
Conceptos abiertos, anuncios y escenas cinematográficas.
Describe la composición inicial, una acción clara, la trayectoria de cámara y el sonido.
Abrir este flujo de trabajoI2VA
Primera imagen + prompt
Control de identidad, forma del producto y composición.
La imagen define el fotograma estático; la indicación debe explicar qué se mueve después.
Abrir este flujo de trabajoFL2VA
Primera imagen + última imagen + prompt
Transformaciones y convergencia exacta del estado final.
Usa una única trayectoria de movimiento alcanzable; mantén la composición de ambos fotogramas compatible.
Abrir este flujo de trabajoL2VA
Última imagen + prompt
Revelaciones de logotipos, tarjetas finales de productos y cierres diseñados.
Describe un estado anterior plausible y cómo cada elemento se asienta en el fotograma proporcionado.
Abrir este flujo de trabajoRef2VA
Imágenes, video, audio + prompt
Transferencia de identidad, producto, movimiento, cámara o voz.
Asigna una función explícita a cada recurso e indica qué debe conservarse.
Abrir este flujo de trabajoCONTROL RULES
Usa estas reglas antes de añadir detalles cinematográficos. Más palabras no solucionan un briefing contradictorio.
El tipo de entrada determina qué debe controlar el prompt. No escribas un prompt universal para todos los flujos de trabajo.
Los clips cortos necesitan un único evento comprensible. Añade una nueva toma solo cuando la información visual cambie realmente.
Separa los roles de identidad, producto, movimiento, cámara y voz para que las referencias no compitan.
Reemplaza las negaciones vagas por estados explícitos: cámara estática, labios cerrados, rostro exacto y vestuario sin cambios.
02 / PROMPT BUILDER
El creador cambia la instrucción de alineación, las etiquetas de referencia y los roles de contenido de API para el modo H3 seleccionado.
Modo de generación
10s. A matte-red portable speaker remains geometrically consistent. A rim light traces the silhouette, then the speaker settles into a clean hero frame. Minimal dark studio, soft haze, precise reflections and generous negative space. The camera performs a Push In with small amplitude at slow speed. One soft dial click, restrained room tone and a synchronized low-frequency pulse. Minimal electronic percussion, moderate tempo, ending cleanly on the hero frame.La salida se actualiza mientras escribes. Mantén las indicaciones estructurales en inglés; usa el idioma de destino para los diálogos y el texto en pantalla.
462/700003 / OFFICIAL ANATOMY
Usa los nombres de los campos como sistema de pensamiento: primero los elementos visuales y los planos, después el sonido diegético y, por último, la música exclusiva para la audiencia.
T2VA / I2VA / FL2VA / L2VA
{I2VA / FL2VA / L2VA alignment instruction when applicable}
integrated_multimodal_description:
[Shot 1] {initial composition}. {subject action}.
[Shot 2] At 00:04.000, {new visual information}.
overall_soundscape:
{ambience + physical sounds}
non_diegetic_music:
{instrumentation + tempo + dynamics}; or N/ARef2VA
subject_definitions:
<Subject 1> is the product shown in <Picture 1>; preserve its geometry, material, color and logo.
<Video 1> is the camera-path and pacing reference.
summary:
[reference generation] {creative goal using Subject 1}
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - {exact attributes}
<Video 1> (camera and pacing structure): weak_reference - {relationship}
detailed_description:
{style sentence}
[Shot 1] <Subject 1> ...
overall_soundscape:
...
non_diegetic_music:
...tracking shot + medium amplitude + slow speed(S1) says <d>[Chinese] 原句</d>instrumentation + tempo + dynamics; or N/A04 / REFERENCE ROLES
Un mapa de roles claro es más útil que añadir más referencias. Repite en el texto los detalles que deben conservarse.
<Subject 1>Identidad: rostro, cabello, vestuario
<Subject 2>Producto a partir de una imagen 2: geometría, material y color
<Picture 3>Ancla del primer, fotograma clave o último fotograma concreto
<Video 1>Movimiento: ritmo al caminar y trayectoria de cámara
<Audio 1>Voz: solo timbre
Contrato de preservación
In Video 1, change only the original package to the exact product from Picture 1.
Preserve the actor identity, hands, timing, camera path, background and lighting.
Keep the product geometry, color and logo from Picture 1 unchanged.PROMPT RECIPES
Estas son plantillas didácticas originales, no afirmaciones de resultados garantizados. Adapta una variable a la vez.
10s premium product film. A matte-red speaker in clean negative space. Slow push-in as rim light traces the exact silhouette; cut once to a macro texture shot, then settle into a stable hero frame. One soft dial click, restrained room tone, minimal electronic percussion.
Usa este promptPicture 1 anchors 0.00s and Picture 2 anchors 8.00s. Use one continuous shot. The hand pulls the ribbon and the paper unfolds in observable stages. Every moving element gradually settles into the exact composition, lighting and hand position of Picture 2.
Usa este promptIn Video 1, change only the package to the exact product from Picture 1. Preserve actor identity, hands, timing, camera path, background, lighting and all other motion. Keep product geometry, color and logo unchanged.
Usa este prompt05 / TROUBLESHOOTING
Cambia una variable de control explícita en cada reintento para saber qué instrucción mejoró el resultado.
| Síntoma | Causa probable | Cambiar siguiente |
|---|---|---|
| El rostro o el producto se desvían | El rol de referencia es implícito o se comparte con el estilo y el movimiento. | Asigna la identidad a una imagen limpia y enumera las características exactas que deben conservarse. |
| Conflictos de movimiento de cámara | El video de referencia y el texto describen trayectorias de cámara diferentes. | Deja que la referencia defina el recorrido; usa texto solo para la velocidad o la amplitud. |
| El diálogo es apresurado o no coincide | La línea es demasiado larga, el hablante cambia o la sincronización no está anclada. | Acorta la línea, conserva un único ID de hablante y colócala dentro de la toma correspondiente. |
| Saltos entre el primer y el último fotograma | Los fotogramas difieren en el ángulo de cámara, la escala o contienen demasiados objetos independientes. | Crea el último fotograma a partir del primero, cambia un estado alcanzable y describe una trayectoria continua. |
06 / CONTRACT BOUNDARIES
Etiqueta cada duración, resolución, parámetro e ID de modelo con la superficie que realmente lo proporciona.
Duración oficial de API
4–15s
Resolución oficial
768P / 2K
Relación de aspecto del modo fotograma
adaptive
Proporción T2V
21:9 → 9:16
Usa como fuente de verdad el esquema oficial de la solicitud, la cadena del modelo y la documentación de capacidades.
Guía oficial de APIUsa únicamente los modos, controles, precios y límites visibles en el espacio de trabajo actual.
Abrir espacio de trabajoSelecciona el flujo de trabajo y los pesos que correspondan a T2V, fotograma de imagen o generación con referencias.
Guía de ComfyUIFAQ
El modo, las referencias, los diálogos y las restricciones de la plataforma deben decidirse antes del acabado del estilo.
Usa T2VA para conceptos de solo texto, I2VA cuando el primer fotograma controle la composición, FL2VA cuando importen ambos extremos, L2VA para un final diseñado y Ref2VA cuando las imágenes, el vídeo o el audio existentes deban controlar atributos específicos.
No des por hecho que existe una entre proveedores. Escribe condiciones positivas de conservación, como: «la cámara mantiene una toma fija», «conservar exactamente el rostro y el vestuario» o «los labios permanecen cerrados».
Mantén estables los ID de los hablantes, indica el idioma del diálogo, mantén las líneas suficientemente breves para la duración y separa el diálogo del ambiente, los sonidos físicos y la música solo para el público.
No. Los pesos del modelo, los modos de entrada, la duración, la resolución y los parámetros pueden variar. Lee siempre el contrato de la superficie que estés usando.
Fuentes y verificación
Última verificación del contenido: 11 de agosto de 2026. Las plantillas de esta página son material didáctico original basado en las estructuras enlazadas.
Elige el flujo de trabajo que corresponda a tu material de origen, crea el prompt anterior y llévalo al generador correspondiente.