T2VA
テキストから動画
テキスト Prompt
自由なコンセプト、広告、映画的なシーン。
初期構図、一つの主動作、カメラ経路、音を明確にします。
このワークフローを開く適切な生成モードを選び、H3 公式構造で Prompt を組み、参照素材の役割を割り当て、よくある失敗を修正します。
01 / MODE PICKER
ここから始めます。モードを誤ると、カメラ指示を読む前から入力が競合します。
T2VA
テキスト Prompt
自由なコンセプト、広告、映画的なシーン。
初期構図、一つの主動作、カメラ経路、音を明確にします。
このワークフローを開くI2VA
開始画像+Prompt
人物、製品形状、構図の固定。
画像が静止画を決め、Prompt は次に何が動くかを説明します。
このワークフローを開くFL2VA
開始画像+終了画像+Prompt
変化と正確な終了状態への収束。
到達可能な一つの動線にし、二つの構図を近づけます。
このワークフローを開くL2VA
終了画像+Prompt
ロゴ演出、製品エンドカード、設計済みの結末。
妥当な前段階と、各要素が終了画像へ収束する方法を書きます。
このワークフローを開くRef2VA
画像・動画・音声+Prompt
人物、製品、動き、カメラ、声の転送。
各素材に一つの役割を与え、保持すべき要素を明記します。
このワークフローを開くCONTROL RULES
映画的な詳細を足す前に、このルールを満たします。競合した指示は語数を増やしても直りません。
入力形式によって Prompt の役割が変わります。全モードに同じ式を使わないでください。
短い動画では一つの明確な出来事に絞り、映像情報が変わる時だけショットを追加します。
人物・製品・動き・カメラ・声の役割を分け、参照同士の競合を防ぎます。
曖昧な否定を、固定カメラ、閉じた唇、同一の顔、衣装維持など明確な状態へ変えます。
02 / PROMPT BUILDER
選択した H3 モードに合わせ、整列指示・参照ラベル・API content role を切り替えます。
生成モード
10s. A matte-red portable speaker remains geometrically consistent. A rim light traces the silhouette, then the speaker settles into a clean hero frame. Minimal dark studio, soft haze, precise reflections and generous negative space. The camera performs a Push In with small amplitude at slow speed. One soft dial click, restrained room tone and a synchronized low-frequency pulse. Minimal electronic percussion, moderate tempo, ending cleanly on the hero frame.入力に合わせて出力が更新されます。Prompt は英語、台詞と画面テキストは対象言語の使用を推奨します。
462/700003 / OFFICIAL ANATOMY
フィールドを思考の枠組みにします。映像とショット、画内音、観客向け音楽の順です。
T2VA / I2VA / FL2VA / L2VA
{I2VA / FL2VA / L2VA alignment instruction when applicable}
integrated_multimodal_description:
[Shot 1] {initial composition}. {subject action}.
[Shot 2] At 00:04.000, {new visual information}.
overall_soundscape:
{ambience + physical sounds}
non_diegetic_music:
{instrumentation + tempo + dynamics}; or N/ARef2VA
subject_definitions:
<Subject 1> is the product shown in <Picture 1>; preserve its geometry, material, color and logo.
<Video 1> is the camera-path and pacing reference.
summary:
[reference generation] {creative goal using Subject 1}
retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - {exact attributes}
<Video 1> (camera and pacing structure): weak_reference - {relationship}
detailed_description:
{style sentence}
[Shot 1] <Subject 1> ...
overall_soundscape:
...
non_diegetic_music:
...tracking shot + medium amplitude + slow speed(S1) says <d>[Chinese] 原句</d>instrumentation + tempo + dynamics; or N/A04 / REFERENCE ROLES
参照を増やすより、明確な役割マップが有効です。保持する詳細はテキストでも繰り返します。
<Subject 1>人物:顔、髪、衣装
<Subject 2>Picture 2 の製品:形状、材質、色
<Picture 3>具体的な開始・キー・終了フレーム
<Video 1>動き:歩行リズムとカメラ経路
<Audio 1>音声:声色のみ
保持条件
In Video 1, change only the original package to the exact product from Picture 1.
Preserve the actor identity, hands, timing, camera path, background and lighting.
Keep the product geometry, color and logo from Picture 1 unchanged.PROMPT RECIPES
これは独自の教材テンプレートで、出力保証ではありません。一度に一変数だけ調整します。
10s premium product film. A matte-red speaker in clean negative space. Slow push-in as rim light traces the exact silhouette; cut once to a macro texture shot, then settle into a stable hero frame. One soft dial click, restrained room tone, minimal electronic percussion.
この Prompt を使うPicture 1 anchors 0.00s and Picture 2 anchors 8.00s. Use one continuous shot. The hand pulls the ribbon and the paper unfolds in observable stages. Every moving element gradually settles into the exact composition, lighting and hand position of Picture 2.
この Prompt を使うIn Video 1, change only the package to the exact product from Picture 1. Preserve actor identity, hands, timing, camera path, background, lighting and all other motion. Keep product geometry, color and logo unchanged.
この Prompt を使う05 / TROUBLESHOOTING
再試行ごとに一つの制御変数だけ変え、どの指示が改善したか判断します。
| 症状 | 主な原因 | 次に変える点 |
|---|---|---|
| 顔や製品が変わる | 参照の役割が曖昧で、スタイルや動きと兼用されています。 | 一枚の明瞭な画像を人物専用にし、保持する特徴を列挙します。 |
| カメラ動作が競合 | 動画参照とテキストが別のカメラ経路を指定しています。 | 経路は参照に任せ、テキストでは速度か幅だけを指定します。 |
| 台詞が速すぎる・映像とずれる | 台詞が長すぎる、speaker が変わる、または時間が固定されていません。 | 台詞を短くし、speaker ID を固定して対応ショット内に置きます。 |
| 開始・終了フレームが飛ぶ | 画角・スケールの差が大きい、または独立して動く要素が多すぎます。 | 開始画像から終了画像を作り、一つの到達可能な状態だけ変え、連続経路を記述します。 |
06 / CONTRACT BOUNDARIES
長さ、解像度、パラメータ、model ID は、実際に提供する環境ごとに示します。
公式 API の長さ
4–15s
公式解像度
768P / 2K
フレームモード比率
adaptive
T2V 比率
21:9 → 9:16
リクエスト schema、model string、機能範囲は公式文書を基準にします。
公式 API ガイド利用可能なモード、操作、価格、制限は現在のワークスペース表示を基準にします。
ワークスペースを開くT2V、画像フレーム、参照生成に対応する workflow と重みを選びます。
ComfyUI ガイドFAQ
モード、参照、台詞、環境仕様は、スタイル調整より先に決めます。
テキストのみは T2VA、開始画像が構図を決める場合は I2VA、両端が重要なら FL2VA、終了状態を決めるなら L2VA、既存素材で属性を制御するなら Ref2VA を使います。
全 Provider 共通の欄があると仮定せず、「固定カメラを保つ」「顔と衣装を正確に保持」「唇を閉じたまま」など肯定形の条件にします。
speaker ID を固定し、台詞の言語を示し、尺に収まる長さにして、台詞・環境音・物理音・観客向け音楽を分離します。
同じではありません。重み、入力モード、長さ、解像度、パラメータが異なるため、利用する環境の仕様を確認してください。
情報源と検証
最終確認:2026年8月11日。ページ内のテンプレートは、リンク先の構造を基に独自作成した教材です。