03:00:0050% オフクレーム
モード別ガイド+ライブ Builder

MiniMax H3Prompt Builder

適切な生成モードを選び、H3 公式構造で Prompt を組み、参照素材の役割を割り当て、よくある失敗を修正します。

01 / MODE PICKER

入力モードが Prompt の役割を決める

ここから始めます。モードを誤ると、カメラ指示を読む前から入力が競合します。

T2VA

テキストから動画

テキスト Prompt

自由なコンセプト、広告、映画的なシーン。

初期構図、一つの主動作、カメラ経路、音を明確にします。

このワークフローを開く

I2VA

開始フレーム

開始画像+Prompt

人物、製品形状、構図の固定。

画像が静止画を決め、Prompt は次に何が動くかを説明します。

このワークフローを開く

FL2VA

開始+終了フレーム

開始画像+終了画像+Prompt

変化と正確な終了状態への収束。

到達可能な一つの動線にし、二つの構図を近づけます。

このワークフローを開く

L2VA

終了フレーム

終了画像+Prompt

ロゴ演出、製品エンドカード、設計済みの結末。

妥当な前段階と、各要素が終了画像へ収束する方法を書きます。

このワークフローを開く

Ref2VA

参照から動画

画像・動画・音声+Prompt

人物、製品、動き、カメラ、声の転送。

各素材に一つの役割を与え、保持すべき要素を明記します。

このワークフローを開く

CONTROL RULES

四つのルールで多くの失敗を防ぐ

映画的な詳細を足す前に、このルールを満たします。競合した指示は語数を増やしても直りません。

01

先にモードを選ぶ

入力形式によって Prompt の役割が変わります。全モードに同じ式を使わないでください。

02

動きを尺に合わせる

短い動画では一つの明確な出来事に絞り、映像情報が変わる時だけショットを追加します。

03

各参照に一つの役割

人物・製品・動き・カメラ・声の役割を分け、参照同士の競合を防ぎます。

04

肯定形で保持条件を書く

曖昧な否定を、固定カメラ、閉じた唇、同一の顔、衣装維持など明確な状態へ変えます。

02 / PROMPT BUILDER

一度入力し、Quick・H3 構造・API 出力を比較する

選択した H3 モードに合わせ、整列指示・参照ラベル・API content role を切り替えます。

生成モード

10s. A matte-red portable speaker remains geometrically consistent. A rim light traces the silhouette, then the speaker settles into a clean hero frame. Minimal dark studio, soft haze, precise reflections and generous negative space. The camera performs a Push In with small amplitude at slow speed. One soft dial click, restrained room tone and a synchronized low-frequency pulse. Minimal electronic percussion, moderate tempo, ending cleanly on the hero frame.

入力に合わせて出力が更新されます。Prompt は英語、台詞と画面テキストは対象言語の使用を推奨します。

462/7000

03 / OFFICIAL ANATOMY

Base と Reference では構造が異なる

フィールドを思考の枠組みにします。映像とショット、画内音、観客向け音楽の順です。

T2VA / I2VA / FL2VA / L2VA

Base 構造

{I2VA / FL2VA / L2VA alignment instruction when applicable}

integrated_multimodal_description:
[Shot 1] {initial composition}. {subject action}.
[Shot 2] At 00:04.000, {new visual information}.

overall_soundscape:
{ambience + physical sounds}

non_diegetic_music:
{instrumentation + tempo + dynamics}; or N/A

Ref2VA

Reference 構造

subject_definitions:
<Subject 1> is the product shown in <Picture 1>; preserve its geometry, material, color and logo.
<Video 1> is the camera-path and pacing reference.

summary:
[reference generation] {creative goal using Subject 1}

retention_analysis:
<Subject 1> (appears in [Shot 1]): fully_preserved - {exact attributes}
<Video 1> (camera and pacing structure): weak_reference - {relationship}

detailed_description:
{style sentence}
[Shot 1] <Subject 1> ...

overall_soundscape:
...

non_diegetic_music:
...

カメラ

tracking shot + medium amplitude + slow speed

台詞

(S1) says <d>[Chinese] 原句</d>

音楽

instrumentation + tempo + dynamics; or N/A

04 / REFERENCE ROLES

素材をアップするだけでなく、制御対象を指定する

参照を増やすより、明確な役割マップが有効です。保持する詳細はテキストでも繰り返します。

<Subject 1>

人物:顔、髪、衣装

<Subject 2>

Picture 2 の製品:形状、材質、色

<Picture 3>

具体的な開始・キー・終了フレーム

<Video 1>

動き:歩行リズムとカメラ経路

<Audio 1>

音声:声色のみ

保持条件

In Video 1, change only the original package to the exact product from Picture 1.

Preserve the actor identity, hands, timing, camera path, background and lighting.

Keep the product geometry, color and logo from Picture 1 unchanged.
編集の型:変更点を一度だけ書き、その後に保持すべき要素を列挙します。

PROMPT RECIPES

役割が明確な三つの再利用レシピ

これは独自の教材テンプレートで、出力保証ではありません。一度に一変数だけ調整します。

T2VA

高級製品ヒーロー

10s premium product film. A matte-red speaker in clean negative space. Slow push-in as rim light traces the exact silhouette; cut once to a macro texture shot, then settle into a stable hero frame. One soft dial click, restrained room tone, minimal electronic percussion.

この Prompt を使う
FL2VA

設計済み終了フレームへ収束

Picture 1 anchors 0.00s and Picture 2 anchors 8.00s. Use one continuous shot. The hand pulls the ribbon and the paper unfolds in observable stages. Every moving element gradually settles into the exact composition, lighting and hand position of Picture 2.

この Prompt を使う
Ref2VA

製品だけを置き換える

In Video 1, change only the package to the exact product from Picture 1. Preserve actor identity, hands, timing, camera path, background, lighting and all other motion. Keep product geometry, color and logo unchanged.

この Prompt を使う

05 / TROUBLESHOOTING

形容詞を増やさず、原因を直す

再試行ごとに一つの制御変数だけ変え、どの指示が改善したか判断します。

症状主な原因次に変える点
顔や製品が変わる参照の役割が曖昧で、スタイルや動きと兼用されています。一枚の明瞭な画像を人物専用にし、保持する特徴を列挙します。
カメラ動作が競合動画参照とテキストが別のカメラ経路を指定しています。経路は参照に任せ、テキストでは速度か幅だけを指定します。
台詞が速すぎる・映像とずれる台詞が長すぎる、speaker が変わる、または時間が固定されていません。台詞を短くし、speaker ID を固定して対応ショット内に置きます。
開始・終了フレームが飛ぶ画角・スケールの差が大きい、または独立して動く要素が多すぎます。開始画像から終了画像を作り、一つの到達可能な状態だけ変え、連続経路を記述します。

06 / CONTRACT BOUNDARIES

公式 API、スタジオ、ローカル環境は同じ仕様ではない

長さ、解像度、パラメータ、model ID は、実際に提供する環境ごとに示します。

公式 API の長さ

4–15s

公式解像度

768P / 2K

フレームモード比率

adaptive

T2V 比率

21:9 → 9:16

MiniMax 公式 API

リクエスト schema、model string、機能範囲は公式文書を基準にします。

公式 API ガイド

MiniMax H3 AI Video Studio

利用可能なモード、操作、価格、制限は現在のワークスペース表示を基準にします。

ワークスペースを開く

Local / ComfyUI

T2V、画像フレーム、参照生成に対応する workflow と重みを選びます。

ComfyUI ガイド

FAQ

Prompt の結果を変える質問

モード、参照、台詞、環境仕様は、スタイル調整より先に決めます。

どの MiniMax H3 モードを選ぶべきですか?

テキストのみは T2VA、開始画像が構図を決める場合は I2VA、両端が重要なら FL2VA、終了状態を決めるなら L2VA、既存素材で属性を制御するなら Ref2VA を使います。

MiniMax H3 に共通の negative prompt 欄はありますか?

全 Provider 共通の欄があると仮定せず、「固定カメラを保つ」「顔と衣装を正確に保持」「唇を閉じたまま」など肯定形の条件にします。

台詞と音はどう書けばよいですか?

speaker ID を固定し、台詞の言語を示し、尺に収まる長さにして、台詞・環境音・物理音・観客向け音楽を分離します。

Hosted API とローカル ComfyUI の制限は同じですか?

同じではありません。重み、入力モード、長さ、解像度、パラメータが異なるため、利用する環境の仕様を確認してください。

情報源と検証

一次情報を基準にし、Provider 差異を明記する

最終確認:2026年8月11日。ページ内のテンプレートは、リンク先の構造を基に独自作成した教材です。

空の入力欄ではなく、モードから始める

素材に合うワークフローを選び、上で Prompt を作って対応ジェネレーターへ渡します。