入力と参照素材 · MiniMax H3
画像・動画・音声を役割ごとに整理し、ひとつのリクエストにまとめます。
BestAIVideo
MiniMax H3 (Hailuo 03 とも呼ばれます) は、ショットを開始するいくつかの方法をサポートしています。 BestAIVideo は、ルートの選択、すべてのビジュアルまたはオーディオ参照のジョブへの割り当て、クレジット コストの見積もり、結果の横に完全なセットアップを保存するのに役立ちます。
MiniMax では、H3 をテキスト、画像、オーディオ、ターゲット ビデオ間の関係を解釈する汎用マルチモーダル モデルとして説明しています。 BestAIVideo は、1 つの焦点を絞ったジェネレーターで制作可能なビデオ モードを公開します。
被写体、動き、カメラ言語、音声参照がどのように連携するかを説明します。 H3 は、すべてのクリエイティブなリクエストを個々の専門家のタスクに強制するのではなく、自然言語を使用してこれらの関係を解釈します。
より高速に探索するには 768P を選択し、より細かいテクスチャと制作の詳細には 2K を選択してください。 MiniMax はインコンテキスト再生成を使用するため、ベース モデルは高解像度の情報を復元しながら元のコンテキストを再訪できます。
ビジュアルとともにオーディオ、アンビエンス、エフェクト、および音楽を生成します。ステレオ配置と視聴覚のタイミングにより、動き、カット、会話、環境音が同じシーンに属することが保証されます。
4 ~ 15 秒の間で任意の継続時間を設定し、映画のような、正方形、横向き、または垂直のアスペクト比を選択します。テキストだけでは不十分な場合は、最初のフレーム、最後のフレーム、およびブラウズ モードでさらに制御を追加できます。
どのモードが自分の仕事に適しているかを決定し、それぞれの参照に個別の役割を与え、生成前にカメラとサウンドの命令を 1 つの調整されたシーケンスとして記述します。
探索はテキスト、人物固定は1枚、転換は2枚、映像と音の連携は混合参照を使います。
画像5枚と音声3件までを、人物、背景、画風、声、効果のいずれかに割り当てます。
開始、動作、カメラ、場面転換、終了フレームを4〜15秒の中に配置します。
台詞、環境音、効果音、音楽を画面に合わせ、尺、解像度、画角を確認します。
公式 MiniMax H3 サンプルには、クレステッドゲッコーの目、鱗、舌の動きの詳細が含まれています。サンプル プロンプトを使用して、制御されたスタジオの照明、浅いフォーカス、正確な自然な動きを探索します。
機械式タワー内を垂直に移動するカメラは、モデルのネイティブ ステレオ プレゼンテーションを表示します。 空間の雰囲気、仕組み、照明、建築の継続的な動きを調整するためのプロンプトを試してみましょう。
MiniMax のサンプル ムービー タイトルは、グラフィック パネル、タイポグラフィ、シルエット、オブジェクト、リズミカルなカットを組み合わせています。プロンプトは、これらの要素を、サウンドの方向が同期された簡潔なオープニング シーケンスに変換します。
画像・動画・音声を役割ごとに整理し、ひとつのリクエストにまとめます。
短いテストから始め、選択したモデルが対応する長さと解像度を指定します。
プロンプト、設定、参照素材を履歴に残すと、結果を比較して再現できます。
カスタマイズされたモンタージュ、タイポグラフィー、トランジション、サウンドを使用して、タイトル シーケンス、ムード フィルム、ピッチに対応したビジュアル ディレクションを開発します。
アニメーション化された製品モーメント、機能デモ、インタラクティブな外観のシーンを作成し、デジタル エクスペリエンス用のビジュアルを起動します。
静的なキー アートとキャラクター デザインを、深さ、動き、フレーミング、雰囲気を制御したループ状の縦型ポスターに変換します。
参考画像と正確なクリエイティブ ブリーフから製品の公開、ライフスタイルの写真、ブランドの移行、キャンペーンのバリエーションを作成します。
完全な制作パイプラインにコミットする前に、キャラクター、インターフェイス、環境、カットシーン、様式化されたモーションを事前に視覚化します。
明確な視覚的なステップ、ナレーション、エフェクト、一貫したテーマを組み合わせて、デモンストレーション、レッスン、短い概念説明を行います。
MiniMax H3 は、MiniMax の汎用マルチモーダル生成モデルであり、Hailuo 03 としても利用できます。ビデオの生成、参照、関係の編集、および同時生成されたネイティブ ステレオ オーディオが統合されています。
BestAIVideo は、テキストからビデオへの変換、最初のフレームの画像からビデオへの変換、最初と最後のフレームの生成、および画像とオプションのオーディオを含むマルチモーダルなリファレンス生成をサポートしています。
BestAIVideo の MiniMax H3 ジェネレーターは 768P と 2K をサポートしています。 より高速な探索には 768P を使用し、出力に強力なテクスチャと細部の忠実度が必要な場合には 2K を使用します。
BestAIVideo では、MiniMax H3 は 4 ~ 15 秒の任意の 1 秒の長さをサポートしており、ショットの長さをクイック モーション、製品の瞬間、トランジション、または完全な短いシーンに合わせることができます。
はい。 MiniMax H3 は、音声、アンビエンス、音響効果、音楽を含むネイティブ ステレオ オーディオを同時生成するため、サウンドは画面上の動きやシーンの変化に追従できます。
はい。 最初のフレームをアップロードしてコンポジションをアニメーション化するか、ビデオが 2 つの定義された視覚状態の間を移動する必要がある場合は、最初と最後のフレームの両方を追加します。
BestAIVideo の MiniMax H3 リファレンス モードは、1 ~ 5 つの画像と、オプションで最大 3 つの WAV または MP3 オーディオ ファイルを受け入れます。 このモードには参照画像が必要です。
テキストと参照の生成は、21:9、16:9、4:3、1:1、3:4、および 9:16 をサポートします。リファレンス モードではアダプティブ フレーミングも提供されますが、イメージ モードではアップロードされたフレームに従います。
コンパクトな制作概要を作成します。テーマと設定を特定し、アクションとカメラの動きを確認し、視覚的な処理を指定して、会話、雰囲気、効果、音楽の合図を追加します。
はい。 このページの機能とサンプル ビデオは、MiniMax の公式 H3 リリース ドキュメントから引用されています。プロンプトの例は、ロックされた MiniMax H3 ジェネレーターの目に見える機能を調べるために作成された BestAIVideo 互換の概要です。
それぞれに明らかなジョブが 1 つ含まれるクリーンなソース ファイルから始めます。アイデンティティや製品の形状が重要な場合は、遮るもののない明るい画像を使用し、意図したシーンと視覚的に一貫したスタイル参照を維持します。オーディオの場合は、無音や無関係な素材をトリミングして、音声、音楽の合図、雰囲気、エフェクトを簡単に識別できます。モデルが推測することを期待するのではなく、プロンプトですべてのファイルの役割に名前を付けます。2 つの参照が矛盾する場合は、どちらが被写体のアイデンティティを制御し、どちらが色、構成、動き、または音声を制御するかを述べてください。 通常、小規模で意図的なリファレンス セットは、無関係な 5 つの画像と 3 つの競合するオーディオ トラックよりも指示するのが簡単です。
レイヤーの出力を確認します。 まず、対象者の身元、構成、および主なアクションが選択した時間内に終了するかどうかを確認します。 次に、カメラの方向、動きの連続性、手と細部を検査し、続いて対話のタイミング、ステレオの配置、雰囲気、音楽のバランスを検査します。 一度に 1 カテゴリずつ指示を変更し、何が結果を改善するかを確認できます。ショットが急いでいると感じる場合は、アクションを簡略化するか、詳細を追加する前に時間を長くしてください。 画像がずれた場合は、最初のフレームまたは参照の役割を強化します。 適切な文言、解像度、アスペクト比、および参照の割り当てを、次のバリエーションの再利用可能な概要として保持してください。
テキスト、フレーム、またはマルチモーダル参照から開始し、768P または 2K を選択して、単一の焦点を絞ったオーディオビジュアル ブリーフを洗練された 4 ~ 15 秒の結果に変換します。