200 万ドル規模の動画制作パイプラインを構築する方法

@EXM7777
英語2026年8月16日
286K
644
49
23
1.8K

TL;DR

本ガイドでは、Higgsfield と Seedance 2.5 を活用したプロ仕様の 11 段階の AI 動画制作ワークフローを公開します。キャラクターの一貫性と自動化されたパイプライン構築に焦点を当てています。

7 つの無料スキルと、higgsfield で数百万ドルの予算を持つ AI 映画を制作するためにディレクターが実際に使用しているパイプラインを公開します...システム全体をステップバイステップで明らかにし、各段階を実行するスキルを今日インストール可能にしました

Seedance 2.5 の 1080p(higgsfield のみ)により、30 秒のフル広告/クリエイティブ/予告編をアップスケーリングなしでワンショット生成できるようになりました...これは素晴らしい

Machina - inline image

内部構成:

  • ワークフロー全体が動作する単一のプラットフォームとその理由
  • すべての AI 映画が直面する唯一の問題
  • 11 のステージとそれらを結びつける 2 つのゲート
  • 各ステージの詳細、自動化可能なものとそれを実行するスキル
  • 人間が担当する部分とその理由
  • 完全なプレイブックブロック

すべてのスキルにアクセスするには、こちらから参加してください: https://t.me/tgmachina まもなく投稿します

AI 動画を実際の収益に変える方法をさらに深く学びたい方は、weeklyaiops.com のリアルタイム AI オペレーションコミュニティでトレーニングと週次システムを提供しています

エンジン: Seedance 2.5 の 1080p と CLI

この記事のすべては、1 つのプラットフォームを通じて動作します: higgsfield

理由は 2 つあり、どちらも構造的なものです: 表面全体がエージェント使用向けに構築されているため、エージェントがエンドツーエンドで生成を駆動でき、Seedance 2.5 の 1080p(higgsfield のみ)がその上で動作します

ワークフロー全体は意図的に 1 つの動画モデルで動作します

1 つのモデルは、1 つのプロンプト文法、1 セットの癖、1 つの一貫性動作を学ぶことを意味します...画像モデルはそれを供給するリファレンスシートのみを構築します

現在の動画モデルは Seedance 2.5 です

30 秒のクリップを、ダイアログのリップシンクと効果音を同じパスで生成し、キャスト、ロケーション、キープロップ、カメラムーブ、ボイス、アンビエンスを 1 つの生成内に保持できる十分なリファレンス予算を持ちます

パイプラインの反復ルールでは、失敗したショットに 10 〜 15 回の試行を与え、その後ようやく文言の問題を疑うことができます

CLI はエージェントへの扉です:

  • npm install -g @higgsfield/cli
  • higgsfield auth login
  • npx skills add higgsfield-ai/skills

3 つのコマンドで、すべてのモデルが Claude Code や任意のハーネスから呼び出し可能になり、エージェントがパイプライン全体を保持できるようになります...何を、どの順序で、どのモデルで生成するかを、あなたが指示しながら

そして、2.5 が来期に置き換えられても、以下の内容は何も変わりません...モデルテーブルをスナップショットとして扱ってください。ステージとゲートは保持すべき部分だからです

このパイプラインで何が生成できるかの簡単な例:

Machina - inline image

俳優は昨日の自分の姿を覚えていない

その一文が、このパイプラインが存在するすべての理由です

動画モデルには生成間の記憶がありません。そのため、キャラクターの外見がすべてのプロンプトで網羅的に記述されていない場合、隣接するショットで異なる顔、異なるジャケット、異なる年齢が与えられます

10 秒のクリップでは誰も気づきません...90 分間では映画を台無しにします。なぜなら、観客は他のどの欠陥よりも早く連続性の破綻を読み取るからです

モデルには記憶がないため、パイプラインが記憶となります

これから見るステージの半分は、モデルに代わって物事を記憶するためだけに存在します...主人公が何を着ているか、ドアが窓からどのくらい離れているか、どのパレットがシーンを支配するか

そして、記憶は決して破ってはいけない 4 つのルールで動作します:

  • すべてのアセットがロックされるまで、映画のために何も生成しない
  • 1 つのアセットには 1 つの承認されたパスポートがあり、それを使用するすべてのプロンプトに逐語的にコピーされる
  • 編集は外科的に: 1 行を変更し、他のすべては一字一句そのまま保持
  • すべてがバージョン管理され記録される。記録されていない良いショットは再現できないショットだから

最初のルールを破ると、ルックがずれた時点で素材の半分を作り直すことになります

この記事の残りの部分は、それらの 4 つのルールを実際のスタジオに拡張したものです

11 のステージ

従来のプリプロダクションは、キャスティング、ロケーションスカウティング、プロップショップです

ここでは逆に動作します: 代わりにデジタルリファレンスを固定し、初期ステージをより厳密に閉じるほど、その後のすべての生成が安価になります

Machina - inline image
  • ブレイクダウン: 脚本がシーンとショットカードになる
  • リファレンス: アセットごと、スタイルごとの仕様として収集された画像
  • ビジュアルバイブルロック: すべてのボードに書面での決定が下される
  • アセットシート: キャラクター、ロケーション、プロップにパスポートが作成される
  • ライブラリ: パスポートがストレステストされ、レジストリにロックされる
  • 生成: カードとパスポートからショットが生成される
  • 編集: 生成と並行してアセンブリが実行される
  • クリーンアップ: アーティファクトがショットごとに修正される
  • カラー: 外部カラーリストが統一しグレーディングする
  • サウンド: 外部ポストチームがクリーンアップしミックスする
  • マスター: フェスティバルおよびプラットフォーム納品物とアーカイブ

ステージはシーンレベルで順次実行されますが、1 つの例外があります: シーン N が生成されている間に、編集者はすでにシーン N-1 をアセンブリし、ディレクターチームは N+1 のショットリストを作成しています

このオーバーラップが存在するのは、ここでの再撮影が数分で済み、撮影日を必要としないからです

編集者はアセンブリを確認し、不足しているカットアウェイを注文し、同じ日の午後には入手できます...つまり、編集はポストプロダクションではなくなり、何が作られるかを積極的に形成し始めます

しかし、ゲートが許可するまでは何も始まりません

ステージは書面によるチェックリストを通じて終了し、最も難しいゲートは生成の前にあります: シーン内のすべてのキャラクター、バリアント、ロケーション、プロップには、1 フレームの映画がレンダリングされる前に、レジストリ行が「ロック済み」とマークされている必要があります

パイプラインの中で最も高価なルールであり、最も報われるルールでもあります

それでは、ステージ自体を見ていきましょう

以下の各ステージは、それを実行するために私が構築したスキルで締めくくられ、7 つすべてが Telegram で待機しています

ステージ 1: ブレイクダウン

誰かがプロンプトを書く前に、脚本がショットカードになります

各ショットには、3 つのレーンに 22 のフィールドを持つカードが作成されます:

  • アイデンティティ: シーンとショット ID、ロケーション、時間帯、アセットタグと状態バリアントを持つキャラクター、プロップ、説明、ダイアログの逐語、実行時間、複雑さ
  • ディレクション: ショットの目標、動詞としてのタスク、ドラマツルギー、ブロッキング、演技、スタイルデバイス
  • カメラと編集: サイズ、動き、レンズ、アングル、カットタイプ、ペース、トランジション

22 のフィールドは官僚的に聞こえますが、それが何をもたらすかを見れば納得です: 後でプロンプトがほぼ機械的に自動生成されます。なぜなら、列グループがプロンプトブロックに一対一でマッピングされるからです

Machina - inline image

2 つのルールが付随します

すべてのクリップは 1 つのアクションのみを運び、連続したアクションは決してありません

そして、フレーム内に表示される必要があるテキスト...看板、電話画面、タイトル...は生成から完全に除外され、独自のタスクリストに移動します。なぜなら、動画モデルはテキストをうまく書けず、タイトルは編集に属するからです

スキル: /film-breakdown は、脚本、トリートメント、または 1 段落のアイデアを受け取り、シーンごとに、1 つの質問ずつ、シーンテーブルとシーンごとに 1 つのショットカードファイルを作成しながら進めます

すべてのショットは 22 のフィールドすべてが入力された状態で終了し、フレーム内テキストはプロンプトを書く前にすでに独自のタスクリストに引き出されています

Machina - inline image

しかし、完璧なカードでも、2 つのモデルが同じように描かない人物を記述します...その問題には独自の 2 つのステージがあります

ステージ 2 と 3: リファレンスとロック

ここでのリファレンスは仕様です

「疲れた父親が擦り切れたジャケットを着ている」は、モデルや頭ごとに異なる人物を生成します

実際の彼の画像が問題を解決します。そのため、ルールは一方向のみで実行されます: 既存の画像を最初に見つけ、次にそれを説明する...説明を想像して証拠を探すことは決してしない

実用的な数値: 主要キャラクターに 10 〜 20 枚、主要ロケーションに 8 〜 15 枚、プロップに 3 〜 5 枚、さらにライト、カラー、光学、カメラムーブメント、テクスチャー、カッティングテンポ、サウンド用の個別ボード

これらの範囲は実際の制作から数えられたものであり、推測ではありません。そのため、丸めていません

すべての画像には、そこから正確に何を取るかを指定するキャプションが付けられます

キャプションのない、単に気に入った画像は、1 週間後にはゴミです

そして「このようなもの...許可しない」とマークされた画像は禁止リストになり、リファレンスよりも多くの生成を節約します

スタイルボードを埋める最速の方法は、想像する代わりに実際の映画から抽出することです: すでにあなたの感覚を運んでいる映画の静止画をビジョンモデルに与え、レンズ、ライトの方向、パレット、グレインを特定させ、出力を 1 段落としてロックし、プロジェクトのすべてのプロンプトに貼り付けます

次にロックが来ます。そしてロックは書面です

すべてのボードは固定された決定で終了します...承認、修正、または却下...ボード自体に記録されます

口頭で承認されたスタイルは、ディレクターとプロンプトエンジニアが 2 つの異なる映画を保持していることを意味し、1 か月後に判明します

スキル: /reference-board は、ボードごとにインタビューを実行します...あなたがリファレンスを提供し、すべての画像にキャプションを強制し、すべてのアンチリファレンスを禁止リストにファイルし、各ボードを書面による決定(承認、修正、却下)で閉じます

その決定がボードになければ、「ロック済み」とは呼ばれません

Machina - inline image

ステージ 4: パスポート

ここで一貫性が製造されます

1 人のキャラクターに何が起こるか見てみましょう: 彼は網羅的なテキスト記述子と、ニュートラルグレーの背景で生成されたリファレンス画像のシートを取得します...正面、斜め、横顔、背面、クローズポートレート

そのペア(記述子とリファレンス)は、彼が登場するすべてのプロンプトに、一字一句、ファイルごとに移動します

それが彼のパスポートであり、制作はキャラクター、ロケーション、プロップごとに 1 つ保持します

濡れた服は別のパスポートです

血も同様です...@cal@cal_wet@cal_blood は、3 つの別々のタグを持つ 3 つの別々のアセットです。なぜなら、インラインで記述されたバリアントは、モデルが忘れるバリアントだからです

パスポートを保持する 2 つの詳細:

  • 記述子は決して短縮されません。「簡潔さのためにトリミング」は、まさに一貫性が死ぬ場所だからです
  • ロケーションのパスポートは、シーンのパレットとライトキャラクターを内部に運びます。そのため、そのロケーションのすべてのショットは、事前にグレーディングされた状態で到着します

そして、リファレンス画像自体は、動画プロンプトが存在する前に、まず画像モデルで手作業で構築されます

それらをロックし、決して再生成しないでください...後でモーションが間違って見える場合は、モーションプロンプトを修正してください。新しい画像は、古い画像の上に積み重ねられたすべての一貫性作業を元に戻すからです

すべてのパスポートは、1 つの生きたレジストリの行として着地します: タグ、タイプ、バージョン、シードファイル、シーン、ステータス

この時点でのパスポートはまだドラフトです。なぜなら、1 枚のラッキーな画像に基づいて構築されたパスポートは偽りの勝利だからです

スキル: /asset-passport は、一度に 1 つのアセットを構築します...記述子にギャップがなくなるまでインタビューし、画像モデル用のグレーバックグラウンドリファレンスシートプロンプトを作成し、すべての状態バリアントを独自のタグ付きアセットに分割し、レジストリ行をドラフトとしてファイルします

Machina - inline image

ステージ 5: ストレステスト

アセットが信頼される前に、戦闘条件下で生成されます: 異なるアングルとショットサイズ、実際のシーンの照明、そしてフレームを共有するすべてのアセットの隣に立った状態...なぜなら、単独で保持できるキャラクターでも、フレームを共有するとしばしば崩れるからです

テストは安価な静止画像で、高価な動画生成の前に行われます

キャラクターは 10 回中 10 回の再現性を達成する必要があります

これは正しいです

それ以下の場合、レジストリ行はドラフトのままであり、ブロックするシーンは待機するか、意識的に次の制作ブロックに移動します

シーンの生成は、それが触れるすべての行が「ロック済み」と言ったときに開始され、1 時間も早くはありません

スキル: /stress-test は、レジストリとブレイクダウンを読み取り、戦闘マトリックスを構築します...アングル、ショットサイズ、実際のシーンライト、すべての共演者の隣のツーショット...テストプロンプトを提供し、フルパスでのみ行を「ロック済み」に切り替えます

フルパスがなければロックなし、シーンは閉じたままです

Machina - inline image

レジストリがグリーンになると、制作はついにレンダリングを開始します...そして、そのすべてのショットは同じ 15 のブロックから来ます

ステージ 6: プロンプト

すべてのショットプロンプトは、同じ固定順序の同じ 15 ブロックです

ネガティブプロンプトはどこにもありません...すべての禁止は、フレーム内に「あるもの」として書き直されます

これが生成ステージの実行内容です。ブロックがロックされると、レンダリング自体は機械的だからです

Machina - inline image

それだけで価値のあるブロック:

  • オープナーは「正確に N 人のキャラクター - 重複なし」と述べます。なぜなら、モデルはカウントを開いたままにすると人を追加するからです
  • ロケーションマップは距離をメートルで示し、カメラが決して越えない線を指定します
  • ショットごとに 1 つのレンズ、視野はハードカットでのみ変更されます
  • アクションは 0.3 〜 0.8 秒のタイミングビートで配置されます
  • 物理は持続します: ダメージはシーン途中で治癒せず、破片は落ちた場所に留まります
  • ライトは決してフラットで正面からではなく、ロケーション自身の光源から形作られます
  • スタイルブロックは 60:30:10 のカラーラインで閉じます: 支配的な色相、二次色、アクセントのフレーム占有率

30 秒のワンショットの場合、プロンプトは 4 つのタイミングビートに分割されます...0-6 でシーン設定、6-14 で構築、14-24 で転換、24-30 で解決...各ビートに完全な詳細セットとタイムスタンプが含まれます

リファレンスも同じ規律を得ます: 添付されたすべての画像、クリップ、またはオーディオファイルは、何を制御し、何に触れてはならないかを述べます

@video 1 はモーションとペーシングを定義する」は役割の半分です...残りの半分は「アイデンティティ、衣類、またはシーンをそこから取得しない」であり、この 2 行目が、1 つのリファレンスが決して形作ることを意図されていなかったショットに漏れるのを防ぎます

モーションには独自の文法があります: すべてのプロンプトはカメラムーブに名前を付け、クリップ中に発生するイベントとペアにします

次に、凍った人物は絶対にないと述べます

立っている人物のそばをドリーするのは、漂う静止画像です

帆が裂ける間に同じドリーをするのは、映画です

次に反復ルール

編集は 1 行を変更し、他のすべてを一字一句保持し、すべての試行は何が変更されたかと判定とともに記録され、試行 15 までに着地しなかったショットはより良い言葉を必要としません...より単純なショットが必要です: 2 つに分割し、アクションを削除し、アングルを変更する

完了したテイクはチェックリストによって受け入れられます...リファレンスに一致、アーティファクトなし、カメラ指示通り、リップシンク保持、隣接ショットとカット...そして受け入れられたテイクのみがセレクトフォルダに最終的な名前を得ます

その受け入れがショットに必要な最後の「はい」です。なぜなら、編集者は生の生成物に決して触れないからです

スキル: /shot-prompt は、1 つのショットカードとフレーム内のすべてのロックされたパスポートを受け取り、それらのアセットのいずれかがまだドラフトである間は、生成準備完了のプロンプトを書くことを拒否します

次に、すべての記述子を逐語的に貼り付けて 15 ブロックを作成し、生成ログをあなたと一緒に保持します...試行ごとに 1 行変更、15 でショットを簡略化

Machina - inline image

スタジオはファイルツリー

このパイプラインにはプロダクションオフィスはありません

ディレクトリがあります

  • assets はパスポートを保持: キャラクター、ロケーション、プロップ
  • prompts はショットカードとすべてのプロンプトバージョンを保持
  • generations は生の試行を保持し、プロンプトエンジニア以外は誰も入らない
  • selects は受け入れられたテイクのみを保持し、編集が許可される唯一のフォルダ
  • edit、color、sound、master は仕上げチェーンを保持
  • docs はブレイクダウン、バイブル、レジストリ、生成ログを保持

もう 1 つのルール: リファレンスファイルの名前は決して変更しない

新しいバージョンは新しいファイルです。なぜなら、名前を変更すると、古いファイルを指すすべてのプロンプトが壊れるからです

スキル: /studio-init は 1 つの質問(プロジェクト名)をし、ツリー全体をスキャフォールドし、ブレイクダウン、バイブル、レジストリ、生成ログを準備済みテンプレートとしてシードし、3 つのフォルダルールをプロジェクトに書き込むため、それに触れるすべてのエージェントがそれらを継承します

Machina - inline image

そして 7 番目のスキルは正面玄関です: /setup は、どの画像モデルと動画モデルを使用するか、それぞれにどのようにアクセスするかを尋ね、スタックを決して仮定しません...共有設定をプロジェクトに書き込み、他のすべてのスキルが同じ設定を読み取るようにし、次にチェーンを順序通りに提供します: setup、studio-init、film-breakdown、reference-board、asset-passport、stress-test、shot-prompt

Machina - inline image

7 つすべてが Telegram にあります: https://t.me/tgmachina

ステージ 7 から 11: 人間が担当する部分

編集、クリーンアップ、カラー、サウンド、マスターは、スキルが実行しない 5 つのステージです

パイプラインは画像とスクラッチオーディオを生成し、意図的にそこで停止します

仕上げは人間の仕事です

編集は、ほとんどすべての生成の最初と最後の半秒をトリミングします。なぜなら、クリップは端でずれるからです

そして、自然に感じるよりもハードにカットします。なぜなら、生成されたショットはゆっくりとした入り口に傾くからです...常設の指示は、考えるよりも積極的にカットすることです

生成されたサウンドは足場です: リップシンクされたラインがタイミングを設定し、サウンドポストチームが同じ音声を再録音する代わりにクリーンアップし、効果音を再構築し、プラットフォームのラウドネスにミックスします

カラーはカラーリストに送られ、その最初の仕事は隣接するショットを統一することです。なぜなら、各ロケーションのパスポートはすでに洗練するための組み込みグレードを提供しているからです

そして、マスターはどのスタジオと同じように出荷されます: フェスティバル用の DCP(標準的な映画納品パッケージ)、アーカイブ用の ProRes ファイル(高品質アーカイブフォーマット)、さらにプラットフォームエンコードと字幕

アーカイブは完成した映画以上のものを保持します

それは生産手段を保持します...すべての最終プロンプト、生成ログ、レジストリ、ロックされたパスポート...なぜなら、続編は前回の制作が学んだすべてから始まるからです

プレイブックブロック

パイプライン全体を、保存する価値のあるブロックに圧縮:

  1. 映画のために何かを生成する前に、ビジュアルバイブルを書面でロックする
  2. 1 つのアセット、1 つのパスポート: 網羅的な記述子とグレーバックグラウンドリファレンス、永久に逐語的にコピー
  3. すべてのパスポートをシーンライトとツーショットで 10/10 までストレステストしてからシーンを開く
  4. すべてのプロンプトを同じ 15 ブロックとして書き、30 秒ショットには 4 つのタイミングビート
  5. 試行ごとに 1 行変更、すべての生成を記録、試行 15 でショットを簡略化
  6. チェックリストによってテイクをセレクトに受け入れる: 編集はそれ以外を見ない
  7. 端をトリミング、アグレッシブにカット、ピクチャーをロック、カラーとサウンドを人間に任せる

ロックをスキップすると、素材の半分が 2 回作られることになります

モデルはこのシステムの下から入れ替わります...メソッド自体は、モデルテーブルが数か月で古くなることを想定しています

シーケンスとゲートは変わらない部分です

higgsfield にこの記事のスポンサーを感謝します

7 つのスキルはまもなく私の Telegram に投稿されます: https://t.me/tgmachina

YouMindで再制作

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る