Codex と Hypit でバイラル Douyin 動画を再現するステップバイステップガイド

@Pluvio9yte
中国語2026年9月16日
204K
468
92
29
937

TL;DR

オープンソースの Hypit エンジンと Codex を組み合わせて、バイラルなショート動画を作成するための包括的なガイドです。アセット生成、編集、合成のための AI エージェントの設定方法について詳しく説明しています。

Hypit とは?

Hypit は、AI エージェントが動画を作成できるようにするオープンソースプロジェクトです。Codex に参考動画、キャラクター画像、要件を提供すると、エージェントは Hypit を使用してアセット生成、編集、字幕、ピクチャー・イン・ピクチャー(PiP)効果を整理し、最終的に動画を出力できます。

また、編集可能なプロジェクトファイルも残ります。後で字幕を変更したり、PiP を調整したりしたい場合は、生成されたアセットを再利用して修正を続けることができます。

オープンソースアドレス: hypit-ai/hypit

まずは完成品をご覧ください。左側は「Chao Ge Shuo Che」(Brother Chao Talks Cars)のオリジナル動画、右側は私がキャラクター「Han Li」を使って再現したものです。

雪踏乌云 - inline image

これは私の Minimax H3 API を独自に使用して作成しました。公式 API や SeedDance を使用すれば、結果はさらに良くなります。

以下では、インストールから始まり、すべての操作手順を完全に解説します。 モデル設定には 2 つのパスがあります:Hypit クレジットがある場合は組み込みサービスを使用し、ない場合は自分の API を接続します。 この例では実際には自前の API パスに従っています。

  1. 役割の明確化:Hypit、Codex、生成モデルはそれぞれ何を担当するか?

混乱を避けるため、パイプライン内の各ツールの具体的な責任範囲を最初に明確にする必要があります。

  • Codex の役割: コードおよびエンジニアリング実行アシスタントとして、Codex は自然言語でのユーザーリクエストを解析し、ローカル開発環境を確認・設定し、参考動画のストーリーボード構造を読み取って分解し、プロジェクトソースファイルを生成・修正し、基盤エンジンへの呼び出しを整理して自動化パイプラインを完了します。
  • 画像 & ビデオモデルの役割: 静的なビジュアルアセットと動的シーンの生成を専門に担当します。この例では、画像モデルが現代のライブ配信ルームにいる古代衣装の男性の最初のフレームを生成し、ビデオモデルはその最初のフレームを駆動して話すストリーマーアニメーションにし、プロンプトに基づいて外部交通シーンを生成します。
  • Hypit エンジンの役割: コアオーケストレーションセンターとして、Hypit はすべての生成アセットの依存関係を記録し、ショットシーケンスと遷移クロックを定義し、字幕表示タイミングと外観を制御し、PiP の位置、レイヤー、角丸マスクを管理し、アセットが準備できたら基盤レンダラーを呼び出して最終的な動画を合成します。

異なる読者の実際の状況に対応するため、このチュートリアルでは生成モデルの設定を 2 つの独立したパスに明示的に分割しています。

  • パス A: Hypit アカウントに利用可能なクレジットがあり、公式の HypiHub サービスを通じて組み込みホスティングモデルを直接呼び出します。
  • パス B: Hypit プラットフォームのクレジットがなく、サードパーティの API インターフェースを明示的に設定して接続します。

条件に合ったパス(A または B)を 1 つ選択して設定を完了し、その後、共通の制作およびオーケストレーションワークフローに合流する必要があります。

  1. 準備とアセット仕様

開始前に、Codex、明確な参考動画、そして置き換えたいターゲットキャラクターの参考画像を用意してください。

キャラクター参考画像は、理想的には顔の特徴がはっきりしており、照明が均一で、服や髪のディテールが明確な単一人物の写真であるべきです。参考画像には動き情報が含まれていないため、モデルが静止画だけで元のホストの肩すくめやハンドジェスチャーなどを自動的に再現すると想定しないでください。

結果を公開予定で、元のホストの声を使いたくない場合は、正式な制作の前に代替音声対話を録音しておいてください。ナレーション音声を変更すると発音の間合いやセグメント長が変わるため、カットと字幕タイミングの再整列が必要になります。

  1. インストール

公式 Skill グローバルインストールコマンドを実行します:

npx skills add hypit-ai/hypit -g

インストールのエントリーポイントについては Hypit Repository を、詳細なプロセスステップについては Official Quickstart Manual を参照してください。

パス A: Hypit クレジットあり、組み込みサービスを使用

クレジットがある場合、自分の API を設定せずに Codex が Hypit の組み込みサービスを直接使用できます。

Hypit の組み込みサービスを使用してログインし、利用可能なモデルとクレジットを確認してください。まず推定消費量を教えてから、生成を開始してください。

パス B: Hypit クレジットなし、自分の API を使用

今回は自前の API パスに従いました:画像生成には Google を、動画生成には ZenMux の MiniMax H3 Max を使用しました。

まず Codex にインターフェースを設定させ、モデルが呼び出せることを確認してから、制作を続けました。

画像生成には Google API を、動画には ZenMux の MiniMax H3 Max を使用してください。設定の完了と可用性の確認を手伝ってください。有料テストが必要な場合は、まずコストを説明してください。

雪踏乌云 - inline image

Codex に元動画と Han Li 画像を与える

次に、「Chao Ge Shuo Che」の動画リンクと Han Li 画像を一緒に Codex に送信し、最初の 20 秒だけを再現するように指定しました。

この動画の最初の 20 秒を再現し、キャラクターを提供した Han Li 画像に置き換えてください。元の構図、カットリズム、字幕、PiP を維持してください。元のオーディオを保持してください。すべての操作を同じ Hypit プロジェクト内で完了してください。

再現範囲を明確にしてください。そうしないと、10 分以上ある元動画に対して、Codex が全長を計画してしまう可能性があります。

雪踏乌云 - inline image

動画生成前に最初のフレームを確認する

Codex にショットを分解させ、4 つの最初のフレームを生成しました:ライブ配信ルームにいる Han Li、夕暮れの都市交通、トンネル内の白いメルセデス、日中の街路交通です。

このステップでは主に、キャラクターの外見が正しいか、服装が適切か、シーンが逸脱していないかをチェックします。最初のフレームが満足できない場合は、動的動画の生成を続ける前にまず修正してください。

まず 4 シーンの最初のフレームを表示してください。Han Li の顔、長い髪、青金色のローブを維持してください。車のショットには元のホスト、字幕、PiP を含めないでください。これらは後で Hypit によって統一的に追加されます。

[ここに Han Li ライブ配信ルームの最初のフレームを挿入]

Codex にセグメントを生成させ、Hypit で合成する

最初のフレームを確認した後、Codex に 4 つのホストセグメントと 3 つの車セグメントを生成させ、それぞれ 5 秒ずつ要求し、その後 Hypit を使用して最終的な 20 秒を合成しました。

モデルはビジュアルを生成し、Hypit はカット、字幕、PiP を処理します。

確認済みの最初のフレームと予算に従って動的アセットを生成し、元のリズムに従って 20 秒の動画を合成してください。車のショットが表示される際は、中央下部に PiP として Han Li を配置し、元のオーディオと字幕を含めてください。すでに生成されたアセットは直接再利用し、再生成しないでください。

雪踏乌云 - inline image

今回、参考動画から Han Li バージョンの最終カットまで、私の主なタスクは Codex に要件を与え、結果をレビューし、調整が必要な箇所を伝えることでした。

Hypit は単なる動画だけでなく、編集可能なプロジェクトを残します。次回キャラクターを変更したり、字幕を編集したり、PiP を調整したりしたい場合は、このプロジェクトから続行できます。

もちろん、現在のアクションやリップシンクはまだ 1:1 の再現には達していませんが、Seedance シリーズのようなより優れたモデルを使用すれば、これを大幅に改善できます。興味があれば、まず短い 10〜20 秒の動画を見つけて、どのステップが節約できるか試してみてください。

プロジェクトアドレス: hypit-ai/hypit。有用だと感じたら、プロジェクトへのスター登録を検討してください。

YouMindで再制作

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る