Hypit이란 무엇인가요?
Hypit은 AI 에이전트가 동영상을 제작할 수 있도록 지원하는 오픈소스 프로젝트입니다. Codex에 참조 영상, 캐릭터 이미지, 요구 사항을 제공하면 에이전트가 Hypit을 활용하여 자산 생성, 편집, 자막 및 화면 속 화면(PiP) 효과를 정리하고 최종적으로 영상을 내보냅니다.
또한 수정 가능한 프로젝트 파일이 남습니다. 나중에 자막을 변경하거나 PiP를 조정해야 할 경우, 생성된 자산을 재사용하여 계속 수정할 수 있습니다.
오픈소스 주소: hypit-ai/hypit
먼저 완성된 결과물을 보겠습니다. 왼쪽은 'Chao Ge Shuo Che'(Brother Chao Talks Cars)의 원본 영상이고, 오른쪽은 제가 'Han Li'라는 캐릭터를 사용하여 복제한 버전입니다.

이는 제 자체 Minimax H3 API를 사용하여 만든 것입니다. 공식 API나 SeedDance를 사용한다면 결과는 더욱 좋아질 것입니다.
아래에서는 설치부터 전체 작업 과정을 완전히 안내합니다. 모델 구성에는 두 가지 경로가 있습니다: Hypit 크레딧이 있는 경우 내장 서비스를 사용하거나, 없는 경우 자체 API를 연결하는 것입니다. 이 예제는 실제로 자체 API 경로를 따릅니다.
- 역할 명확히 하기: Hypit, Codex, 생성 모델은 각각 무엇을 담당하나요?
혼란을 피하기 위해 파이프라인에서 각 도구의 구체적인 책임을 먼저 명확히 해야 합니다.
- Codex의 역할: 코드 및 엔지니어링 실행 어시스턴트로서 Codex는 자연어 사용자 요청을 분석하고, 로컬 개발 환경을 확인 및 구성하며, 참조 영상의 스토리보드 구조를 읽고 세분화하고, 프로젝트 소스 파일을 생성 및 수정하며, 하위 엔진 호출을 조직화하여 자동화된 파이프라인을 완료합니다.
- 이미지 및 비디오 모델의 역할: 정적 시각 자산과 동적 장면을 생성하는 데 전담합니다. 이 예제에서는 이미지 모델이 현대 라이브 방송 방에 있는 고대 의상을 입은 남성의 첫 프레임을 생성하고, 비디오 모델은 첫 프레임을 말하는 스트리머 애니메이션으로 구동하며 프롬프트에 기반해 외부 교통 장면을 생성합니다.
- Hypit 엔진의 역할: 핵심 오케스트레이션 센터로서 Hypit은 모든 생성된 자산 의존성을 기록하고, 컷 시퀀스와 전환 타이밍을 정의하며, 자막 표시 타이밍과 외관을 제어하고, PiP 위치, 레이어링, 모서리 둥근 마스크를 관리하며, 자산 준비가 완료되면 하위 렌더러를 호출하여 최종 영상을 합성합니다.
독자들의 실제 상황에 맞추기 위해 이 튜토리얼은 생성 모델 구성을 두 개의 독립적인 경로로 명시적으로 나눕니다:
- 경로 A: Hypit 계정에 사용 가능한 크레딧이 있으며 공식 HypiHub 서비스를 통해 내장 호스팅 모델을 직접 호출합니다.
- 경로 B: Hypit 플랫폼 크레딧이 없으며 자체 서드파티 API 인터페이스를 명시적으로 구성하고 연결합니다.
조건에 맞는 하나의 경로(A 또는 B)만 선택하여 구성을 완료한 후, 공통 제작 및 오케스트레이션 워크플로우로 통합하면 됩니다.
- 준비 및 자산 사양
시작하기 전에 Codex, 명확한 참조 영상, 그리고 대체하려는 대상 캐릭터 참조 이미지를 준비하세요.
캐릭터 참조 이미지는 이상적으로 얼굴 특징이 뚜렷하고, 조명이 균일하며, 의상/헤어 디테일이 선명한 1인 사진이어야 합니다. 참조 이미지에는 모션 정보가 포함되지 않으므로, 모델이 정적 이미지만으로 원본 호스트의 어깨 으쓱이나 손짓 등을 자동으로 복제할 것이라고 가정하지 마세요.
결과를 공개적으로 게시할 계획이며 원본 호스트의 목소리를 사용하지 않으려면, 정식 제작 전에 대체 대화 오디오를 녹음하세요. 음성 오버 오디오를 변경하면 발음 휴지와 세그먼트 길이가 달라져 컷과 자막 타이밍을 다시 정렬해야 합니다.
- 설치
공식 Skill 글로벌 설치 명령어를 실행하세요:
npx skills add hypit-ai/hypit -g
설치 진입점은 Hypit 저장소를, 상세한 프로세스 단계는 공식 빠른 시작 매뉴얼을 참고하세요.
경로 A: Hypit 크레딧 보유, 내장 서비스 사용
크레딧이 있다면 자체 API를 구성하지 않고도 Codex가 Hypit의 내장 서비스를 직접 사용하도록 할 수 있습니다.
Hypit의 내장 서비스를 사용하여 로그인하고, 사용 가능한 모델과 크레딧을 확인해 주세요. 예상 소비량을 먼저 알려준 후 생성을 시작하세요.
경로 B: Hypit 크레딧 없음, 자체 API 사용
이번에는 자체 API 경로를 따랐습니다: 이미지 생성에는 Google을, 비디오 생성에는 ZenMux의 MiniMax H3 Max를 사용했습니다.
먼저 Codex에게 인터페이스를 구성하게 하고, 모델 호출이 가능한지 확인한 후 제작을 계속 진행했습니다.
이미지 생성에는 Google API를, 비디오에는 ZenMux의 MiniMax H3 Max를 사용하세요. 구성을 완료하고 가용성을 확인해 주세요. 유료 테스트가 필요한 경우 비용을 먼저 설명해 주세요.

원본 영상과 Han Li 이미지를 Codex에 전달
다음으로 'Chao Ge Shuo Che'의 영상 링크와 Han Li 이미지를 함께 Codex에게 보내며, 처음 20초만 복제하도록 지정했습니다.
이 영상의 처음 20초를 복제하되, 캐릭터를 제가 제공한 Han Li 이미지로 교체해 주세요. 원본 구성, 컷 리듬, 자막, PiP는 유지하세요. 원본 오디오는 그대로 두고, 모든 작업을 동일한 Hypit 프로젝트 내에서 완료해 주세요.
복제 범위를 명확히 하세요. 그렇지 않으면 10분 이상의 원본 영상에 대해 Codex가 전체 길이를 계획할 수 있습니다.

비디오 생성 전 첫 프레임 확인
Codex에게 컷을 세분화하고 네 가지 첫 프레임을 생성하게 했습니다: 라이브 방송 방의 Han Li, 일몰 도시 교통, 터널 안의 흰색 Mercedes, 낮 시간 거리 교통.
이 단계에서는 주로 캐릭터가 올바르게 보이는지, 의상이 정확한지, 장면이 이탈되지 않았는지 확인합니다. 첫 프레임이 불만족스럽다면 동적 비디오 생성을 계속하기 전에 먼저 수정하세요.
네 가지 장면의 첫 프레임을 먼저 보여주세요. Han Li의 얼굴, 긴 머리, 청금색 로브는 유지하세요. 자동차 컷에는 원본 호스트, 자막, PiP를 포함하지 마세요. 이는 나중에 Hypit이 통일적으로 추가할 것입니다.
[여기에 Han Li 라이브 방송 방 첫 프레임 삽입]
Codex로 세그먼트 생성 후 Hypit으로 합성
첫 프레임을 확인한 후, Codex에게 호스트 세그먼트 4개와 자동차 세그먼트 3개를 각각 5초씩 생성하게 한 다음, Hypit을 사용하여 최종 20초를 합성했습니다.
모델은 비주얼을 생성하고, Hypit은 컷, 자막, PiP를 처리합니다.
확정된 첫 프레임과 예산에 따라 동적 자산을 생성한 후, 원본 리듬에 맞춰 20초 영상을 합성해 주세요. 자동차 컷이 나타날 때 Han Li를 중앙 하단 PiP에 배치하고, 원본 오디오와 자막을 포함하세요. 이미 생성된 자산을 직접 재사용하고 재생성하지 마세요.

이번에는 참조 영상부터 Han Li 버전 최종 컷까지, 제 주요 작업은 Codex에게 요구 사항을 전달하고, 결과를 검토하며, 조정 필요 사항을 지시하는 것이었습니다.
Hypit은 단순히 영상만이 아니라 수정 가능한 프로젝트를 남깁니다. 다음에 캐릭터를 변경하거나, 자막을 편집하거나, PiP를 조정하고 싶다면 이 프로젝트에서 계속 진행할 수 있습니다.
물론 현재 동작과 립싱크는 아직 1:1 복제 수준에는 미치지 못하지만, Seedance 시리즈 같은 더 나은 모델을 사용하면 크게 개선될 수 있습니다. 관심이 있다면 먼저 짧은 10~20초 영상을 찾아 어떤 단계를 생략할 수 있는지 확인해 보세요.
프로젝트 주소: hypit-ai/hypit. 유용하다고 생각되면 프로젝트에 스타를 눌러 주세요.





