O que é o Hypit?
O Hypit é um projeto de código aberto que permite que Agentes de IA criem vídeos. Você fornece vídeos de referência, imagens de personagens e requisitos ao Codex, e o Agente pode usar o Hypit para organizar a geração de ativos, edição, legendas e efeitos de picture-in-picture (PiP), exportando o vídeo final.
Ele também gera um arquivo de projeto editável. Se você quiser alterar as legendas ou ajustar o PiP posteriormente, pode reutilizar os ativos gerados e continuar modificando-os.
Endereço do Código Aberto: hypit-ai/hypit
Primeiro, veja o produto finalizado. À esquerda está o vídeo original de "Chao Ge Shuo Che" (Irmão Chao Fala sobre Carros), e à direita está minha réplica usando o personagem "Han Li".

Isso foi feito usando minha própria API Minimax H3. Se você usar a API oficial ou SeedDance, os resultados serão ainda melhores.
Abaixo, começamos pela instalação e percorremos toda a operação completamente. A configuração do modelo tem dois caminhos: use serviços integrados se você tiver créditos no Hypit, ou conecte sua própria API se não tiver. Este exemplo segue na verdade o caminho da API própria.
- Esclarecendo Papéis: O que o Hypit, o Codex e os Modelos de Geração fazem cada um?
Precisamos primeiro esclarecer as responsabilidades específicas de cada ferramenta no fluxo de trabalho para evitar confusão:
- Papel do Codex: Como assistente de execução de código e engenharia, o Codex analisa solicitações de usuários em linguagem natural, verifica e configura o ambiente local de desenvolvimento, lê e decompondo a estrutura do storyboard dos vídeos de referência, gera e modifica arquivos-fonte do projeto e organiza chamadas aos motores subjacentes para completar fluxos automatizados.
- Papel dos Modelos de Imagem & Vídeo: Responsáveis especificamente por gerar ativos visuais estáticos e cenas dinâmicas. Neste exemplo, o modelo de imagem gera o primeiro quadro de um homem com traje antigo em uma sala de transmissão ao vivo moderna, enquanto o modelo de vídeo anima esse primeiro quadro em uma animação de streamer falando e gera planos externos de tráfego com base nos prompts.
- Papel do Motor Hypit: Como centro de orquestração principal, o Hypit registra todas as dependências dos ativos gerados, define sequências de planos e relógios de transição, controla o tempo de exibição e aparência das legendas, gerencia posição, camadas e máscaras de cantos arredondados do picture-in-picture, e chama o renderizador subjacente para compor o vídeo final assim que os ativos estiverem prontos.
Para acomodar as condições reais de diferentes leitores, este tutorial divide explicitamente a configuração do modelo de geração em dois caminhos independentes:
- Caminho A: Você tem créditos disponíveis na sua conta Hypit e chama diretamente modelos hospedados integrados via serviço oficial HypiHub.
- Caminho B: Você não tem créditos na plataforma Hypit e configura explicitamente e conecta suas próprias interfaces de API de terceiros.
Você só precisa escolher um caminho (A ou B) que se adeque às suas condições para completar a configuração, depois integrar-se ao fluxo comum de produção e orquestração.
- Preparação e Especificações de Ativos
Antes de começar, prepare o Codex, um vídeo de referência claro e uma imagem de referência do personagem alvo que você deseja substituir.
As imagens de referência de personagens devem idealmente ser fotos de pessoa única com traços faciais distintos, iluminação uniforme e detalhes claros de roupa/cabelo. Como as imagens de referência não contêm informações de movimento, não presuma que o modelo replicará automaticamente os encolhimentos de ombro, gestos manuais etc., do apresentador original apenas a partir de uma imagem estática.
Se você planeja publicar o resultado publicamente e não quer usar a voz do apresentador original, grave áudio de diálogo substituto antes da produção formal. Alterar o áudio da narração altera pausas de pronúncia e durações de segmentos, exigindo realinhamento de cortes e tempos de legenda.
- Instalação
Execute o comando de instalação global oficial do Skill:
npx skills add hypit-ai/hypit -g
Consulte o Repositório Hypit para pontos de entrada de instalação, e o Manual Oficial de Início Rápido para etapas detalhadas do processo.
Caminho A: Com Créditos Hypit, Usando Serviços Integrados
Se você tem créditos, pode deixar o Codex usar os serviços integrados do Hypit diretamente sem configurar sua própria API.
Por favor, use os serviços integrados do Hypit para me ajudar a fazer login, verificar modelos disponíveis e créditos. Me diga o consumo estimado primeiro, então comece a geração.
Caminho B: Sem Créditos Hypit, Usando Sua Própria API
Segui o caminho da API própria desta vez: usando Google para geração de imagens e MiniMax H3 Max da ZenMux para geração de vídeos.
Primeiro fiz o Codex configurar as interfaces, confirmei que os modelos podiam ser chamados e então continuei a produção.
Use a API do Google para geração de imagens e o MiniMax H3 Max da ZenMux para vídeo. Por favor, me ajude a completar a configuração e verificar a disponibilidade. Explique custos primeiro se testes pagos forem necessários.

Entregue o Vídeo Original e a Imagem de Han Li ao Codex
Em seguida, enviei o link do vídeo de "Chao Ge Shuo Che" e a imagem de Han Li juntos ao Codex, especificando para replicar apenas os primeiros 20 segundos.
Por favor, replique os primeiros 20 segundos deste vídeo, substituindo o personagem pela imagem de Han Li que forneci. Preserve a composição original, ritmo de corte, legendas e picture-in-picture. Mantenha o áudio original. Complete todas as operações dentro do mesmo projeto Hypit.
Seja claro sobre o escopo da replicação; caso contrário, para um vídeo original de mais de 10 minutos, o Codex pode planejar para a duração inteira.

Verifique os Primeiros Quadros Antes de Gerar o Vídeo
Fiz o Codex decompor os planos e gerar quatro primeiros quadros: Han Li na sala de transmissão ao vivo, tráfego urbano ao pôr do sol, Mercedes branca em túnel e tráfego urbano diurno.
Este passo verifica principalmente se o personagem parece correto, se a roupa está certa e se as cenas não sofreram deriva. Se os primeiros quadros não forem satisfatórios, modifique-os primeiro antes de continuar a gerar vídeo dinâmico.
Por favor, mostre os primeiros quadros das quatro cenas primeiro. Preserve o rosto de Han Li, cabelo longo e vestes azul-douradas. Planos de carros não devem incluir o apresentador original, legendas ou picture-in-picture; estes serão adicionados uniformemente pelo Hypit mais tarde.
[Insira Aqui o Primeiro Quadro da Sala de Transmissão de Han Li]
Faça o Codex Gerar Segmentos, Depois Componha com o Hypit
Após confirmar os primeiros quadros, fiz o Codex gerar quatro segmentos de apresentador e três segmentos de carro, solicitando 5 segundos cada, então usei o Hypit para compor os 20 segundos finais.
Os modelos geram visuais; o Hypit lida com cortes, legendas e picture-in-picture.
Por favor, gere ativos dinâmicos de acordo com os primeiros quadros confirmados e orçamento, então componha um vídeo de 20 segundos seguindo o ritmo original. Quando planos de carros aparecerem, coloque Han Li em um picture-in-picture centralizado na parte inferior, com áudio original e legendas. Reutilize diretamente os ativos já gerados; não regenere.

Desta vez, do vídeo de referência ao corte final versão Han Li, minhas principais tarefas foram dar requisitos ao Codex, revisar resultados e dizer o que precisava de ajuste.
O Hypit deixa para trás não apenas um vídeo, mas um projeto editável. Da próxima vez que você quiser mudar personagens, editar legendas ou ajustar o picture-in-picture, pode continuar a partir deste projeto.
Claro, ações atuais e sincronização labial ainda não atingiram replicação 1:1; usar modelos melhores como a série Seedance melhoraria isso significativamente. Se estiver interessado, tente encontrar um vídeo curto de 10-20 segundos primeiro para ver quais etapas ele economiza para você.
Endereço do Projeto: hypit-ai/hypit. Se achar útil, considere marcar o projeto com estrela.





