Te regalo 7 habilidades gratuitas y el pipeline exacto que los directores están usando para producir películas con IA con presupuestos de millones de dólares en higgsfield... el sistema completo revelado paso a paso, con la habilidad que ejecuta cada etapa lista para instalar hoy mismo
Seedance 2.5 a 1080p (solo en higgsfield) ahora significa que puedes generar de una sola vez anuncios/creativos/tráilers completos de 30 segundos sin necesidad de escalado... esto es increíble

esto es lo que incluye:
- la única plataforma por la que fluye todo el flujo de trabajo y por qué
- el único problema con el que muere toda película de IA
- las 11 etapas y las dos puertas que las mantienen unidas
- cada etapa desglosada, las automatizables cerrando con la habilidad que las ejecuta
- lo que sigue siendo humano y por qué
- el bloque del manual completo
para acceder a todas las habilidades, únete aquí: https://t.me/tgmachina las publicaré en breve
y si quieres profundizar en cómo convertir el video con IA en ingresos reales, la formación y los sistemas semanales para ello están en la comunidad de operaciones de IA en tiempo real en weeklyaiops.com
el motor: seedance 2.5 a 1080p y el CLI
todo en este artículo funciona a través de una plataforma: higgsfield
dos razones, y ambas son estructurales: toda la superficie está construida para uso agéntico, por lo que tu agente puede impulsar cada generación de principio a fin, y Seedance 2.5 a 1080p solo en higgsfield se ejecuta en ella
todo el flujo de trabajo se ejecuta en un solo modelo de video, deliberadamente
un modelo significa una gramática de prompt, un conjunto de peculiaridades, un comportamiento de consistencia que aprender... los modelos de imagen solo construyen las hojas de referencia que lo alimentan
ese modelo de video hoy es Seedance 2.5
genera de una sola vez un clip de 30 segundos con el diálogo sincronizado de labios y los efectos de sonido generados en la misma pasada, y lleva un presupuesto de referencia lo suficientemente grande como para contener tu reparto, tu ubicación, un accesorio clave, un movimiento de cámara, una voz y la ambientación dentro de una sola generación
la regla de iteración del pipeline le da a una toma fallida de 10 a 15 intentos antes de que puedas culpar a la redacción
el CLI es la puerta agéntica:
- npm install -g @higgsfield/cli
- higgsfield auth login
- npx skills add higgsfield-ai/skills
tres comandos y cada modelo se vuelve invocable desde Claude Code o cualquier otro sistema que uses, lo que significa que un agente puede manejar todo el pipeline... qué genera, en qué orden, con qué modelo, mientras tú diriges
y si 2.5 es reemplazado el próximo trimestre, nada de lo siguiente cambia... trata la tabla de modelos como una instantánea, porque las etapas y las puertas son la parte que conservas
aquí tienes un ejemplo rápido de lo que podrías producir con este pipeline:

el actor no recuerda cómo se veía ayer
esa frase es la razón completa por la que existe este pipeline
un modelo de video no tiene memoria entre generaciones, por lo que si la apariencia de un personaje no se describe exhaustivamente en cada prompt, las tomas vecinas le dan una cara diferente, una chaqueta diferente, una edad diferente
en un clip de 10 segundos nadie lo nota... en 90 minutos mata la película, porque el público detecta una ruptura de continuidad más rápido que cualquier otro defecto
el modelo no tiene memoria, por lo que el pipeline es la memoria
la mitad de las etapas que estás a punto de ver existen solo para recordar cosas en nombre del modelo... qué lleva el héroe, a qué distancia está la puerta de la ventana, qué paleta domina la escena
y la memoria se basa en cuatro reglas que nunca debes romper:
- no generes nada para la película hasta que cada activo esté bloqueado
- un activo obtiene un pasaporte aprobado, copiado textualmente en cada prompt que lo use
- las ediciones son quirúrgicas: cambia una línea, mantén todo lo demás palabra por palabra
- todo está versionado y registrado, porque una buena toma no registrada es una toma que no puedes reproducir
rompe la primera regla y rehaces la mitad de tu material una vez que el estilo se desvía
el resto de este artículo son esas cuatro reglas extendidas en un estudio funcional
las 11 etapas
la preproducción clásica es casting, búsqueda de localizaciones y un taller de utilería
aquí funciona al revés: arreglas referencias digitales en su lugar, y cuanto más ajustes las primeras etapas, más barata será cada generación posterior

- desglose: el guion se convierte en escenas y tarjetas de toma
- referencias: imágenes recopiladas como especificación, por activo y por estilo
- el bloqueo de la biblia visual: cada tabla recibe una decisión por escrito
- hojas de activos: los personajes, ubicaciones y accesorios obtienen pasaportes
- la biblioteca: los pasaportes se someten a pruebas de estrés y luego se bloquean en un registro
- generación: las tomas se producen a partir de tarjetas y pasaportes
- edición: el montaje se ejecuta en paralelo con la generación
- limpieza: los artefactos se corrigen toma por toma
- color: un colorista externo unifica y luego etalonaje
- sonido: un equipo de postproducción externo limpia y mezcla
- master: entregables para festivales y plataformas, más el archivo
las etapas se ejecutan en secuencia a nivel de escena, con una excepción: mientras se genera la escena N, el editor ya está montando la escena N-1 y el equipo de dirección está planificando las tomas de la N+1
esa superposición existe porque una regrabación aquí cuesta minutos, no un día de rodaje
el editor ve un montaje, solicita un plano de recurso faltante y lo tiene esa misma tarde... lo que significa que la edición deja de ser postproducción y comienza a dar forma activamente a lo que se crea
pero nada de esto comienza hasta que las puertas lo dicen
una etapa sale a través de una lista de verificación por escrito, y la puerta más difícil está frente a la generación: cada personaje, variante, ubicación y accesorio en una escena necesita una fila de registro marcada como bloqueada antes de que se renderice un solo fotograma de la película
la regla más cara del pipeline, y la más gratificante
ahora las etapas en sí mismas
cada una a continuación se cierra con la habilidad que construí para ejecutarla, y las 7 están esperando en el telegram
etapa 1: el desglose
antes de que alguien escriba un prompt, el guion se convierte en tarjetas de toma
cada toma obtiene una tarjeta de 22 campos en tres carriles:
- identidad: ID de escena y toma, ubicación, hora del día, personajes con sus etiquetas de activo y variantes de estado, accesorios, descripción, el diálogo textual, duración, complejidad
- dirección: el objetivo de la toma, la tarea como verbo, dramaturgia, bloqueo, actuación, recurso estilístico
- cámara y edición: tamaño, movimiento, lente, ángulo, tipo de corte, ritmo, transición
22 campos suenan a burocracia hasta que ves lo que compran: el prompt luego se escribe solo casi mecánicamente, porque los grupos de columnas se asignan uno a uno a los bloques de prompt

dos reglas acompañan
cada clip lleva una sola acción, nunca una secuencia de ellas
y cualquier texto que deba aparecer dentro del encuadre... un letrero, una pantalla de teléfono, un título... sale de la generación por completo y va a su propia lista de tareas, porque los modelos de video escriben texto mal y los títulos pertenecen a la edición
la habilidad: /film-breakdown toma un guion, un tratamiento o una idea de un párrafo y la recorre escena por escena, una pregunta a la vez, escribiendo la tabla de escenas y un archivo de tarjeta de toma por escena a medida que avanza
cada toma sale con los 22 campos completos, y cualquier texto dentro del encuadre ya está extraído en su propia lista de tareas antes de que hagas un prompt

pero una tarjeta perfecta todavía describe a un hombre que ningún modelo dibujará de la misma manera... ese problema tiene sus propias dos etapas
etapas 2 y 3: referencias y el bloqueo
una referencia aquí es una especificación
"un padre cansado con una chaqueta gastada" produce un hombre diferente en cada modelo y en cada cabeza
una imagen real de él resuelve la pregunta, por eso la regla funciona en una sola dirección: encuentra la imagen existente primero, luego descríbela... nunca imagines una descripción y busques pruebas
los recuentos de trabajo: 10 a 20 imágenes para un personaje principal, 8 a 15 por ubicación clave, 3 a 5 por accesorio, más tableros separados para luz, color, óptica, movimiento de cámara, textura, ritmo de corte y sonido
esos rangos se cuentan de producciones reales, no se adivinan, por eso no los estoy redondeando
cada imagen recibe un título que nombra exactamente lo que se toma de ella
una imagen que solo te gusta, sin título, es basura una semana después
y las imágenes marcadas "así no... no permitido" se convierten en la lista de prohibiciones, lo que te ahorra más generaciones que las referencias
la forma más rápida de llenar los tableros de estilo es extraer del cine real en lugar de imaginar: alimenta fotogramas de películas que ya tengan tu sensación a un modelo de visión, haz que nombre la lente, la dirección de la luz, la paleta, el grano, y bloquea la salida como un párrafo que se pega en cada prompt del proyecto
luego viene el bloqueo, y el bloqueo está escrito
cada tablero termina en una decisión fija... aprobado, revisar o rechazado... registrada en el propio tablero
un estilo que fue aprobado verbalmente significa que el director y el ingeniero de prompts tienen dos películas diferentes, y se dan cuenta un mes después
la habilidad: /reference-board ejecuta la entrevista un tablero a la vez... tú proporcionas las referencias, él fuerza un título en cada imagen, archiva cada anti-referencia en la lista de prohibiciones y cierra cada tablero con la decisión por escrito, aprobado, revisar o rechazado
nada se llama bloqueado sin esa decisión en el tablero

etapa 4: el pasaporte
aquí es donde se fabrica la consistencia
observa lo que le sucede a un personaje: recibe un descriptor de texto exhaustivo y una hoja de imágenes de referencia generadas sobre un fondo gris neutro... frente, tres cuartos, perfil, espalda, retrato cercano
ese par, descriptor más referencias, viaja a cada prompt en el que aparece, palabra por palabra, archivo por archivo
ese es su pasaporte, y una producción tiene uno por personaje, ubicación y accesorio
la ropa mojada es un pasaporte diferente
también lo es la sangre... @cal, @cal_wet y @cal_blood son tres activos separados con tres etiquetas separadas, porque una variante descrita en línea es una variante que el modelo olvidará
dos detalles hacen que los pasaportes se mantengan:
- el descriptor nunca se acorta, ya que "recortado por brevedad" es exactamente donde muere la consistencia
- el pasaporte de una ubicación lleva la paleta de la escena y el carácter de la luz en su interior, por lo que cada toma en esa ubicación llega pre-etalonada
y las imágenes de referencia se construyen primero a mano, en un modelo de imagen, antes de que exista cualquier prompt de video
bloquéalas y nunca las regeneres... si el movimiento se ve mal más tarde, corriges el prompt de movimiento, porque una nueva imagen deshace cada pieza de trabajo de consistencia apilada sobre la anterior
cada pasaporte aterriza como una fila en un registro vivo: etiqueta, tipo, versión, archivo semilla, escenas, estado
un pasaporte en este punto sigue siendo un borrador, porque un pasaporte construido sobre una sola imagen afortunada es una falsa victoria
la habilidad: /asset-passport construye un activo a la vez... te entrevista hasta que el descriptor no tenga lagunas, escribe los prompts de la hoja de referencia de fondo gris para tu modelo de imagen, divide cada variante de estado en su propio activo etiquetado y archiva la fila del registro como borrador

etapa 5: la prueba de estrés
antes de que se confíe en cualquier activo, genera en condiciones de combate: diferentes ángulos y tamaños de toma, la iluminación de sus escenas reales y junto a cada activo con el que compartirá encuadre... porque un personaje que se sostiene solo a menudo se rompe en el momento en que comparte encuadre
las pruebas son imágenes estáticas baratas, ejecutadas antes de una sola generación de video costosa
los personajes deben alcanzar 10 de 10 en repetibilidad
lo cual es correcto
cualquier cosa por debajo de eso mantiene la fila del registro como borrador, y la escena que bloquea espera o se mueve conscientemente al siguiente bloque de producción
la generación de una escena comienza cuando cada fila que toca dice bloqueada, y no una hora antes
la habilidad: /stress-test lee tu registro y desglose, construye la matriz de combate... ángulos, tamaños de toma, la luz real de la escena, un plano de dos junto a cada coprotagonista... te entrega los prompts de prueba y cambia la fila a bloqueada solo en una pasada completa
sin pasada completa, no hay bloqueo, y la escena permanece cerrada

con el registro en verde, la producción finalmente comienza a renderizar... y cada toma proviene de los mismos quince bloques
etapa 6: el prompt
cada prompt de toma son los mismos 15 bloques en el mismo orden fijo
sin prompt negativo en ninguna parte... cada prohibición se reescribe como lo QUE SÍ está en el encuadre
esto es en lo que se ejecuta la etapa de generación, porque una vez que los bloques están bloqueados, el renderizado en sí es mecánico

los bloques que vale la pena robar por sí solos:
- el abridor indica "EXACTAMENTE N PERSONAJES - SIN DUPLICADOS" porque el modelo agrega personas en el momento en que dejas el recuento abierto
- el mapa de ubicación da distancias en metros y nombra la línea que la cámara nunca cruza
- una lente por toma, y el campo de visión cambia solo en un corte duro
- la acción aterriza en tiempos de 0.3 a 0.8 segundos
- la física persiste: el daño nunca se cura a mitad de escena, los escombros permanecen donde cayeron
- la luz nunca es plana y frontal, viene moldeada desde las propias fuentes de la ubicación
- el bloque de estilo se cierra con una línea de color 60:30:10: el tono dominante, el secundario y la parte del acento en el encuadre
para una toma única de 30 segundos, el prompt se divide en cuatro tiempos... 0-6 establece la escena, 6-14 construye, 14-24 gira, 24-30 resuelve... con el conjunto de detalles completo escrito por tiempo, incluidas las marcas de tiempo
las referencias obtienen la misma disciplina: cada imagen, clip o archivo de audio adjunto indica qué controla y qué no debe tocar
"@video 1 define el movimiento y el ritmo" es la mitad de un rol... la otra mitad es "no tomes identidad, vestimenta ni escena de él", y esa segunda línea es lo que evita que una referencia se filtre en una toma que nunca debió moldear
el movimiento tiene su propia gramática: cada prompt nombra el movimiento de cámara y lo empareja con un evento que ocurre durante el clip
luego dice sin figuras congeladas, directamente
un travelling junto a una figura de pie es una imagen fija que se desplaza
el mismo travelling mientras la vela se desgarra es una película
luego la regla de iteración
una edición cambia una línea y mantiene todo lo demás textualmente, cada intento se registra con lo que cambió y el veredicto, y una toma que no ha aterrizado en el intento 15 no necesita mejores palabras... necesita una toma más simple: divídela en dos, elimina una acción, cambia el ángulo
una toma terminada se acepta mediante lista de verificación... coincide con las referencias, sin artefactos, cámara según lo ordenado, la sincronización de labios se mantiene, corta con sus vecinos... y solo las tomas aceptadas reciben nombres finales en la carpeta de selecciones
esa aceptación es el último sí que una toma necesita, porque el editor nunca toca las generaciones en bruto
la habilidad: /shot-prompt toma una tarjeta de toma más los pasaportes bloqueados de todo lo que está en el encuadre, y se niega a escribir un prompt listo para generar mientras alguno de esos activos siga siendo borrador
luego escribe los 15 bloques con cada descriptor pegado textualmente y mantiene el registro de generación contigo... una línea cambiada por intento, simplifica la toma en el intento 15

el estudio es un árbol de archivos
no hay oficina de producción en este pipeline
hay un directorio
- assets contiene los pasaportes: personajes, ubicaciones, accesorios
- prompts contiene las tarjetas de toma y cada versión de prompt
- generations contiene los intentos en bruto, y nadie más que el ingeniero de prompts entra
- selects contiene solo las tomas aceptadas, y es la única carpeta que la edición puede ver
- edit, color, sound y master contienen la cadena de finalización
- docs contiene el desglose, la biblia, el registro y el registro de generación
una ley más: un archivo de referencia nunca se renombra
una nueva versión es un nuevo archivo, porque renombrar rompe cada prompt que apunta al anterior
la habilidad: /studio-init hace una pregunta, el nombre del proyecto, luego crea todo el árbol, siembra el desglose, la biblia, el registro y el registro de generación como plantillas listas, y escribe las tres leyes de carpetas en el proyecto para que cada agente que lo toque las herede

y la séptima habilidad es la puerta de entrada: /setup pregunta con qué modelos de imagen y video trabajas, cómo accedes a cada uno, y nunca asume una pila... escribe la configuración compartida en tu proyecto para que cada otra habilidad lea la misma configuración, luego te entrega la cadena en orden: setup, studio-init, film-breakdown, reference-board, asset-passport, stress-test, shot-prompt

las 7 están en el telegram: https://t.me/tgmachina
etapas 7 a 11: lo que sigue siendo humano
edición, limpieza, color, sonido y master son las cinco etapas que ninguna habilidad ejecuta
el pipeline genera imagen y audio de referencia, y se detiene ahí a propósito
la finalización es trabajo humano
la edición recorta el primer y el último medio segundo de casi cada generación, porque los clips se desvían en sus bordes
y corta más fuerte de lo que se siente natural, porque las tomas generadas tienden a entradas lentas... la instrucción permanente es cortar de manera más agresiva de lo que crees que deberías
el sonido generado es un andamio: las líneas sincronizadas de labios establecen el tiempo, luego un equipo de postproducción de sonido limpia esa misma voz en lugar de regrabarla, reconstruye los efectos y mezcla al volumen de la plataforma
el color va a un colorista cuyo primer trabajo es unificar las tomas vecinas, ya que el pasaporte de cada ubicación ya entregó un etalonaje incorporado para refinar
y los masters se envían como cualquier estudio: un DCP, el paquete de entrega de cine estándar, para festivales, un archivo ProRes, el formato de archivo de alta calidad, para la bóveda, más codificaciones de plataforma y subtítulos
el archivo guarda más que la película terminada
guarda los medios de producción... cada prompt final, el registro de generación, el registro, los pasaportes bloqueados... porque la secuela comienza desde todo lo que la última producción aprendió
el bloque del manual
todo el pipeline, comprimido al bloque que vale la pena guardar:
- bloquea la biblia visual por escrito antes de que se genere cualquier cosa para la película
- un activo, un pasaporte: descriptor exhaustivo más referencias de fondo gris, copiado textualmente para siempre
- prueba de estrés cada pasaporte a 10/10 en luz de escena y planos de dos antes de que se abran sus escenas
- escribe cada prompt como los mismos 15 bloques, cuatro tiempos para una toma de 30 segundos
- cambia una línea por intento, registra cada generación, simplifica la toma en el intento 15
- acepta tomas mediante lista de verificación en selects: la edición no ve nada más
- recorta los bordes, corta agresivo, bloquea la imagen, entrega color y sonido a humanos
salta los bloqueos y la mitad de tu material se hace dos veces
los modelos cambiarán bajo este sistema... el método en sí mismo espera que su tabla de modelos envejezca en meses
la secuencia y las puertas son la parte que no cambia
gracias a higgsfield por patrocinar este artículo
las 7 habilidades se publicarán en mi telegram en breve: https://t.me/tgmachina





