Сьогодні ми запускаємо MiniMax H3 — універсальну мультимодальну генеративну модель. H3 розуміє єдиний контекст тексту, зображень, відео та аудіо, створюючи відео з нативним стереозвуком, до 15 секунд, у роздільній здатності 2K.
Ранні тестування показують, що H3 готовий до створення комерційного контенту в широкому діапазоні сценаріїв використання, чудово справляючись з виконанням інструкцій, точним відтворенням тексту та брендових елементів, а також перенесенням руху V2V. Завдяки точній, контрольованій мультимодальній генерації та редагуванню H3 створений для реклами, брендингу, електронної комерції, продуктового дизайну, UI/UX, ігор тощо.
Завдяки таким технологіям, як Contextual Omni Representation, H3-VAE, H3-Omni Transformer та In-Context Regeneration, H3 забезпечує найкраще в індустрії співвідношення ціни та продуктивності. Ми пропонуємо роздільну здатність 2K за замовчуванням. При 2K ціна H3 за секунду менша за третину ціни масових моделей, а при 768p — менша за половину ціни 720p масових моделей.
Закриті моделі тривалий час домінували у відеогенерації, з повільнішими ітераціями та менш відкритою екосистемою порівняно з такими напрямами, як великі мовні моделі. Щоб підтримати спільноту відкритого коду, прискорити сумісність із ширшим спектром AI-обладнання та спростити користувачам створення власних кастомізованих версій, ми плануємо найближчими днями відкрити ваги моделі з урахуванням чинного законодавства. Сумісність із обладнанням була ключовим фактором із найраніших етапів розробки H3.
Ключові особливості моделі H3
1. Розуміння мультимодального контексту
Справжня творча робота вимагає поєднання складної інформації з різних модальностей, залучаючи зображення, аудіо, відео тощо як вхідні джерела. Наприклад, запит для кадру нижче: «Відтвори рух камери Гічкока з Відео 1, зроби так, щоб персонаж із Зображення 2 співав, а вокал відповідав Аудіо 3». Просто опишіть словами зв'язок між контекстом і цільовим відео. H3 самостійно справляється зі складним розумінням усіх модальностей.
Мультимодальний вхід

Відео 1

Зображення 2

Аудіо 3
Відео, згенероване H3

2. Продуктивність 2K

3. Нативний стереозвук

Приклади використання H3
1. Вступні титри до фільмів

2. Вебсайт продукту

3. Анімований постер

4. Реклама та електронна комерція

Філософія дизайну H3
Подолання меж між завданнями: від спеціалізованого до універсального
Ми розробили два попередні покоління моделей: Hailuo 01 створив систему з нуля, а Hailuo 02 зосередився на вдосконаленні ключових компонентів, таких як архітектурна ефективність, якість даних і масштаб.
Під час розробки H3 ми усвідомили обмеження попередніх генеративних моделей щодо меж між завданнями: генерація зображень зазвичай розділялася на окремі експертні моделі для T2I, редагування, референсу об'єкта, референсу руху та референсу стилю; голос, звукові ефекти та музика в аудіогенерації значною мірою вивчалися як окремі домени; а генерація відео була додатково фрагментована на текст-у-відео, зображення-у-відео, перший-та-останній кадр, референс об'єкта, референс руху, референс голосу, редагування відео тощо, з чіткими межами між зображенням, відео та аудіо.
Ці ізольовані завдання, можливості та модальності обмежували творчу свободу на практиці. А з боку навчання — обмежували здатність моделі до узагальнення. Обидва аспекти вказують на значний простір для змін як у парадигмі застосування, так і в парадигмі навчання. Тому першим принципом розробки H3 стало об'єднання та узагальнення різних завдань.
Виходячи з цього, ось короткий огляд парадигми попереднього навчання H3:
1. Дані та завдання
Текст-у-зображення
Текст-у-відео
З аудіо, згенерованим спільно з відео, весь аудіовихід є нативним стерео
Нативне багатокадрове моделювання*
Текст-у-аудіо
Без розділення між голосом, звуковими ефектами та музикою — усе моделюється спільно
2. Узагальнені референси та редагування
Референс і редагування зображення-у-зображення
Референс і редагування зображення-у-відео
Референс і редагування аудіо-у-аудіо
Референс і редагування аудіо-відео-у-аудіо-відео
У нашому дизайні «узагальнені референси та редагування» означає:
- Побудовано повністю на реальних, природних даних, що забезпечує сильну масштабованість даних.
- Зв'язки референсів і редагування виражаються природною мовою, а не обмежуються фіксованим набором завдань; мова (або структура інтелекту, загалом) є мостом до узагальнення.
3. Архітектура
Об'єднуйте різноманітні типи даних і завдань якомога раніше — правильна пропорція змішування є ключовою.
4. Стратегія навчання
Об'єднуйте різноманітні типи даних і завдань якомога раніше в процесі навчання — правильна пропорція змішування є ключовою.
Усі ці рішення спрямовані на одну мету: надати H3 широкі можливості розуміння та генерації мультимодального контексту,





