ПозитивнаImpact 5/10🧪 Beta🏢 Від 50 людей📺 Медіа і Контент

Prism: модель Tencent Hunyuan + Fudan для нативної генерації відео та аудіо за один прохід

Нейронавт | Нейросети в творчестве•близько 13 годин тому•2 перегляди•

Tencent Hunyuan та Фуданський університет випустили Prism — модель ШІ, яка генерує відео та аудіо за один прохід у нативних роздільностях 720p, 1080p та 2K за ліцензією MIT. Для роботи потрібна одна GPU 80 ГБ для 720p або чотири такі карти для 1080p/2K.

ВердиктПозитивнаImpact 5/10

📊 Ніша для медіа. Якість як у лідерів, але доступна для локального запуску — для тих, хто робить 10+ відео/міс і потребує контролю над даними.

Що це означає для вас

Маркетингу

Спробуйте згенерувати тестове відео з голосом та фоновою музикою за один прохід, щоб оцінити якості липсинку та синхронізації

🕐 Завантажте модель з huggingface.co/FrancisRing/Prism і запустіть інференс на одному тестовому запиті з текстом та аудіо-підказкою (20 хв)

📊 З новини: 720p — одна карта 80 ГБ

🛠 Інструмент: Prism

Пропустіть, якщо: якщо ваша команда не має досвіду з запуском ШІ-моделей на GPU — спочатку зверніться до IT-спеціаліста

Перевірте, чи може ваша поточна інфраструктура підтримувати локальну генерацію відео без залежності від закритих API

Отримати карту AI-можливостей →

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • •Prism генерує відео та аудіо за один прохід у нативних роздільностях 720p, 1080p, 2K
  • •Модель заснована на MOVA та випущена під ліцензією MIT з відкритим кодом
  • •Для 720p потрібна одна GPU 80 ГБ; для 1080p/2K — чотири такі карти
  • •Доступні превью-версії alpha (стабільна) та beta (з покращеним рухом)
  • •Проект підтримується Tencent Hunyuan та Фуданським університетом

Як це змінить ваш ринок?

Медіакомпанії та продакшн-студії, які працюють з дубляжем, локалізацією або створенням соціального контенту, тепер можуть уникати залежності від закритих API типу Sora або Runway. Це зменшує витрати на генерацію та підвищує конфіденційність проєктів, особливо для брендів, які працюють з чутливими даними або мають строгі вимоги до суверенітету інформації.

Визначення:

Prism — це опенсорсна модель ШІ для генерації синхронізованого відео та аудіо (мова, музика, ефектів) за один прохід, розроблена Tencent Hunyuan у співпраці з Фуданським університетом.

Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.

  • •720p: одна GPU NVIDIA A100 або H100 80 ГБ, без IT-команди, 30 хв на налаштування та тест
  • •1080p/2K: чотири GPU 80 ГБ, потрібен інженер ШІ або DevOps, 2-3 дні на інтеграцію
  • •Для продакшену: рекомендується мати резервне обладнання та систему моніторингу

Альтернативи (ТАБЛИЦЯ: | | Продукт 1 | Продукт 2 | Продукт 3 | з колонками: Ціна, Де працює, Мін. вимоги, Ключова різниця.

| | Prism (локально) | Sora (OpenAI) | Runway Gen-2 | | Ціна | безкоштовно (MIT) | $0.01/секунда | $0.005/секунда | | Де працює | локально на GPU | хмара API | хмара API | | Мін. вимоги | 1x GPU 80 ГБ (720p) | інтернет-з'єднання | інтернет-з'єднання | | Ключова різниця | повний контроль над даними та моделлю | простота використання, але vendor lock-in | хороша якість, але обмежена кастомізація |


💬 Часті запитання

Так, для 720p потрібна одна GPU 80 ГБ (наприклад, NVIDIA A100), а для 1080p/2K — чотири такі карти. На слабшому залізі модель може не запускатися або працювати надто повільно.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
PrismTencentHunyuanFudanvideogenerationaudiogenerationMITlicenseMOVA720p1080p2K

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live