Sand.ai випустила MAGI-2 Preview — відкриту модель аудіо‑відео на 114B параметрів
Sand.ai представила MAGI-2 Preview — відкриту модель аудіо‑відео на 114B параметрів з Ultra‑Fine‑Grained MoE.
⚠️ Експериментальний, а не продакшн-готовий. Для великих медіа-компаній з GPU-інфраструктурою може варто експериментувати з генерацією коротких відео.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Вага моделі MAGI-2 Preview становить 307 ГБ (основний трансформер 228 ГБ + кодер Qwen3.5-27B 56 ГБ + рефайнер 14 ГБ + VAE компоненти)
- •Для роботи потрібно 8× NVIDIA Hopper GPU (H100/H200) — це мінімальна конфігурація за даними Sand.ai
- •Орієнтовна вартість генерації у хмарі: приблизно $0.074 за 10 секунд 1080p відео (теоретична оцінка для ще не випущеної дистильованої версії)
- •Модель доступна на Hugging Face та через API платформи Sand.ai (посилання на docs та сторінку придбання кредитів)
- •В лідерборді open-weight відео-моделей з аудіо MAGI-2 Preview займає друге місце з баллом 1108, перше — MiniMax H3 (1192), третє — LTX-2.3 Fast (958)
Як це змінить ваш ринок?
Медіакомпанії, які мають доступ до великих GPU-кластерів, можуть скоротити витрати на продакшн коротких рекламних та соціальних відео, замість наймання аніматорів та rented студій. Однак через високий поріг входження (8× H100 і 307 ГБ ваг) це рішення залишається практичним лише для企业 з власним інфраструктурним бюджетом або можливістю орендувати хмарні вузли. Якщо ваша компанія не може забезпечити таке обладнання, варто розглядати готові API‑провайдери з нижчими вимогами, проте вони можуть мати обмеження за довжиною або якістю відео.
Визначення: Ultra-Fine-Grained MoE — це архітектура mieszanki експертів, де кожен токен активує лише маленький підмножину експертів (у MAGI-2 — 6 з 256 на кожному з 12 голов), що дозволяє зберігати велику кількість спеціалізованих параметрів без повного обчислення всіх ваг на кожному кроці.
Для кого це і за яких умов
- •Мінімальне обладнання: 8× NVIDIA Hopper GPU (H100/H200) з пам’яттю ≥80 ГБ кожна, загалом ≥640 ГБ VRAM для комфортного розміщення ваг та активних обчислень.
- •Бюджет: Орієнтовна вартість оренди такого кластера в хмарі — від $5/год за GPU, тобто мінімум ~$40/год лише за GPU, без урахування зберігання та ліцензій. Для постійного використання потрібен бюджет від $200k/рік.
- •Команда: Потребуються інженер ML/DevOps для налаштування інференсу, оптимізації batch розміру та моніторингу стабільності.
- •Масштаб: Рекомендовано для компаній з 200+ співробітників або спеціалізованих медіа-підрозділів, які регулярно потребують генерації коротких відеокліпів (до 10 секунд).
- •Час на впровадження: При наявності готового GPU-кластера — 1-2 тижні на інтеграцію API та тестування якості; без готової інфраструктури — додатково 1-2 місяці на закупівлю або налаштування хмарних ресурсів.
Альтернативи
| Показник | MAGI-2 Preview | MiniMax H3 | LTX-2.3 Fast |
|---|---|---|---|
| Ціна | $0.074 за 10 сек 1080p (теоретично) | дані не розкриті | дані не розкриті |
| Де працює | Hugging Face, Sand.ai API | дані не розкриті | дані не розкриті |
| Мін. вимоги | 8× H100/H200, 307 ГБ ваг | дані не розкриті | дані не розкриті |
| Ключова різниця | Уніфікована аудіо‑відео MoE 114B | Найвищий бал у лідерборді (1192) | Найшвидша генерація (958) |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live