Фейбл 5.1 добре, але ви бачили, що випустив стартап Фей-Фей Лі?
Стартап Фей-Фей Лі World Labs представив Atlas – мультимодальну world model, яка генерує зображення та відео з піксельним контролем камери та відновлює 3D-сцени у форматі point cloud та 3D Gaussian splats. Це дозволяє симулювати рух роботів та навчати їх у віртуальному середовищі, відкриваючи нові можливості для робототехнічного та медіа-сектора.
🔬 Atlas захоплює. Якість 3D‑реконструкції на рівні лідерів — для робототехнічних команд та медіа-студій, що потребують точного симулювання.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Модель Atlas генерує відео до 1 хвилини у роздільності 1440p з піксельним контролем руху камери.
- •Вона відновлює 3D‑сцени у форматі point cloud та 3D Gaussian splats, що дозволяє отримати точну геометрію та вигляд об’єктів.
- •Навчена на space‑time симуляції, Atlas може створювати RGB та глибину з точки зору бортових камер робота для реально‑симуляційно‑реального навчання.
- •Архітектура – мультимодальний дифузійний трансформер, що поєднує авторегресію LLM та дифузійні відеомоделі з явним 3D‑контекстом.
- •На момент публікації модель доступна лише через блог World Labs; публічного API або комерсійного тарифу ще не оголошено.
Як це змінить ваш ринок?
Поява Atlas сигналізує про зближення генеративного відео та точної 3D‑реконструкції, що може змінити підходи до створення віртуального контенту та навчання автономних систем. У виробництві це дозволяє скоротити витрати на фізичні прототипи, переносивши тестування рухів та взаємодії з об’єктами у симуляційне середовище. У медіа‑секторі модель відкриває можливість створювати відео з динамічною камерою без потребі в дорогому захопленніMotion Capture, оскільки рух камери кодується прямо у вихідному сигналі. Проте широке впровадження потребує доступності до обчислювальних ресурсів рівня GPU‑кластера та інтеграції з существуючими пайплайнами, що робить технологію актуальною в першу чергу для середніх та великих підприємств з внутрішніми R&D‑відділами.
Визначення: World model — це тип генеративної моделі, яка передбачає не лише зображення, а й повну просторово‑часову сцену, включаючи геометрію, освітлення та можливі траєкторії руху об’єктів у часі.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження)
- •Atlas (доступний через блог World Labs): потрібен GPU‑кластер з принаймні 2× NVIDIA H100 або еквівалент, бюджет на обчислення від $2 000/міс, команда з 2‑3 інженерів з досвідом у глибокому навчанні та 3D‑графіці, час на інтеграцію – від 2 до 4 тижнів.
- •Для менших команд: без власного кластеру модель практически недоступна через відсутність публічного API та високі вимоги до пам’яті.
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Runway Gen-2 | $0.015/секунда відео | Хмарний SaaS | Інтернет‑з’єднання, браузер | Генерація коротких кліпів без 3D‑виходу, фокус на стилізацію |
| OpenAI Sora (предвариний доступ) | Ціна не розкрита | Хмарний API | Доступ до списку очікування | Довге відео до 1 хвилини, але без явного 3D‑реконструйованого виходу |
| Stable Video Diffusion | Відкрито ваги, безкоштовно | Локальний запуск | GPU 24GB+, навички у запуску дифузійних моделей | Генерація відео, але без контролю камери та точного 3D‑виходу |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Data Secrets — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live