ПозитивнаImpact 5/10🔬 Research📺 Медіа і Контент

Veda: розріджена увага для відео-дифузії від ByteDance, HKU та USTC

Нейронавт | Нейросети в творчестве•близько 2 годин тому•0 переглядів•

Від ByteDance, HKU та USTC представлено Veda — механізм розрідженої уваги для відео-дифузії. Він навчає предиктор вибирати лише потрібні 128-токенні тайли, зменшуючи обчислення на 90-95% при майже незатрібній втраті якості.

ВердиктПозитивнаImpact 5/10

🔬 Цікаво для дослідження, але не для продакшену. Для тих, хто експериментує з відео-генерацією та шукає способів зменшити обчислювані витрати без суттєвої втрати якості.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • •Veda — механізм розрідженої уваги для відео-дифузії
  • •Зменшує обчислення на 90-95% при майже незатрібній втраті якості
  • •Розроблено ByteDance, HKU та USTC
  • •Прискорює обробку відео 720P 241 кадр з 19,4 до 3,8 хвилин
  • •Код доступний на GitHub та Hugging Face

Як це змінить ваш ринок?

Для компаній у медіа та контент-створенні, які використовують відео-дифузійні моделі, Veda сигналізує можливість зниження витрат на інференс без потреби в жертву якості. Це особливо актуально для сервісів з високим обсягом генерації відео, де економія на обчисленнях може перетворитися на значне зниження операційних витрат.

Визначення: Розріджена увага (sparse attention) — техніка, при якій модель обчислює увагу лише для підмножини токенів, а не для всіх пар, зменшуючи складність з O(N²) до майже лінійної.

Для кого це і за яких умов

Для дослідників та інженерів, що працюють з відео-генераційними моделями: потрібна досвід роботи з PyTorch або TensorFlow, доступ до GPU для експериментів, час на інтеграцію та тестування — 1-2 тижні для базового впровадження.

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
FlashAttention-3безкоштовно (open source)GPU з підтримкою CUDACUDA 11.0+, GPU Ampere+Стандартна дensa увага, оптимізована реалізація
Vedaбезкоштовно (open source)GPU з підтримкою CUDACUDA 11.0+, GPU Ampere+Розріджена увага з адаптивним вибором тайлів для відео-дифузії
Стандартна PyTorch увагабезкоштовнобудь-яке обладнанняPyTorchУниверсальна, але неоптимізована реалізація уваги

💬 Часті запитання

Ні, Veda працює на стандартних GPU з підтримкою CUDA, як і FlashAttention-3. Основна вигода — в алгоритмі, а не в залізі.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
sparseattentionvideodiffusionByteDanceHKUUSTCVeda

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live