FLEX-π: Багатопотокова модель світу та дій з обчислювальною гнучкістю
Вчені представили FLEX-π — модель світу та дій на 6B параметрів, яка одночасно передбачає дії робота, майбутні RGB-кадри, 3D-карти точек та семантичні представления. Це дозволяє роботам динамічно переключатися між швидким інференсом дій та повною генерацією світу, покращуючи точність маніпуляцій без додаткових датчиків глибини.
🔬 Перспективне дослідження. Для робототехнічних команд, які хочуть покращити точність маніпуляцій без додаткових сенсорів.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Модель FLEX-π має 6B параметрів і базується на архітектурі Mixture-of-Transformers.
- •Одновременно передбачає дії робота, майбутні RGB-кадри, 3D-карти точек (з Depth Anything 3) та семантичні ознаки DINOv3.
- •Завдяки дропауту візуальних потоків і межмодальному форсуванню один чекпоінт може переключатися між швидким інференсом дій (~60 мс) та повною генерацією світу та дій (~193 мс).
- •Використовує готові моделі Depth Anything 3 та Wan-2.2, тому не потребує спеціалізованих 3D-датчиків або додаткового навчання на 3D даних.
- •На субміліметровых та деформованих задачах двуручної манипуляції показує покращення успішності в 2–6 разів порівняно з сучасними SOTA-бейзлайнами.
Як це змінить ваш ринок?
Для виробників промислових роботів FLEX-π пропонує шлях до зменшення затрат на датчики глибини, залишаючи високий рівень точності планування дій. Це може скоротити час впровадження нових маніпуляційних навичок і зробити гнучкі автоматизовані лінії доступнішими для середніх бізнесів. Однак, оскільки модель залишається дослідним прототипом, комерційне використання потребує додаткової інженерної адаптації та валідації на реальному обладнанні.
Визначення: World-Action Model (WAM) — тип генеративної моделі, яка одночасно передбачає майбутні станы середовища (зображення, геометрія, семантика) та дії агента, дозволяючи політиці учитись на основі симульованих наслідків.
Для кого це і за яких умов
- •Мінімальне обладнання: GPU з 24 GB пам’яті (наприклад, RTX 4090) для повного запуску 6B моделі; для інференсу лише дій достатньо 12 GB.
- •Бюджет: Як дослідний прототип — безкоштовний код та ваги за ліцензією Apache 2.0; комерційне впровадження потребує витрат на інтеграцію (оцінно $15–30 тис. на інженера‑робототехника на 3 місяці).
- •Команда: Потребує інженера з досвідом у глибокому навчанні та робототехніки (1–2 спеціалістів) для тонкої налаштування та інтеграції з керуванням.
- •Масштаб бізнесу: Актуально для компаній з 50+ співробітників, які мають внутрішню R&D або працюють з кастомними роботами.
- •Час на впровадження: Від 1 до 3 місяців для адаптації коду під конкретну платформу та проведення симуляційних тестів.
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| FLEX-π (цей прототип) | дані не розкриті | Симуляція, лабораторійні стенди | GPU 24GB, PyTorch 2.+ | Гнучкий переключаємост між швидким та повним режимом без додаткових 3D-моделей |
| RT-1 (Robotics Transformer 1) | дані не розкриті | Google Robotics, внутрішні дані | TPU v4, великі датасети | Спеціалізований на дії, не передбачає 3D-геометрію або семантику |
| BC-Z (Behavior Cloning with ZeRO) | дані не розкриті | Високоточність клонування поведінки | GPU 16GB, демонстрації | Простий підхід, не передбачає прогнозування майбутнього стану середовища |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live