FLEX-π: Багатопотокова модель світу та дій з обчислювальною гнучкістю

gonzo-обзоры ML статейблизько 2 годин тому0 переглядів

Вчені представили FLEX-π — модель світу та дій на 6B параметрів, яка одночасно передбачає дії робота, майбутні RGB-кадри, 3D-карти точек та семантичні представления. Це дозволяє роботам динамічно переключатися між швидким інференсом дій та повною генерацією світу, покращуючи точність маніпуляцій без додаткових датчиків глибини.

ВердиктПозитивнаImpact 5/10

🔬 Перспективне дослідження. Для робототехнічних команд, які хочуть покращити точність маніпуляцій без додаткових сенсорів.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Модель FLEX-π має 6B параметрів і базується на архітектурі Mixture-of-Transformers.
  • Одновременно передбачає дії робота, майбутні RGB-кадри, 3D-карти точек (з Depth Anything 3) та семантичні ознаки DINOv3.
  • Завдяки дропауту візуальних потоків і межмодальному форсуванню один чекпоінт може переключатися між швидким інференсом дій (~60 мс) та повною генерацією світу та дій (~193 мс).
  • Використовує готові моделі Depth Anything 3 та Wan-2.2, тому не потребує спеціалізованих 3D-датчиків або додаткового навчання на 3D даних.
  • На субміліметровых та деформованих задачах двуручної манипуляції показує покращення успішності в 2–6 разів порівняно з сучасними SOTA-бейзлайнами.

Як це змінить ваш ринок?

Для виробників промислових роботів FLEX-π пропонує шлях до зменшення затрат на датчики глибини, залишаючи високий рівень точності планування дій. Це може скоротити час впровадження нових маніпуляційних навичок і зробити гнучкі автоматизовані лінії доступнішими для середніх бізнесів. Однак, оскільки модель залишається дослідним прототипом, комерційне використання потребує додаткової інженерної адаптації та валідації на реальному обладнанні.

Визначення: World-Action Model (WAM) — тип генеративної моделі, яка одночасно передбачає майбутні станы середовища (зображення, геометрія, семантика) та дії агента, дозволяючи політиці учитись на основі симульованих наслідків.

Для кого це і за яких умов

  • Мінімальне обладнання: GPU з 24 GB пам’яті (наприклад, RTX 4090) для повного запуску 6B моделі; для інференсу лише дій достатньо 12 GB.
  • Бюджет: Як дослідний прототип — безкоштовний код та ваги за ліцензією Apache 2.0; комерційне впровадження потребує витрат на інтеграцію (оцінно $15–30 тис. на інженера‑робототехника на 3 місяці).
  • Команда: Потребує інженера з досвідом у глибокому навчанні та робототехніки (1–2 спеціалістів) для тонкої налаштування та інтеграції з керуванням.
  • Масштаб бізнесу: Актуально для компаній з 50+ співробітників, які мають внутрішню R&D або працюють з кастомними роботами.
  • Час на впровадження: Від 1 до 3 місяців для адаптації коду під конкретну платформу та проведення симуляційних тестів.

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
FLEX-π (цей прототип)дані не розкритіСимуляція, лабораторійні стендиGPU 24GB, PyTorch 2.+Гнучкий переключаємост між швидким та повним режимом без додаткових 3D-моделей
RT-1 (Robotics Transformer 1)дані не розкритіGoogle Robotics, внутрішні даніTPU v4, великі датасетиСпеціалізований на дії, не передбачає 3D-геометрію або семантику
BC-Z (Behavior Cloning with ZeRO)дані не розкритіВисокоточність клонування поведінкиGPU 16GB, демонстраціїПростий підхід, не передбачає прогнозування майбутнього стану середовища

💬 Часті запитання

Ні, модель отримує 3D-карти точек зі стандартних RGB-камер за допомогою готового Depth Anything 3, тому окрім камер нічого іншого не потрібно.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
FLEX-πworld-actionmodelrobotics3Dpointmapscomputeflexibility

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live