Порт моделі глибини Depth Anything 3 на чистий C++

Нейронавт | Нейросети в творчествеблизько 2 годин тому0 переглядів

Порт моделі глибини Depth Anything 3 від ByteDance реалізований на чистому C++ без Python та PyTorch, працює на CPU та є в 1,3 рази швидший. Це дозволяє отримувати метричні карти глибини, параметри камери та 3D-хмари точок без залежності від важких фреймворків, що спрощує інтеграцію в продукти.

ВердиктПозитивнаImpact 5/10

🔬 Експериментальний інструмент. Для технічних команд, що потребують швидкої CPU-обробки глибини без залежності від GPU.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Реалізовано на чистому C++ без зовнішніх залежностей (Python, PyTorch)
  • Швидкість обробки на CPU збільшена в 1,3 рази относительно оригінальної реалізації
  • Видає метричну глибину в метрах та карту впевненості для кожного пікселя
  • Надає внутрішні та зовнішні параметри камери, а також 3D-хмару точок у форматах GLB, COLMAP, PLY
  • Підтримує багатовидову глибину та оцінку позиції камери для реконструкції сцени з кількох зображень

Як це змінить ваш ринок?

Використання Depth Anything 3 у C++ дозволяє виробникам та інтеграторам систем машинного зору уникати дорогих GPU та складних фреймворків, таких як PyTorch. Це знижує вартості впровадження рішень для контролю якості на конвеєрах та робототехніки, переносити обчислення на доступні CPU-платформи та скорочувати час до ринку. Тепер даже маленькі мастерські можуть впроваджувати точне 3D-сканування без потребі в спеціалізованих акселераторах.

Визначення: Depth Anything 3 — це монокулярна модель оцінки глибини від ByteDance, яка виводить метричну глибину, карту впевненості та внутрішні/зовнішні параметри камери з одного зображення.

Для кого це і за яких умов

Потребує комп'ютера з x86-64 CPU, принаймні 4 GB ОЗУ та дискового простору для коду. GPU не обов’язковий — модель працює виключно на CPU. Для впровадження достатньо одного інженера з досвідом роботи з C++ та CMake; типові терміни — 1–2 дні на інтеграцію та базові тести. Розмір бізнесу не критичний: рішення корисне як для стартапів, так і для середніх виробничих компаній, які хочуть зменшити затрати на обладнання та енергоспоживання.

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
MiDaS (PyTorch)безкоштовноGPU/CPUPyTorch ≥1.8, Python 3.8+Вимагає середовище Python, менш ефективне на CPU без GPU
Intel RealSense SDKбезкоштовно (для камер Intel)Windows/LinuxIntel RealSense камера, SDK 2.0+Апаратне залежне, працює тільки з власними датчиками глибини
OpenCV DNN (MiDaS у OpenCV)безкоштовноGPU/CPUOpenCV ≥4.5, модель у форматі ONNX/TensorFlowПростіше інтегрувати в OpenCV-потоки, але нижча точність порівняно з оригіналом
Custom C++ inference via ONNX Runtimeзалежить від ліцензії моделіGPU/CPUONNX Runtime ≥1.15, C++17Позволяє використовувати вже навчені моделі без PyTorch, потребує конвертації у ONNX

💬 Часті запитання

Так, код поширюється під ліцензією Apache 2.0, що дозволяє безкоштовно використовувати, змінювати та поширювати у proprietaries продуктах.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
depthestimationDepthAnything3C++CPU3Dreconstruction

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live