ПозитивнаImpact 5/10🚀 Early Adoption👤 Для всіх📺 Медіа і Контент🏭 Виробництво і Промисловість

Liquid AI випустила легку та швидку зору-мовну модель LFM2.5-VL-3B

Вайб-кодингблизько 2 годин тому0 переглядів

Liquid AI випустила модель LFM2.5-VL-3B з 3 мільярдами параметрів, яка працює на Galaxy S26 Ultra зі швидкістю ~20 токенів/сек і перевершує більші моделі у задачах розуміння інтерфейсів.

ВердиктПозитивнаImpact 5/10

🚀 Швидка мобільна AI. Якість порівняно з більшими моделями, але працює на смартфоні — для компаній, які потребують реального часу обробки зображень на пристрої.

Що це означає для вас

Власнику / керівнику

Оцініть можливість заміни хмарних API на LFM2.5-VL-3B для обробки екранів у реальному часі, щоб зменшити витрати та затримки.

🕐 Запустіть модель на одному тестовому знімку екрану через Hugging Face Inference API і виміряйте час відповіді (10 хв)

📊 З новини: 20 токенів/сек

🛠 Інструмент: LFM2.5-VL-3B

Пропустіть, якщо: якщо ваша продукція не потребує обробки зображень екрану

Маркетингу

Використайте LFM2.5-VL-3B для автоматичного створення описів продуктів зі знімків екрану у рекламних кампаніях.

🕐 Згенеруйте опис для п’яти скріншотів вашого сайту за допомогою моделі на Hugging Face і порівняйте з ручним написанием (15 хв)

📊 З новини: 3 млрд параметрів

🛠 Інструмент: LFM2.5-VL-3B

Пропустіть, якщо: якщо ваш маркетинг не використовує знімки екрану

IT-команді

Внедріть LFM2.5-VL-3B на крайні пристрої для локального розпізнавання елементів інтерфейсу у тестуванні.

🕐 Завантажте ваги моделі з Hugging Face і запустіть інференс на одному зразку документа на ноутбуці (20 хв)

📊 З новини: 3 ГБ пам’яті

🛠 Інструмент: LFM2.5-VL-3B

Пропустіть, якщо: якщо у вас немає пристроїв з достатньо ОЗУ для моделі

Якщо ви хочете скоротити витрати на хмарну AI і отримати мгновенні результати на пристрої — подивіться, які завдання вашого бізнесу можна перенести на пристрій.

Отримати карту AI-можливостей →

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Розмір моделі: 3 мільярда параметрів.
  • Швидкість на Galaxy S26 Ultra: ~20 токенів/сек, на M5 Max до 228 токенів/сек.
  • Потребує приблизно 3 ГБ оперативної пам’яті для роботи.
  • Доступна на Hugging Face за посиланням https://huggingface.co/LiquidAI/LFM2.5-VL-3B (ліцензія не розкрита).
  • Результат на ScreenSpot-v2: 80,7 баллів, перевершує Gemma-4-E4B (51,2) та більші моделі у задачах розуміння інтерфейсів.

Як це змінить ваш ринок?

Виробники часто стикаються з потребою швидко аналізувати зображення з ліній виробництва або сканерів документів, щоб виявляти дефекти або несоответності. Традиційно це вимагає відправки даних у хмару, що створює затримки, збільшує витрати на передачу та викликає питання конфіденційності. LFM2.5-VL-3B дозволяє проводити такий аналіз прямо на крайньому пристрої — на терміналі або мобільному сканері — без виходу даних за межі локальної мережі, що скорочує час реакції до секунд та зменшує витрати на хмарні ресурси.

Визначення: Зору-мовна модель (Vision-Language Model, VLM) — тип штучного інтелекту, який одночасно розуміє та обробляє текстові та зображені дані, дозволяючи виконувати завдання типу опис зображень, відповіді на питання про вміст екрану або прив’язки об’єктів до координат.

Для кого це і за яких умов

Модель призначена для використання на пристроях з мінімум 3 ГБ ОЗУ, таких як сучасні смартфони (наприклад, Galaxy S26 Ultra) або ноутбуки з базовою графікою. Для тестування через Hugging Face достатньо мати доступ до інтернету і базові навички роботи з API — окрема IT‑команда не обов’язкова. Підходить для будь-якого розміру бізнесу, включаючи одиночних підприємців та маленькі команди, тому що розгортання може займати менше години. Час на повне впровадження в продакшн — від кількох днів до тижня, залежно від інтеграції з існуючими системами.

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
LFM2.5-VL-3Bдані не розкритіHugging Face, локально3 ГБ ОЗУ, ARM/x86 CPUНайвища швидкість на мобільних пристроях, кращий результат у ScreenSpot-v2
Gemma-4-E4Bдані не розкритіHugging Face, локально2 ГБ ОЗУМенший розмір, але нижча точність у задачах розуміння інтерфейсів
Phi-3-visionдані не розкритіHugging Face, локально2,5 ГБ ОЗУДобрий баланс розміру та швидкості, проте нижче у ScreenSpot-v2
MiniCPM-Vдані не розкритіHugging Face, локально3 ГБ ОЗУПідтримка багатьох мов, але спеціалізовано на ОКР, а не на UI

💬 Часті запитання

Ні, модель оптимізована для роботи на CPU та нейропроцесорах сучасних смартфонів. Зазначені швидкості (20–228 токенів/сек) вимірювалися на ARM‑процесорах без дискретної GPU. Для ще кращої продуктивності можна використовувати пристрої з нейропроцесором, але це не обов’язково.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
LiquidAILFM2.5-VL-3Bvision-languagemodel3Bparameterson-deviceAI

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live