ПозитивнаImpact 5/10🧪 Beta🏢 Від 50 людей🏭 Виробництво і Промисловість

Jev працює через API в vLLM без дообучения

Data Secretsблизько 12 годин тому0 переглядів

Контрибьютор vLLM адаптував DiffusionGemma 26B від Google для роботи в режимі Jev через API без дообучения моделі. Тепер цей режим доступний у vLLM і працює на одній GPU з 24 ГБ пам’яті.

ВердиктПозитивнаImpact 5/10

🔬 Цікаво для експериментів. Jev у vLLM дає швидкі відповіді без дообучения — для тих, хто тестує формати запитів та потребує контролю над виходом.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Режим Jev тепер підтримується у vLLM через API
  • Робота на одному кроку денойзингу без дообучения моделі
  • Підтримка yes/no, multiple-choice та scoring питань
  • Використовує DiffusionGemma 26B від Google
  • Потребує однієї GPU з 24 ГБ пам’яті в NVFP4

Як це змінить ваш ринок?

Компанії, що використовують LLM для автоматизованих опитувань, тестування або систем підтримки рішень, тепер можуть отримувати структуровані відповіді без додаткового етапу парсингу тексту. Це зменшує ризик помилок у витокі даних та пришвидшує реакцію в реальному часі, особливо в галузях, де критична точність — наприклад, медична діагностика або фінансовий скоринг.

Визначення:

Jev — це режим роботи LLM, у якому замість генерації довільного тексту модель отримує структурований шаблон відповіді (так/ні, вибір з варіантів, числовий бал) та видає результат після одного кроку денойзингу, що дозволяє одразу отримати ймовірності можливих варіантів.

Для кого це і за яких умов

7B/12B варіанти: ноутбук з 16–24 ГБ ОЗУ, без IT-команди, 20 хв на налаштування. 26B: GPU з 24 ГБ пам’яті (наприклад, RTX 4090) або хмарний еквівалент ~$0.30/год, фахівець з основи LLM, 1–2 години на інтеграцію.

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
Jev у vLLMбезкоштовно (опенсорс)Локально, хмараGPU 24GB, vLLMСтруктуровані відповіді без парсингу
OpenAI API з функцією вибору варіантів$0.002 / 1K токенівХмараІнтернет, API-ключПотребує парсингу тексту, залежить від зовнішнього сервісу
Локальна модель з кастомним хедеромрозробкаЛокальноML-інженер, GPUПотребує дообучения та тестування, не гнучке

💬 Часті запитання

Так, для DiffusionGemma 26B потрібна хотя б одна GPU з 24 ГБ пам’яті в режимі NVFP4. Менші моделі можуть працювати на CPU, але повільно.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
vLLMDiffusionGemmaJevAPILLMinference

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live