SGLang навчив чат-моделі відповідати ймовірностями
SGLang додав ендпоінти /v1/decisions та /v1/systemone, які перетворюють чат-моделі на моделі прийняття рішень. Тепер модель може вибирати з 2–26 варіантів, оцінювати за шкалою та відповідати «так/ні» з ймовірностями.
🔬 Цікаво для експериментів. API нестабільне, логіти доступні лише в nightly-сборках — зачекайте 2-3 місяці перед спробою в продакшені.
Що це означає для вас
Запустіть тестовий запит до /v1/decisions з Qwen3.8-27B через nightly-сборку SGLang
🕐 Клонуйте репозиторій SGLang, переключтеся на гілку main та запустіть nightly-сборку з Qwen3.8-27B (20 хв)
📊 З новини: <100 мс на рішення🛠 Інструмент: SGLang
Пропустіть, якщо: якщо у вас немає досвіду з локальним запуском LLM — спочатку освойте Ollama або vLLM
Перевірте, чи може ваш бот відповідати швидше за 100 мс на прості запити — це може зекономити час у автоматизації.
Отримати карту AI-можливостей →🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •SGLang додав ендпоінти /v1/decisions та /v1/systemone для прийняття рішень LLM
- •Використовує однотокенові мітки та softmax на логітах для ймовірностей
- •Демонстрація на Qwen3.8-27B у грі Pokémon FireRed: <100 мс на рішення
- •Доступно в nightly-сборках з основної гілки репозиторію SGLang
- •Підтримує вибір з 2–26 варіантів, оцінку за шкалою 2–10 та бінарні так/ні
Як це змінить ваш ринок?
Для розробників ігрового AI або простих ботів це зменшує затримку у прийнятті рішень, що критично для реального часу. Тепер можна будувати агенти, які вибирають дії без затримок через генерацію повних текстових відповідей.
Для кого це і за яких умов
Qwen3.8-27B: MacBook 32GB+ або GPU 16GB, без IT-команди, 1-2 дні на налаштування. Для продакшену: GPU 24GB+ або хмара ~$0.3/год, IT-спеціаліст, 1 тиждень.
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| SGLang /v1/decisions | безкоштовно (опенсорс) | Локально, хмара | GPU 16GB+ | Однотокенові мітки, <100 мс на рішення |
| vLLM з кастомним логітом | безкоштовно (опенсорс) | Локально, хмара | GPU 24GB+ | Повний контроль над логітами, але складніше інтегрувати |
| OpenAI API з функційним викликом | $0.002 / 1K токенів | Хмара | Інтернет | Повний текстовий вивід, але повільніше та платний |
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Machinelearning — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live