ПозитивнаImpact 5/10🧪 Beta🏢 Від 50 людей🏭 Виробництво і Промисловість📺 Медіа і Контент

SGLang навчив чат-моделі відповідати ймовірностями

Machinelearning•близько 3 годин тому•0 переглядів•

SGLang додав ендпоінти /v1/decisions та /v1/systemone, які перетворюють чат-моделі на моделі прийняття рішень. Тепер модель може вибирати з 2–26 варіантів, оцінювати за шкалою та відповідати «так/ні» з ймовірностями.

ВердиктПозитивнаImpact 5/10

🔬 Цікаво для експериментів. API нестабільне, логіти доступні лише в nightly-сборках — зачекайте 2-3 місяці перед спробою в продакшені.

Що це означає для вас

IT-команді

Запустіть тестовий запит до /v1/decisions з Qwen3.8-27B через nightly-сборку SGLang

🕐 Клонуйте репозиторій SGLang, переключтеся на гілку main та запустіть nightly-сборку з Qwen3.8-27B (20 хв)

📊 З новини: <100 мс на рішення

🛠 Інструмент: SGLang

Пропустіть, якщо: якщо у вас немає досвіду з локальним запуском LLM — спочатку освойте Ollama або vLLM

Перевірте, чи може ваш бот відповідати швидше за 100 мс на прості запити — це може зекономити час у автоматизації.

Отримати карту AI-можливостей →

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • •SGLang додав ендпоінти /v1/decisions та /v1/systemone для прийняття рішень LLM
  • •Використовує однотокенові мітки та softmax на логітах для ймовірностей
  • •Демонстрація на Qwen3.8-27B у грі Pokémon FireRed: <100 мс на рішення
  • •Доступно в nightly-сборках з основної гілки репозиторію SGLang
  • •Підтримує вибір з 2–26 варіантів, оцінку за шкалою 2–10 та бінарні так/ні

Як це змінить ваш ринок?

Для розробників ігрового AI або простих ботів це зменшує затримку у прийнятті рішень, що критично для реального часу. Тепер можна будувати агенти, які вибирають дії без затримок через генерацію повних текстових відповідей.


Для кого це і за яких умов

Qwen3.8-27B: MacBook 32GB+ або GPU 16GB, без IT-команди, 1-2 дні на налаштування. Для продакшену: GPU 24GB+ або хмара ~$0.3/год, IT-спеціаліст, 1 тиждень.


Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
SGLang /v1/decisionsбезкоштовно (опенсорс)Локально, хмараGPU 16GB+Однотокенові мітки, <100 мс на рішення
vLLM з кастомним логітомбезкоштовно (опенсорс)Локально, хмараGPU 24GB+Повний контроль над логітами, але складніше інтегрувати
OpenAI API з функційним викликом$0.002 / 1K токенівХмараІнтернетПовний текстовий вивід, але повільніше та платний

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
SGLangLLMdecisionmakinglogitsprobabilityscoring

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live