Qwen3.8-Whittle-16B: стиснена модель 16,8B параметрів досягла 36/39 успіху у завданнях
Створено стиснену модель Qwen3.8-Whittle-16B на основі Qwen3.8-27B через приплюснування та QLoRA-лікування. Вона досягає 36 з 39 успішних завдань і 20 токенів на секунду на GPU з 8 ГБ пам’яті, але потребує спеціальних параметрів запуску для уникнення циклів повторень.
🔬 Цікаво для експериментів. Стиснення дає доступ до 16B-класу на середніх GPU — для тих, хто тестує локальні LLM у межах бюджету на обчислення.
Що це означає для вас
Запустіть модель з параметрами, зазначеними у статті, щоб перевірити чи уникаєте ви циклів повторень у вашому кейсі
🕐 Скачайте модель з huggingface.co/logic65/Qwen3.8-Whittle-16B та запустіть її з флагом, що забороняє повторення (наприклад, --no-repeat-ngram 2)
📊 З новини: 20 t/s on 8GB GPUs🛠 Інструмент: Qwen3.8-Whittle-16B
Пропустіть, якщо: якщо ваша команда не має досвіду з налаштуванням LLM serving або ви використовуєте готові API замість самохостингу
Перевірте, чи витрачаєте ви надто на API, коли локальна модель на середньому GPU може дати схожі результати за правильного налаштування
Отримати карту AI-можливостей →🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Модель Qwen3.8-Whittle-16B має 16,8 млрд параметрів
- •Отримана шляхом приплюснування Qwen3.8-27B та одного QLoRA-лікування
- •Досягає 36/39 успіху у завданнях та 20 токенів на секунду на GPU з 8 ГБ
- •Потребує спеціальних параметрів serving для уникнення циклів повторень
- •Доступна на Hugging Face за посиланням huggingface.co/logic65/Qwen3.8-Whittle-16B
Як це змінить ваш ринок?
Для виробничих компаній, які хочуть впроваджувати AI у внутрішні процеси без залежності від зовнішніх API, ця модель демонструє шлях до економії: стиснення дозволяє запускати великі моделі на доступному обладнанні. Це зменшує бар’єр входження для середнього бізнесу у сферу локального AI, особливо там, де конфіденційність даних є критичною.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
- •16B модель: GPU з 8 ГБ пам’яті (наприклад, RTX 4060 або аналог), без потреби в IT-команді для базового запуску, 30 хв на налаштування
- •Для стабільного використання в продакшені: потрібен інженер з досвідом оптимізації LLM serving, можливо додаткові витрати на тестування параметрів
- •Масштаб: актуально для команд від 50 людей, які мають внутрішні AI-ініціативи або тестують моделі для специфічних завдань
Альтернативи (ТАБЛИЦЯ: | | Продукт 1 | Продукт 2 | Продукт 3 |
| Ціна | безкоштовно (опенсорс) | $0,0006/1K токенів (API аналог) | $0,0003/1K токенів (конкурент) | | Де працює | локально на GPU з 8 ГБ+ | хмарний API | хмарний API | | Мін. вимоги | GPU 8 ГБ, навички налаштування LLM | інтернет-з’єднання, API-ключ | інтернет-з’єднання, API-ключ | | Ключова різниця | повна контроль над даними, без постійних витрат | простота використання, підтримка | нижча вартість при високих об’ємах |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live