Quesma протестувала Qwen3.8 27B від Unsloth на GPQA Diamond, IFBench та Terminal-Bench 2.1
Quesma протестувала квантовані версії Qwen3.8 27B, витративши $3000 на оренду GPU. 4-битний Q4_K_M у 17 ГБ показав ідентичні результати повному BF16 у 55 ГБ у всіх тестах, поміщаючись у RTX 4090 з контекстом 64К токенів.
🔬 Це дослідження, а не продукт. Для компаній до 200 людей практичного застосу нема: потрібна GPU-експертиза для квантування та оцінки trade-off між розміром і якістю.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Qwen3.8 27B у 4-битному Q4_K_M кванті вимагає 17 ГБ пам’яті заміть 55 ГБ у повному BF16
- •Якість квантованої моделі ідентична повній у тестах GPQA Diamond, IFBench та Terminal-Bench 2.1
- •Загальна пам’ять з контекстом 64К токенів — 24 ГБ, що дозволяє запуск на одній RTX 4090
- •2-битний UD-Q2_K_XL на 10,7 ГБ покаже незначну degradацію в агентному кодингу
- •1-битні кванти непридатні для використання: відповідають на рівні випадкового вгадування
Як це змінить ваш ринок?
Для фінансових та юридичних компаній, які вимагають локального обробки даних через регуляції, можливість запуску 27B-моделі на одній RTX 4090 зменшує залежність від хмарних API. Це знімає блокер передачі конфіденційної інформації третім сторонам, але вимагає внутрішньої GPU-експертизи для налаштування квантування.
Для кого це і за яких умов
27B Q4_K_M: RTX 4090 (24 ГБ VRAM), без IT-команди, 1-2 дні на налаштування квантування та тестування. Потрібні навички роботи з llama.cpp або Hugging Face Optimum. Для 2-битного варіанту — додаткова tolerance до помилок у кодогенерації.
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Qwen3.8 27B Q4_K_M (локально) | $0 (після придбання GPU) | RTX 4090 або аналог | 24 ГБ VRAM, навички квантування | Повний контроль над даними, без витрат на токени |
| OpenAI GPT-4.1 API | $2.50 за 1M токенів | Хмара | Інтернет-з’єднання | Простота використання, але витрати зростають зі_scale |
| Anthropic Claude 3 Sonnet API | $3.00 за 1M токенів | Хмара | Інтернет-з’єднання | Краща безпека даних, але vendor lock-in |
| Llama 3 70B Q4_K_M (локально) | $0 (після GPU) | Дві RTX 4090 або одна RTX 6000 Ada | 48 ГБ VRAM | Вища якість reasoning, але понадвіше обладнання |
🔒 Підтекст (Insider)
Quesma провела бенчмарк за власними коштами, щоб показати trade-off квантування — це не реклама продукту, а спроба зрозуміти, чи вигідно компресувати моделі для локального використання. Результати корисні для тих, хто розглядає власний інференс, але не визначають ринок.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live