ПозитивнаImpact 6/10🧪 Beta🏢 Від 50 людей🏭 Виробництво і Промисловість📺 Медіа і Контент

Prism ML випустила тернарну версію Qwen3.8-27B

Machinelearning1 день тому0 переглядів

Prism ML, стартап з Калтеху, випустила тернарно-квантовану версію Qwen3.8-27B. Модель займає 5,9 ГБ замість 54 ГБ у FP16 та зберігає 98,2% продуктивності.

ВердиктПозитивнаImpact 6/10

🔬 Цікаво, але не для вас. Це експериментальний реліз без готового продукту — компанія на 10-50 людей не зможе впровадити через потребу спеціального форку llama.cpp та ручної збірки. Для дослідників — варто стежити.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Тернарне квантування: ваги лише -1, 0, +1 з окремого множника на групу
  • Розмір: 5,95 ГБ (GGUF PTQ1_0) замість 54 ГБ у FP16
  • Контекст: 262 000 токенів
  • Зірка: окрема модель 0,6 ГБ, завантажується лише при зображенні на вході
  • Ліцензія: Apache 2.0

Як це змінить ваш ринок?

Банки та юридичні фірми зможуть запускати складні моделі документообігу локально, не передаючи чуткі дані в хмару — це знімає головний блокер у регульованих галузях, де передача даних заборонена або обмежена.

Для кого це і за яких умов

GGUF PTQ1_0: потребує GPU з 8 ГБ пам’яті (наприклад, RTX 3060) або CPU з 16 ГБ RAM, без IT-команди, 1-2 години на збірку з форком llama.cpp. Для постійного використання потрібен спеціаліст, який підтримуватиме власний форк.

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
Bonsai 2 27B (GGUF)безкоштовно (Apache 2.0)Локально, через llama.cpp форкGPU 8 ГБ або CPU 16 ГБ RAMТернарне квантування: 1,75 біта/вагу
Qwen3.8-27B UD-Q4_K_XLбезкоштовноllama.cpp, vLLM, TGIGPU 16 ГБ4-бітне квантування: вища точність, 2× більший розмір
Qwen3.8-27B IQ2_XXSбезкоштовноllama.cppGPU 4 ГБ2-бітне квантування: нижча точність, але менший розмір nizhchi
GPT-4o (API)$2.50 за 1M токенівХмара (OpenAI)Інтернет, обліковий записПроприєтарна, найвища загальна точність, без локального запуску

💬 Часті запитання

Ні, модель працює повністю локально. Зірка та інструменти завантажуються лише при потребі, тому для чистих текстових задач хмара не задіюється.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
ternaryquantizationQwen3.8-27BPrismMLBonsai2localLLMGGUFApache2.0

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live