Qwen3.6-35B-A3B-Escha-W2
Escha-W2 — це 2-бітово квантована 35B MoE модель розміром 12,3 ГБ, призначена для локального запуску через OpenAI-сумісний API на GPU 16-24 ГБ. Це дозволяє компаніям з обмеженими ресурсами запускати великі моделі локально, знижуючи залежність від хмарних API та витрати на інференс.
🚀 Швидкий локальний запуск 35B MoE моделі. Якість близка до повноцінної, а розмір 12,3 ГБ дозволяє розмістити на одному GPU 24 ГБ — для компаній, які потребують конфіденційності і мають доступ до такого обладнання.
Ключові тези
- 2-бітове квантування зменшує розмір моделі до 12,3 ГБ
- Призначена для локального запуску на GPU 16-24 ГБ через OpenAI-сумісний API
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секунд🔒 Підтекст (Insider)
Огляд показує, що EschaLabs розробила цю модель як відповідь на попит щодо запуску великих LLM на доступному обладнанні. Використання 2-бітової квантації та MoE архітектури дозволяє значно зменшити вимоги до пам’яті без катастрофічного втрати якості для багатьох задач. Це сигналізує про зростаючу тенденцію децентралізації AI-інференсу, що може зменшити domínio хмарних провайдерів.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Shir-man Trending — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live