Qwen3.8-Flash: мультимодальна MoE-модель з 125B параметрів
Qwen анонсує Qwen3.8-Flash — мультимодальну MoE-модель з 125B параметрів, що активується лише за 6B на токен, з контекстом до 262K.
🚀 Продакшен-ready для масштабних AI-застосувань з високими вимогами до контексту та ціни.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •125B параметрів, 51B N-gram embeddings
- •активуються лише 6B параметрів на токен
- •контекст до 262K, розширення до 1M через YaRN
- •нова архітектура: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding, Muon optimizer
- •ціна: $0.16 / 1M входних токенів, $0.47 / 1M вихідних токенів
Як це змінить ваш ринок?
Банки та фінансові компанії можуть аналізувати великі обсяги документів без передачі даних третім сторонам, що вирішує проблему довіри та відповідальності.
Визначення: MoE — модель, яка розподіляє обчислювальні ресурси між окремими експертами для різних типів даних.
Для кого це і за яких умов
- •7B: MacBook 16GB, без IT-команди, 15 хв.
- •27B: GPU $2,000+ або хмара ~$0.5/год, IT-спеціаліст, 1-2 дні.
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Qwen3.8-Flash | $0.16 / 1M токенів | Хмарні платформи | 8GB RAM | Найнижча ціна за токен у сегменті |
| Claude 3.5 | $15 / 1M токенів | API | 16GB RAM | Висока якість, але дорожча |
| GPT-4 Turbo | $20 / 1M токенів | API | 16GB RAM | Найвища ціна, але з найкращим API |
💬 Часті запитання
🔒 Підтекст (Insider)
Qwen3.8-Flash позиціонується як альтернатива платним API, що дозволяє компаніям зменшити витрати на AI-обчислення, особливо у сферах, де важлива довідка даних і великий контекст.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Machinelearning — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live