Qwen3.8-Flash: мультимодальна MoE-модель з 125B параметрів
Qwen анонсує Qwen3.8-Flash — мультимодальну MoE-модель з 125B параметрів, що активується лише за 6B на токен, з контекстом до 262K.
ВердиктНейтральнаImpact 6/10
🚀 Продакшен-ready для масштабних AI-застосувань з високими вимогами до контексту та ціни.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундДетальний розбір ↓
TL;DR
- •125B параметрів, 51B N-gram embeddings
- •активуються лише 6B параметрів на токен
- •контекст до 262K, розширення до 1M через YaRN
- •нова архітектура: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding, Muon optimizer
- •ціна: $0.16 / 1M входних токенів, $0.47 / 1M вихідних токенів
Як це змінить ваш ринок?
Банки та фінансові компанії можуть аналізувати великі обсяги документів без передачі даних третім сторонам, що вирішує проблему довіри та відповідальності.
Визначення: MoE — модель, яка розподіляє обчислювальні ресурси між окремими експертами для різних типів даних.
Для кого це і за яких умов
- •7B: MacBook 16GB, без IT-команди, 15 хв.
- •27B: GPU $2,000+ або хмара ~$0.5/год, IT-спеціаліст, 1-2 дні.
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Qwen3.8-Flash | $0.16 / 1M токенів | Хмарні платформи | 8GB RAM | Найнижча ціна за токен у сегменті |
| Claude 3.5 | $15 / 1M токенів | API | 16GB RAM | Висока якість, але дорожча |
| GPT-4 Turbo | $20 / 1M токенів | API | 16GB RAM | Найвища ціна, але з найкращим API |
💬 Часті запитання
Так, 7B-версія працює на ноутбуці з 16GB RAM.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Machinelearning — оригіналQwen3.8-FlashMoEмультимодальнамодельN-gramembeddings262Kконтекст
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live