ПозитивнаImpact 6/10🔬 Research🏗️ Enterprise📺 Медіа і Контент🔐 Кібербезпека

Kimi K3: відкрита MoE-модель на 2,8 трлн параметрів досягає рівня закритих флагманів

gonzo-обзоры ML статейблизько 2 годин тому1 перегляд

Команда Kimi представила Kimi K3 — відкриту мультимодальну MoE-модель на 2,8 трлн параметрів з контекстом 1 млн токенів, яка в бенчмарках порівняна з комерційними флагманами. Це перша опенсорс-модель 3T-класу з агентним RL на довгому контексті, що дає альтернативу закритим API для складних задач розробки та мультимодальних пайплайнів.

ВердиктПозитивнаImpact 6/10

🔬 Не для вашого масштабу. Модель 2,8T параметрів потребує серйозного GPU-кластера — для компаній до 200 людей це лише стратегічний сигнал: опенсорс нагнал закриті флагмани.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Модель: Kimi K3, MoE, 2,8T загальних / 104B активованих параметрів, контекст 1 млн токенів
  • Архітектура: гібридне увагу (Delta + Gated MLA 3:1), 896 експертів, Block Attention Residuals
  • Навчання: багаторівневе RL з трьох доменів (загальний, агентний, кодерський), дистиляція
  • Ефективність: 2,5× приріст предобування vs Kimi K2, ваги на Hugging Face, код на GitHub
  • Ліцензія: не оголошена в публічному анонсі

Як це змінить ваш ринок?

Опенсорс досяг рівня закритих флагманів (GPT-5.6, Claude Fable 5) у бенчмарках. Це знімає головний виправдання для компаній, які платять за API лише через якість: безкоштовна альтернатива існує. Але — вона вимагає інфраструктури, якої немає у 99% українських SMB. Ринок розділиться на тих, хто будує власні кластери, і тих, хто платить за API. Середній сегмент зникне.

Визначення: MoE (Mixture of Experts) — архітектура, де лише частина параметрів (експертів) активується для кожного токена, що дає масштаб без лінійного росту обчислень.

Для кого це і за яких умов

  • Мінімум заліза: 8×H100 (80GB) для повного bf16 розгортання ~600GB VRAM; 4-bit квантування — ~150GB VRAM (4×H100 або A100 80GB)
  • Команда: потрібні ML-інженери для деплою, оптимізації інференсу, квантування та моніторингу
  • Бюджет: $200K+ за залізза або $15-30K/міс у хмарі (RunPod, Lambda, Together AI)
  • Час впровадження: 2-4 тижні на стабільний продакшн-ендпоінт з автоскейлінгом
  • Висновок: лише для ентерпрайзу з ML-командою та бюджетом на інфраструктуру. Для SMB — тільки через сервіси типу Together AI / Fireworks AI, коли вони додадуть K3.

Альтернативи

Kimi K3 (self-hosted)Together AI / Fireworks (K3 API, коли з'явиться)GPT-4o / Claude 3.5 Sonnet API
Ціна$200K+ CapEx або $15-30K/міс OpEx~$2-5/1M токенів (очікувано)$5-15/1M токенів вхід / $15-75/1M вихід
Де працюєВаш дата-центр / приватна хмараПублічна хмара провайдераПублічна хмара OpenAI / Anthropic
Мін. вимоги8×H100, ML-команда, 2-4 тижніAPI-ключ, 0 інфраструктуриAPI-ключ, 0 інфраструктури
Ключова різницяПовний контроль, дані не виходять, без лімітівБаланс контролю та зручностіНайвища якість «з коробки», vendor lock-in

💬 Часті запитання

Ні. 104B активованих параметрів у bf16 вимагають ~200GB VRAM лише для активних ваг. На одному GPU (навіть H100 80GB) не поміститься. Потрібне квантування до 4bit (~50GB) + offloading на CPU — працюватиме, але дуже повільно.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
KimiK3open-sourceLLMMoEmultimodalAI1McontextwindowMixtureofExperts

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live