🚨 Moonshot AI виклала Kimi K3 на Hugging Face — 2,8 трільйона параметрів у відкритих вагах
Moonshot AI опублікувала відкриті ваги моделі Kimi K3 з 2,8 трільйона параметрів на платформі Hugging Face. Завдяки MiE-архітектурі та контексту 1 048 576 токенів модель призначена для довгострокових агентних завдань, таких як аналіз великих кодових баз та оптимізація GPU‑ядер, що може зменшити витрати на дослідження та розробку для компаній з великими обчислювальними ресурсами.
🚀 Breakthrough release. Open 2.8T MoE model empowers long-agent AI workflows for enterprises with massive GPU infrastructure.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Moonshot AI опублікувала модель Kimi K3 з 2,8 трільйона параметрів у відкритих вагах на Hugging Face.
- •Кожен токен активує лише 104 мільйона параметрів завдяки MiE‑архітектурі з 16 експертами з 896.
- •Контекст модели — 1 048 576 токенів, підтримка тексту та зображень у одному проході.
- •Заявлено про 2,5× краще масштабування порівняно з попередньою Kimi K2.
- •Модель орієнтована на довгострокові агентні завдання: робота з великими репозиторіями, терміналом, дослідження та оптимізація GPU‑ядер.
Як це змінить ваш ринок?
Відкриття ваг такої масивної моделі дозволяє компаніям з великими обчислювальними кластерами проводити дослідження без залежності від закритих API, що може зменшити витрати на інференс та підвищити контроль над даними. Особливо це важливо для галузей, де потрібна обробка великих кодових баз або симуляцій, таких як виробництво програмного забезпечення та інженерія. Проте через вимоги до апаратних ресурсів доступ залишається обмеженим для великих企業 та дослідницьких центрів.
Визначення: MiE (Mixture of Experts) — архітектура, у якій модель складається з багатьох експертних субмоделей, а для кожного токену вибирається лише частина їх, що зменшує обчислювані витрати при збереженні високої пропускної здатності.
Для кого це і за яких умов
- •Мінімальне обладнання: для запуску повної моделі потрібна GPU‑кластер з загальною пам’яттю ≥ 2,8 TB у форматі MXFP4 (приблизно 350× NVIDIA H100 80 GB) або доступ до хмарних інстансів з подібною пам’яттю.
- •Бюджет: орієнтовна вартість оренди такого кластеру — від $15 000 до $30 000 за місяць у хмарі (залежно від провайдера).
- •Команда: потрібен інженер з досвідом роботи з великими моделями та оптимізацією інференсу (наприклад, vLLM або TensorRT‑LLM).
- •Мінімальний масштаб бізнесу: компанії з понад 500 співробітників або дослідні інститути, які вже мають ML‑інфраструктуру.
- •Час на впровадження: 2–4 тижні для завантаження ваг, налаштування інференс‑сервера та проведення перших тестових запитів.
Альтернативи
| Продукт 1 | Продукт 2 | Продукт 3 | |
|---|---|---|---|
| Ціна | $0,0005 за 1 M токенів (API Llama 3 70B) | $0,003 за 1 M токенів (API Mixtral 8x22B) | безкоштовно (власна інсталяція Kimi K3) |
| Де працює | хмарний API, локально на 2×A100 40 GB | хмарний API, локально на 4×A100 40 GB | власний GPU‑кластер ≥2,8 TB RAM |
| Мін. вимоги | 24 GB GPU RAM | 48 GB GPU RAM | ≥2,8 TB GPU RAM (MXFP4) |
| Ключова різниця | менша модель, нижча точність для довгих контекстів | середній розмір, добре балансує швидкість і якість | максимальна розмірність, відкриті ваги, спеціалізованастрійка під агентні завдання |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Machinelearning — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live