Deltafin запускає 2,8T Kimi K3 MoE на одному Apple Silicon Mac
Deltafin дозволяє запускати масивну модель Kimi K3 MoE з 2,8 трильйонами параметрів на одному Mac з Apple Silicon за допомогою потокової передачі експертних ваг. Швидкість сягає близько 1 токена за хвилину на M1 Max з 64 ГБ ОЗУ.
🔬 Цікавий експеримент, але не для бізнесу. 1 токен за хвилину робить це непридатним для реальних задач — це демонстрація архітектури потокової передачі ваг, а не інструмент для продакшену. Для компаній 10-50 людей: забити, поки швидкість не зросте в 1000 разів.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Deltafin — це GitHub-репозиторій (github.com/gavamedia/deltafin), що запускає 2,8T Kimi K3 MoE на одному Mac
- •Швидкість інференсу: ~1 токен за хвилину на M1 Max з 64 ГБ ОЗУ
- •Використовує потокову передачу експертних ваг (weight streaming) для обходу обмежень пам'яті
- •Модель Kimi K3 — китайська MoE-архітектура, ліцензія не уточнена в репозиторії
- •Це дослідницький прототип, не готовий до продакшену інструмент
Як це змінить ваш ринок?
Для медіа-компаній та контент-агенцій: локальний запуск гігантських моделей стає технічно можливим, але поточна швидкість робить це непридатним для комерційного контенту. Коли (і якщо) оптимізації прискорити інференс у 1000+ разів, зникне залежність від хмарних API та їхніх цін/лімітів. Поки що — лише напрямок досліджень.
Визначення: Weight streaming (потокова передача ваг) — техніка, при якій лише активні експертні підмережі MoE-моделі завантажуються в пам'ять GPU/CPU по черзі, дозволяючи запускати моделі, більші за доступну VRAM/RAM.
Для кого це і за яких умов
- •Мінімальне обладнання: Mac з Apple Silicon (M1/M2/M3 Max/Ultra) з 64+ ГБ уніфікованої пам'яті
- •Команда: Потрібен ML-інженер для налаштування, компіляції та відлагодження; нетехнічна команда не зможе це впровадити
- •Масштаб: Тільки для R&D відділів або ентузіастів; нульового бізнес-сенсу для SMB
- •Час на впровадження: Дні-тижні на налаштування середовища, завантаження ваг (сотні ГБ), вирішення залежностей
- •Вердикт: Не для бізнесу. Це «запустив для цікавості», а не «використовую в роботі».
Альтернативи
| llama.cpp / ollama | vLLM / TGI | Deltafin (цей проєкт) | |
|---|---|---|---|
| Ціна | Безкоштовно (open source) | Безкоштовно (open source) | Безкоштовно (open source) |
| Де працює | CPU/GPU (Apple Silicon, NVIDIA, AMD) | GPU (NVIDIA, AMD), 일부 CPU | Тільки Apple Silicon (поки що) |
| Мін. вимоги | 8-16 ГБ RAM для 7B; 32+ ГБ для 70B | 24+ ГБ VRAM для 7B; 80+ ГБ для 70B | 64 ГБ RAM для 2,8T (дуже повільно) |
| Ключова різниця | Зрілий, швидкий, підтримує куантизацію | Production-ready serving, батчинг, PagedAttention | Унікальна здатність запускати 2,8T на споживачеві, але 1 токен/хв |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Shir-man Trending — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live