Kimi K3 (2,8Т) працює зі швидкістю 1 токен/с на MacBook Pro через чотири SSD
Deltafin запустила повну неприкрасну модель Kimi K3 з 2,8 трлн параметрів на Apple Silicon. Використовуючи маленькі чернеткові моделі для прискорення, система досягає 0,29 токена/секунду на ноутбуці M1 Max, валідуючи кожен токен великою моделлю.
🔬 Цікаво для досліджень, але не для продакшену. Наразі це прототип, який показує, що великі моделі можна запускати на ноутбуці через оптимізацію потоку даних, але швидкість занадто низька для реальних завдань.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Модель Kimi K3 має 2,8 трлн параметрів
- •Запущена на MacBook Pro M1 Max через чотири SSD
- •Швидкість генерації: 0,29 токена/секунду
- •Використовується техніка чернеткових моделей для прискорення
- •Проєкт доступний на GitHub: github.com/argonautlabsai/deltafin
Як це змінить ваш ринок?
Для більшості компаній ця новина не змінить нічого через надто низьку швидкість. Проте вона сигналізує, що архітектурні оптимізації (наприклад, спекулятивне декодування) можуть робити великі моделі доступнішими на слабкому залізі. Це може підготувати почву для майбутніх інструментів, які збалансують розмір моделі та швидкість роботи на ноутбуках або краях.
Визначення: Чернеткова модель (draft model) — менша, швидша модель, яка генерує попередні токени, а велика модель валідує їх для забезпечення точності.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
- •Для дослідників: MacBook з 16ГБ+ ОЗУ, навички роботи з LLMs, 1-2 дні на розгортання та експерименти
- •Для IT-команд у SMB: не рекомендується через низьку продуктивність; краще чекати на оптимізовані версії
- •Мін. масштаб: будь-який, але практична користь лише для досліджень або демонстрацій
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Llama 3 8B | безкоштовно | ноутбук, хмара | 8ГБ ОЗУ, GPU опціонально | Баланс розміру та швидкості для реального використання |
| Phi-3-mini | безкоштовно | мобільні пристрої, ноутбуки | 4ГБ ОЗУ | Оптимізована для низького энергоспоживання та швидкого запуску |
| GPT-4o | $2,50 за 1M токенів | хмара через API | інтернет-з’єднання | Висока якість та швидкість, потребує підключення до інтернету |
💬 Часті запитання
🔒 Підтекст (Insider)
Це не про комерційне використання, а про демонстрацію можливостей архітектури. Автор показує, що з правильним поділом на чернеткові та валідаційні моделі можна обходити обмеження пам’яті, проте такий підхід залишається експериментальним і потребує далі оптимізації для практичного застосування.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Shir-man Trending — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live