НейтральнаImpact 4/10🔬 Research👤 Для всіх🏭 Виробництво і Промисловість📺 Медіа і Контент

Kimi K3 (2,8Т) працює зі швидкістю 1 токен/с на MacBook Pro через чотири SSD

Shir-man Trending12 днів тому2 перегляди

Deltafin запустила повну неприкрасну модель Kimi K3 з 2,8 трлн параметрів на Apple Silicon. Використовуючи маленькі чернеткові моделі для прискорення, система досягає 0,29 токена/секунду на ноутбуці M1 Max, валідуючи кожен токен великою моделлю.

ВердиктНейтральнаImpact 4/10

🔬 Цікаво для досліджень, але не для продакшену. Наразі це прототип, який показує, що великі моделі можна запускати на ноутбуці через оптимізацію потоку даних, але швидкість занадто низька для реальних завдань.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Модель Kimi K3 має 2,8 трлн параметрів
  • Запущена на MacBook Pro M1 Max через чотири SSD
  • Швидкість генерації: 0,29 токена/секунду
  • Використовується техніка чернеткових моделей для прискорення
  • Проєкт доступний на GitHub: github.com/argonautlabsai/deltafin

Як це змінить ваш ринок?

Для більшості компаній ця новина не змінить нічого через надто низьку швидкість. Проте вона сигналізує, що архітектурні оптимізації (наприклад, спекулятивне декодування) можуть робити великі моделі доступнішими на слабкому залізі. Це може підготувати почву для майбутніх інструментів, які збалансують розмір моделі та швидкість роботи на ноутбуках або краях.

Визначення: Чернеткова модель (draft model) — менша, швидша модель, яка генерує попередні токени, а велика модель валідує їх для забезпечення точності.

Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.

  • Для дослідників: MacBook з 16ГБ+ ОЗУ, навички роботи з LLMs, 1-2 дні на розгортання та експерименти
  • Для IT-команд у SMB: не рекомендується через низьку продуктивність; краще чекати на оптимізовані версії
  • Мін. масштаб: будь-який, але практична користь лише для досліджень або демонстрацій

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
Llama 3 8Bбезкоштовноноутбук, хмара8ГБ ОЗУ, GPU опціональноБаланс розміру та швидкості для реального використання
Phi-3-miniбезкоштовномобільні пристрої, ноутбуки4ГБ ОЗУОптимізована для низького энергоспоживання та швидкого запуску
GPT-4o$2,50 за 1M токенівхмара через APIінтернет-з’єднанняВисока якість та швидкість, потребує підключення до інтернету

💬 Часті запитання

Ні, через швидкість 0,29 токена/секунду модель непридатна для інтерактивних або продуктивних застосунків. Її варто розглядати лише як дослідження у сфері оптимізації запуску великих моделей.

🔒 Підтекст (Insider)

Це не про комерційне використання, а про демонстрацію можливостей архітектури. Автор показує, що з правильним поділом на чернеткові та валідаційні моделі можна обходити обмеження пам’яті, проте такий підхід залишається експериментальним і потребує далі оптимізації для практичного застосування.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
KimiK3LLMAppleSiliconSSDstreamingdraftmodels

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live