ПозитивнаImpact 5/10🚀 Early Adoption👤 Для всіх📺 Медіа і Контент

Трюк Карпати спрацював: локальна LLM на Mac M5 видає 117 токенів за секунду

INCUBE.AI | Нейросети и не только•близько 2 годин тому•0 переглядів•

Трюк Карпати дозволив open-source движку Uzu від Mirai обмежити пропускну здатність пам’яті на Apple M5 та прискорити Qwen3.5 9B з 22 до 117 токенів за секунду. Це сталося завдяки квантизації, спекулятивному декоду та Weaver.

ВердиктПозитивнаImpact 5/10

🚀 Локальний запуск LLM став практичнішим. Швидкість 117 токенів/сек робить реальним використання моделей типу Qwen3.5 9B на Mac M5 для розробників та малих команд, кому потрібна приватність і низка затримки.

Що це означає для вас

IT-команді

Запустіть тестовий запит до Qwen3.5 9B через Uzu на Mac M5, щоб перевірку швидкості генерації тексту

🕐 Скачайте Uzu з uproger.com та запустіть один запит з промптом «Привіт, як справи?» (10 хв)

📊 З новини: 117 токенів в секунду

🛠 Інструмент: Uzu

Пропустіть, якщо: якщо у вас нема Mac з чіпом M5 або новішою серією

Перевірте, чи може ваш Mac M5 запускати LLM так же швидко, як хмарні API — це може заощадити на тарифах.

Отримати карту AI-можливостей →

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • •Движок Uzu прискорив Qwen3.5 9B на Mac M5 з 22 до 117 токенів/сек
  • •Використано квантизацію, спекулятивний декод та Weaver
  • •Бенчмарк перевершив llama.cpp та MLX на тих самих моделях
  • •Локальний запуск усуває потребу в передачі даних до хмарних провайдерів
  • •Техніка придатна для моделей до 9B параметрів на ARM-маках

Як це змінить ваш ринок?

Компанії у сфері фінансів та медицини, які вимагають konfіденційності даних, тепер можуть розглядати локальний запуск LLM як реальну альтернативу хмарним API. Це знімає головний блокер — ризик витоки під час передачі даних до третіх сторін.

Визначення:

Квантизація — техніка скорочення розміру нейронної мережі зменшенням точності wagів (наприклад, з FP16 до INT4), що збільшує швидкість інференсу за рахунок незначної втрати точності.

Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.

  • •Qwen3.5 9B: MacBook Pro з M5 Pro/Max, 24GB RAM, без IT-команди, 15 хв на налаштування
  • •Для більших моделей (27B+): потрібен зовнішній GPU або хмарний інстанс ~$0.3/год

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
Uzu + Qwen3.5 9BбезкоштовноMac M5+/Linux16GB RAM, ARM-чипЛокальний, безкоштовний, приватний
OpenAI API$0.15/1M токенівХмарнийІнтернет-з’єднанняПростота використання, але передача даних
llama.cppбезкоштовноКрос-платформа8GB RAMБільш зрелий, але повільніший (22 ток/сек)
MLXбезкоштовноApple SiliconmacOS 13.5+Оптимізований для Apple, але нижча швидкість

💬 Часті запитання

Так, Uzu підтримує різноманітні open-source LLM, включаючи Llama та Mistral, але швидкість може варіюватися залежно від архітектури та розміру моделі.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
LLMquantizationspeculativedecodingAppleM5UzuQwen3.5

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live