Трюк Карпати спрацював: локальна LLM на Mac M5 видає 117 токенів за секунду
Трюк Карпати дозволив open-source движку Uzu від Mirai обмежити пропускну здатність пам’яті на Apple M5 та прискорити Qwen3.5 9B з 22 до 117 токенів за секунду. Це сталося завдяки квантизації, спекулятивному декоду та Weaver.
🚀 Локальний запуск LLM став практичнішим. Швидкість 117 токенів/сек робить реальним використання моделей типу Qwen3.5 9B на Mac M5 для розробників та малих команд, кому потрібна приватність і низка затримки.
Що це означає для вас
Запустіть тестовий запит до Qwen3.5 9B через Uzu на Mac M5, щоб перевірку швидкості генерації тексту
🕐 Скачайте Uzu з uproger.com та запустіть один запит з промптом «Привіт, як справи?» (10 хв)
📊 З новини: 117 токенів в секунду🛠 Інструмент: Uzu
Пропустіть, якщо: якщо у вас нема Mac з чіпом M5 або новішою серією
Перевірте, чи може ваш Mac M5 запускати LLM так же швидко, як хмарні API — це може заощадити на тарифах.
Отримати карту AI-можливостей →🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Движок Uzu прискорив Qwen3.5 9B на Mac M5 з 22 до 117 токенів/сек
- •Використано квантизацію, спекулятивний декод та Weaver
- •Бенчмарк перевершив llama.cpp та MLX на тих самих моделях
- •Локальний запуск усуває потребу в передачі даних до хмарних провайдерів
- •Техніка придатна для моделей до 9B параметрів на ARM-маках
Як це змінить ваш ринок?
Компанії у сфері фінансів та медицини, які вимагають konfіденційності даних, тепер можуть розглядати локальний запуск LLM як реальну альтернативу хмарним API. Це знімає головний блокер — ризик витоки під час передачі даних до третіх сторін.
Визначення:
Квантизація — техніка скорочення розміру нейронної мережі зменшенням точності wagів (наприклад, з FP16 до INT4), що збільшує швидкість інференсу за рахунок незначної втрати точності.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
- •Qwen3.5 9B: MacBook Pro з M5 Pro/Max, 24GB RAM, без IT-команди, 15 хв на налаштування
- •Для більших моделей (27B+): потрібен зовнішній GPU або хмарний інстанс ~$0.3/год
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| Uzu + Qwen3.5 9B | безкоштовно | Mac M5+/Linux | 16GB RAM, ARM-чип | Локальний, безкоштовний, приватний |
| OpenAI API | $0.15/1M токенів | Хмарний | Інтернет-з’єднання | Простота використання, але передача даних |
| llama.cpp | безкоштовно | Крос-платформа | 8GB RAM | Більш зрелий, але повільніший (22 ток/сек) |
| MLX | безкоштовно | Apple Silicon | macOS 13.5+ | Оптимізований для Apple, але нижча швидкість |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live