Репозиторій бенчмарків LLM на 4x RTX 3090
Опубліковано репозиторій з детальними бенчмарками запуску LLM на 4х GPU RTX 3090, що охоплює 14 сімейств моделей та 3 інференс-двигуни з точними командами запуску. Це дає бізнесу конкретні дані для оцінки вартості самохостингу моделей на доступному залізі.
🔬 Корисні дані для оцінки самохостингу. Релевантно лише для команд, що планують запускати LLM на 4x RTX 3090 — для інших конфігурацій екстраполяція ризикована.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •638 рядків даних з точними параметрами запуску для кожної моделі
- •Тестовано 3 інференс-двигуни: vLLM, llama.cpp, exllamav3 (останній — експериментальний)
- •Залізо: 4x RTX 3090 (96 ГБ VRAM) — б/в карти по ~$800-1000 за штуку
- •Ліцензія репозиторію: MIT (вільне використання даних)
- •Автор: alesha-pro (особистий проєкт, не компанія)
Як це змінить ваш ринок?
Для компаній, що оцінюють самохостинг LLM, це перша відкрита база з реальними числами на доступному просумерському залізі. До цього доводилося покладатися на синтетичні бенчмарки вендорів або одиночні тести в блогах. Тепер можна розрахувати точний CAPEX (залізо) та OPEX (електроенергія, охолодження) для конкретних моделей та двигунів. Головний блокер — відсутність даних для інших конфігурацій GPU.
Визначення: Інференс-двигун (inference engine) — програмне забезпечення, яке оптимізує запуск навченої нейромережі для генерації відповідей, керує пам'яттю GPU та паралелізацією.
Для кого це і за яких умов
Мінімальне залізо: 4x RTX 3090 (96 ГБ VRAM) — б/в ринок ~$3,200-4,000 за GPU + мати/БП/охолодження ~$1,500. Потрібен інженер з досвідом Docker/CUDA (1-2 дні на розгортання). Масштаб: компанії від 10 людей з власною IT-командою. Час на впровадження тестового кластера: 2-3 дні. Для продакшену — ще +моніторинг, резервування, оновлення.
Альтернативи
| vLLM (OpenAI API-сумісний) | llama.cpp (CPU/GPU гібрид) | exllamav3 (експериментальний) | RunPod / Lambda Labs (хмара) | |
|---|---|---|---|---|
| Ціна | Безкоштовно (опенсорс) | Безкоштовно (опенсорс) | Безкоштовно (опенсорс) | ~$0.5-1.5/год за GPU |
| Де працює | Linux, NVIDIA GPU | Linux/Windows/macOS, CPU+GPU | Linux, NVIDIA GPU (Ampere+) | Будь-яке залізо через SSH |
| Мін. вимоги | 2x GPU для тензорного паралелізму | 16 ГБ RAM + GPU опціонально | 4x 3090/4090 для повної швидкості | Інтернет, карта для оплати |
| Ключова різниця | Найвища пропускна здатність, OpenAI API | Запуск на CPU, квантування на льоту | Макс. швидкість на консьюмерних GPU, нестабільний API | Без CAPEX, плата за секунду, дані в хмарі |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live