НейтральнаImpact 4/10🔬 Research👥 Від 10 людей🏭 Виробництво і Промисловість

Репозиторій бенчмарків LLM на 4x RTX 3090

Shir-man Daily Topблизько 20 годин тому0 переглядів

Опубліковано репозиторій з детальними бенчмарками запуску LLM на 4х GPU RTX 3090, що охоплює 14 сімейств моделей та 3 інференс-двигуни з точними командами запуску. Це дає бізнесу конкретні дані для оцінки вартості самохостингу моделей на доступному залізі.

ВердиктНейтральнаImpact 4/10

🔬 Корисні дані для оцінки самохостингу. Релевантно лише для команд, що планують запускати LLM на 4x RTX 3090 — для інших конфігурацій екстраполяція ризикована.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • 638 рядків даних з точними параметрами запуску для кожної моделі
  • Тестовано 3 інференс-двигуни: vLLM, llama.cpp, exllamav3 (останній — експериментальний)
  • Залізо: 4x RTX 3090 (96 ГБ VRAM) — б/в карти по ~$800-1000 за штуку
  • Ліцензія репозиторію: MIT (вільне використання даних)
  • Автор: alesha-pro (особистий проєкт, не компанія)

Як це змінить ваш ринок?

Для компаній, що оцінюють самохостинг LLM, це перша відкрита база з реальними числами на доступному просумерському залізі. До цього доводилося покладатися на синтетичні бенчмарки вендорів або одиночні тести в блогах. Тепер можна розрахувати точний CAPEX (залізо) та OPEX (електроенергія, охолодження) для конкретних моделей та двигунів. Головний блокер — відсутність даних для інших конфігурацій GPU.

Визначення: Інференс-двигун (inference engine) — програмне забезпечення, яке оптимізує запуск навченої нейромережі для генерації відповідей, керує пам'яттю GPU та паралелізацією.

Для кого це і за яких умов

Мінімальне залізо: 4x RTX 3090 (96 ГБ VRAM) — б/в ринок ~$3,200-4,000 за GPU + мати/БП/охолодження ~$1,500. Потрібен інженер з досвідом Docker/CUDA (1-2 дні на розгортання). Масштаб: компанії від 10 людей з власною IT-командою. Час на впровадження тестового кластера: 2-3 дні. Для продакшену — ще +моніторинг, резервування, оновлення.

Альтернативи

vLLM (OpenAI API-сумісний)llama.cpp (CPU/GPU гібрид)exllamav3 (експериментальний)RunPod / Lambda Labs (хмара)
ЦінаБезкоштовно (опенсорс)Безкоштовно (опенсорс)Безкоштовно (опенсорс)~$0.5-1.5/год за GPU
Де працюєLinux, NVIDIA GPULinux/Windows/macOS, CPU+GPULinux, NVIDIA GPU (Ampere+)Будь-яке залізо через SSH
Мін. вимоги2x GPU для тензорного паралелізму16 ГБ RAM + GPU опціонально4x 3090/4090 для повної швидкостіІнтернет, карта для оплати
Ключова різницяНайвища пропускна здатність, OpenAI APIЗапуск на CPU, квантування на льотуМакс. швидкість на консьюмерних GPU, нестабільний APIБез CAPEX, плата за секунду, дані в хмарі

💬 Часті запитання

Ні, бенчмарки лише для 4x3090. Пам'яті може не вистачити для тих самих моделей, продуктивність не лінійно масштабується.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
LLMbenchmarksRTX3090vLLMllama.cppexllamav3self-hostinginference

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live