Навчання 3,8B LLM до 0,384 CORE за $998 – Hugo Vergnes
Розробник навчив 3,8B параметрів LLM до результату 0,384 CORE за $998, використовуючи 8× B200 GPU, 65B токенів та FP8 точність. Він поділився деталями інфраструктури, оптимізатора Muon та трапециевих графіків швидкості навчання.
🔬 Цікаво для досліджень, але не продукт. Демонструє, що тренування великих моделей стає доступнішим — для тих, хто експериментує з власним ШІ та має доступ до GPU.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Навчено 3,8B LLM за $998 на 8× B200 GPU
- •Достигнуто 0,384 CORE за 65B токенів та FP8
- •Використано оптимізатор Muon та трапециевий LR графік
- •Код та деталі доступні на hugovergnes.github.io/little-lm-3-8b/
- •Ваги моделі не публікуються — лише методика
Як це змінить ваш ринок?
Для дослідників та стартапів це сигнал: тренування LLM стає дешевшим завдяки оптимізації, а не лише масштабуванню GPU. Це може зменшити залежність від хмарних API для прототипів та внутрішніх інструментів у компаніях з технічною здатністю.
Визначення: CORE benchmark — синтетичний тест, що вимірює здатність моделі розуміти та генерувати код на базі розв’язку алгоритмічних задач.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
- •Потрібний досвід з PyTorch, оптимізаторів та GPU-програмування
- •Для повного відтворення: 8× B200 GPU (~$80/год в хмарі), 65B токенів даних, 10+ годин навчання
- •Без IT-команди — нереально; потрібен інженер ШІ або ML
- •Час на впровадження методу: 1-2 тижні для адаптації коду під свої дані
Альтернативи (ТАБЛИЦЯ: | | Продукт 1 | Продукт 2 | Продукт 3 |
| Ціна | $998 (одноразово) | $0.0006/1K токенів (GPT-4o mini) | $0.15/1M токенів (Llama 3 8B API) | | Де працює | Власний код, локально | Хмарний API (OpenAI) | Хмарний API (Together AI, Replicate) | | Мін. вимоги | 8× B200 GPU, ШІ-інженер | Інтернет, API-ключ | Інтернет, API-ключ | | Ключова різниця | Повний контроль, без виплат за токени | Простота, готові ваги | Нижча вартість за токен, опенсорс ваги |
💬 Часті запитання
🔒 Підтекст (Insider)
Це не про готове рішення, а про зниження бар’єра входження в тренування LLM. Показує, що оптимізація (FP8, Muon) може зменшити витрати на порядок — сигнал для інвесторів у ШІ-інфраструктурі.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Shir-man Trending — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live