Автор протестував трансформер з 28 млн параметрів на RTX 5090 за 1,5 години та отримує 44% на ARC-AGI-1
Автор протестував трансформер з 28 млн параметрів на RTX 5090 за 1,5 години та отримує 44% на тесті ARC-AGI-1. Це показує, що навіть компактні моделі можна швидко оцінювати на доступному обладнанні, що важливо для експериментів з ШІ у маленьких командах.
🔬 Цікаво експеримент. Для дослідників ШІ, що хочуть швидко оцінювати малі моделі на доступному GPU.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Розмір моделі: 28 млн параметрів
- •Час навчання: 1,5 години на GPU RTX 5090
- •Результат на ARC-AGI-1: 44% точність
- •Код доступний на GitHub у репозиторії mdlARC
- •Архітектура та гіперпараметри не розкриті у публікації
Як це змінить ваш ринок?
Для компаній, що займаються дослідницькою розробкою ШІ, це показує, що доступне геймерське обладнання може забезпечувати швидке прототипування малих трансформерів. Це зменшує фінансовий бар'єр для експериментів з новими архітектурами без потреби у дорогостоячих хмарних ресурсах. Проте через низький результат на ARC-AGI-1 практичне застосування таких моделей залишається обмеженим.
Визначення: ARC-AGI-1 — бенчмарк, що вимірює абстрактне розуміння та узагальнення за допомогою візуальних пазлів, вважається одним із найскладніших тестів для сучасних ШІ-моделей.
Для кого це і за яких умов
- •Мінімальне обладнання: GPU з принаймні 24 ГБ VRAM (наприклад, RTX 5090 або аналог)
- •Бюджет: нуль, якщо використовується власне обладнання; хмарний еквівалент ~$0,30/години
- •Команда: один дослідник з базовими навичками PyTorch
- •**Час на впровадження:**约 2 години (завантаження коду, запуск скрипту, отримання результату)
- •Мінімальний масштаб: актуально для індивідуальних дослідників або маленьких команд до 10 людей
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| TinyLlama 1.1B | безкоштовно | локально, Hugging Face | GPU 8 ГБ RAM | більша модель, кращий результат на мовних задачах |
| Phi-2 (2.7B) | безкоштовно | локально, Azure | GPU 12 ГБ RAM | кращий баланс розміру та продуктивності |
| GPT-NeoX-20B | безкоштовно (з обмеженнями) | локально, хмара | GPU 48 ГБ RAM | значно більша модель, станарт для досліджень |
| Наш трансформер 28M | безкоштовно | локально (GitHub) | GPU 24 ГБ RAM | найменший розмір, найшвидший час навчання |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live