НейтральнаImpact 3/10🔬 Research🎓 Освіта

Автор протестував трансформер з 28 млн параметрів на RTX 5090 за 1,5 години та отримує 44% на ARC-AGI-1

INCUBE.AI | Нейросети и не толькоблизько 1 години тому0 переглядів

Автор протестував трансформер з 28 млн параметрів на RTX 5090 за 1,5 години та отримує 44% на тесті ARC-AGI-1. Це показує, що навіть компактні моделі можна швидко оцінювати на доступному обладнанні, що важливо для експериментів з ШІ у маленьких командах.

ВердиктНейтральнаImpact 3/10

🔬 Цікаво експеримент. Для дослідників ШІ, що хочуть швидко оцінювати малі моделі на доступному GPU.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Розмір моделі: 28 млн параметрів
  • Час навчання: 1,5 години на GPU RTX 5090
  • Результат на ARC-AGI-1: 44% точність
  • Код доступний на GitHub у репозиторії mdlARC
  • Архітектура та гіперпараметри не розкриті у публікації

Як це змінить ваш ринок?

Для компаній, що займаються дослідницькою розробкою ШІ, це показує, що доступне геймерське обладнання може забезпечувати швидке прототипування малих трансформерів. Це зменшує фінансовий бар'єр для експериментів з новими архітектурами без потреби у дорогостоячих хмарних ресурсах. Проте через низький результат на ARC-AGI-1 практичне застосування таких моделей залишається обмеженим.

Визначення: ARC-AGI-1 — бенчмарк, що вимірює абстрактне розуміння та узагальнення за допомогою візуальних пазлів, вважається одним із найскладніших тестів для сучасних ШІ-моделей.

Для кого це і за яких умов

  • Мінімальне обладнання: GPU з принаймні 24 ГБ VRAM (наприклад, RTX 5090 або аналог)
  • Бюджет: нуль, якщо використовується власне обладнання; хмарний еквівалент ~$0,30/години
  • Команда: один дослідник з базовими навичками PyTorch
  • **Час на впровадження:**约 2 години (завантаження коду, запуск скрипту, отримання результату)
  • Мінімальний масштаб: актуально для індивідуальних дослідників або маленьких команд до 10 людей

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
TinyLlama 1.1Bбезкоштовнолокально, Hugging FaceGPU 8 ГБ RAMбільша модель, кращий результат на мовних задачах
Phi-2 (2.7B)безкоштовнолокально, AzureGPU 12 ГБ RAMкращий баланс розміру та продуктивності
GPT-NeoX-20Bбезкоштовно (з обмеженнями)локально, хмараGPU 48 ГБ RAMзначно більша модель, станарт для досліджень
Наш трансформер 28Mбезкоштовнолокально (GitHub)GPU 24 ГБ RAMнайменший розмір, найшвидший час навчання

💬 Часті запитання

Автор запустив навчання трансформера на власному наборі даних, пов’язаному з ARC-AGI-1, протягом 1,5 години на RTX 5090, потім вимірював точність на тестовій підбірці. Точні деталі передобробки та функції втрати не наведені.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
transformer28MparametersRTX5090ARC-AGI-1benchmark

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live