LowOnMind-300k: модель з 296 тис. параметрів досягла 27,06 перплекситет та 833 Elo на бенчмарку BananaMind
Модель з 296 тис. параметрів, навчена на 200 млн токенів, досягла 27,06 перплекситет та 833 Elo на бенчмарку BananaMind. Доступна на Hugging Face як SLM-Archive/LowOnMind-300k.
🔬 Цікаво для досліджень, але не продукт. Архитектура занадто мала для реальних задач — для тих, хто експериментує з компактними моделями на ноутбуці.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Модель LowOnMind-300k має 296 тис. параметрів
- •Навчена на 200 млн токенів з словником 1024 токени
- •Досягла 27,06 перплекситет та 833 Elo на бенчмарку BananaMind
- •Доступна на Hugging Face як SLM-Archive/LowOnMind-300k
- •Architektura: decoder-only, 6 шарів, 64 прихований розмір
Як це змінить ваш ринок?
Нічого. Це досліднювальний реліз без комерційного потенціалу для SMB. Банки, маркетинг або логістика не отримають жодної пракольної користі — модель замала для реальних NLP-задач.
Визначення: Перплекситет — метрика невизначеності мовної моделі. Чим нижче значення, тим краще модель передбачає наступний токен.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
❌ "Підходить для компаній будь-якого розміру". ✅ "7B: MacBook 16GB, без IT-команди, 15 хв. 27B: GPU $2,000+ або хмара ~$0.5/год, IT-спеціаліст, 1-2 дні." LowOnMind-300k: працює на будь-якому ноутбуці з 4GB RAM, без IT-команди, 5 хв на завантаження та інференс. Проте через малий розмір словника (1024 токени) та низьку параметризацію не придатний для реальних завдань типу генерації тексту або аналізу документів.
Альтернативи (ТАБЛИЦЯ: | | Продукт 1 | Продукт 2 | Продукт 3 | з колонками: Ціна, Де працює, Мін. вимоги, Ключова різниця.
| Phi-3-mini | $0.15/1M токенів | Hugging Face API | 128 контекст, GPU потрібен | Краща якість при подвійних розмірах | TinyLlama-1.1B | безкоштовно (опенсорс) | Локально | 2048 контекст, CPU достатньо | Більше параметрів, краща генерація | LowOnMind-300k | безкоштовно (опенсорс) | Hugging Face | 1024 контекст, CPU достатньо | Найменший розмір для досліджень законів масштабування
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Shir-man Trending — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live