НейтральнаImpact 3/10🔬 Research👤 Для всіх🏭 Виробництво і Промисловість📺 Медіа і Контент

cagliostro-v3: модель з 146 млн параметрів типу decoder-only

Shir-man Trendingблизько 20 годин тому0 переглядів

Знайдено нову модель ШІ з 146 млн параметрів типу decoder-only, натреновану на 75 млрд токенів. Вона демонструє хороші результати на тесті ArithMark-3, але слабші на PIQA, що робить її цікавою для спеціалізованих задач.

ВердиктНейтральнаImpact 3/10

🔬 Цікаво для досліджень, але не для продакшену. Модель занадто мала для складних задач, а результати нестабільні — для тих, хто тестує гіпотези в NLP.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Модель cagliostro-v3 має 146 млн параметрів
  • Натренована на 75 млрд токенів
  • Показує 26.27 на Open SLM Index
  • Краще за базу на ArithMark-3, гірше на PIQA
  • Доступна на huggingface.co/bench-labs/cagliostro-v3

Як це змінить ваш ринок?

Не змінить. Це досліднювальна модель без явного шляху до комерціалізації. Для бізнесу вона не створює нових можливостей, а лише додає шуму в просторі малих мовних моделей.

> Визначення:

Decoder-only — тип нейронної мережі, яка генерує текст, базуючись лише на попередніх токенах, без кодера (наприклад, GPT-стиль моделей).

Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.

❌ "Підходить для компаній будь-якого розміру". ✅ "7B: MacBook 16GB, без IT-команди, 15 хв. 27B: GPU $2,000+ або хмара ~$0.5/год, IT-спеціаліст, 1-2 дні." Для cagliostro-v3: через малий розмір (146M) може запускатися на будь-якому сучасному ноутбуці без GPU. Однак, через слабкі результати на загальних тестах (PIQA), вона не придатна для прямої замість більших моделей без донавчання. Потребує IT-спеціаліста для оцінки придатності до конкретної задачі — оцінка займе 1-2 дні.

Альтернативи

| | cagliostro-v3 | TinyLlama 1.1B | Phi-2 | Ціна | безкоштовно | безкоштовно | безкоштовно | Де працює | Hugging Face | Hugging Face | Hugging Face | Мін. вимоги | CPU, 4GB RAM | CPU, 8GB RAM | CPU, 8GB RAM | Ключова різниця | Дуже мала, нестабільна якість | Баланс розміру та якості | Оптимізована для reasoning


💬 Часті запитання

Ні. Модель занадто мала і нестабільна для загальних задач. Її варто розглядати лише як точку відліку для досліджень або як базу для спеціалізованого fine-tuning на вузькій доменній данині.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
AImodeldecoder-onlyHuggingFaceArithMark-3PIQA

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live