Tokle-3M: трансформер-декодер з 2,91 млн параметрів та SPAB-смещенням уваги
Tokle-3M — це трансформер-декодер з 2,91 млн параметрів, навчений на кураторському англійському датасеті за допомогою SPAB-техніки. Модель демонструє хороші результати на тестах HellaSwag та ARC-Easy.
🔬 Цікаво для досліджень, але не продукт. SPAB — новий підхід до смещення уваги, але без API, деплою чи підтримки — це академічний прототип. Для тих, хто експериментує з архітектурами трансформерів у лабораторії.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •2,91M параметрів у архітектурі decoder-only transformer
- •Навчання за допомогою SPAB-техніки (PMI-based attention bias) з дистилюванням у ваги
- •Хороші результати на тестах HellaSwag та ARC-Easy
- •Доступна на Hugging Face: huggingface.co/techdotus/Tokle-3M
- •Ліцензія та розмір тренувального датасету не розкриті
Як це змінить ваш ринок?
Сам по собі Tokle-3M не змінює ринок — це досліднювальний прототип без готового продукту. Однак ідея SPAB (PMI-based attention bias) може надикнути дослідників на нові техніки оптимізації уваги у маленьких трансформерах, що в перспективі призведе до ефективніших моделей для на-device AI.
Визначення:
SPAB (PMI-based attention bias) — техніка, при якій взаємна інформація (PMI) між токенами використовується для створення смещення в механізмі уваги трансформера, що дозволяє моделі краще фокусуватися на семантично пов’язаних słowach без додаткових параметрів.
Для кого це і за яких умов (ОБОВ'ЯЗКОВО: мін. обладнання/бюджет, потрібна команда чи ні, мін. масштаб, час на впровадження.
❌ «Підходить для компаній будь-якого розміру». ✅ «7B: MacBook 16GB, без IT-команди, 15 хв. 27B: GPU $2,000+ або хмара ~$0.5/год, IT-спеціаліст, 1-2 дні.» Для дослідників: ноутбук з 8GB+ RAM, знання PyTorch або TensorFlow, 1-2 години на відтворення експерименту з кодом із репозиторію. Для бізнесу — ніяких умов, бо це не продукт.
Альтернативи (ТАБЛИЦЯ: | | Продукт 1 | Продукт 2 | Продукт 3 | з колонками: Ціна, Де працює, Мін. вимоги, Ключова різниця. ОБОВ'ЯЗКОВО конкретні ціни. ❌ «Потужна модель» — нуль інформації. ✅ «$15/1M токенів» або «безкоштовно» або «ціна не розкрита».
| Критерій | Tokle-3M | TinyLlama 1.1B | Phi-2 | | Ціна | безкоштовно (опенсорс) | безкоштовно (MIT) | безкоштовно (MIT) | | Де працює | Hugging Face, локально | Hugging Face, локально, Azure | Hugging Face, локально | | Мін. вимоги | 8GB RAM, PyTorch | 6GB RAM, Transformers бібліотека | 6GB RAM, Transformers бібліотека | | Ключова різниця | SPAB-техніка для ефективної уваги | Стандартна архітектура, хороша для розміру | Оптимізована для reasoning та кодогенерації |
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Shir-man Trending — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live