Looped Transformer — одна з найобговорюваніших архітектурних ідей
У новому технічному звіті пропонується розтягнути цикл Looped Transformer між токенами. Це робить декодер рекуррентним для кожного токена, зберігаючи постійну вартість обробки одного токена незалежно від довжини послідовності.
🔬 Це дослідження, а не продукт. Автор заявляє, що прирост у розумінні та масштабуванні RL — ще не виміряні цілі. Для компаній до 200 людей це теорія без готового інструменту.
Ключові тези
- Декодер стає рекуррентним для кожного токена: поєднує представлення токена з энкодера, финальне приховане стан від попереднього токена та кеш недавніх активацій зі зсувним вікном
- Глибина обчислень зростає разом з довжиною послідовності (48t блоків для t токенів у декодері з 48 шарами), а вартість обробки одного токена залишається постійною
- Один і той же перехід між станами використовується для попереднього навчання, SFT, генерації та повторного відтворення в RL без скидання стану на межі запиту та відповіді
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секунд🔒 Підтекст (Insider)
Це не про готовий продукт, а про архітектурну ідею, яка може вплинути на майбутні моделі. Реальна вигода залежить від того, чи будуть виміряні заявлені переваги в ефективності та розумінні.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Вайб-кодинг — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live