Дослідники Google знайшли спосіб економити до 98% токенів у довгих сесіях з агентами
Дослідники Google представили архітектуру SKILL.state, яка замість накоплення історії диалогу використовує змінюване структуроване стан виконання, зменшуючи споживання токенів з квадратичного на лінійне росту. Це дозволяє економити до 98% токенів у довгих сесіях агентів, покращуючи точність та знижаючи вартість використання великих м моделей.
🔬 Ефективна архітектура агентів. Для команд, що будують довгострокові AI-агенти, це зменшує витрати на токени до 98% без втрати точності.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •SKILL.state зменшує розмір промпту на кожному кроці до сталої величини, незалежно від довжини сесії.
- •У синтетичному бенчмарку управління складом на 200 кроків економія токенів становить 98%.
- •Метод не вимагає перетренування моделі, лише зміни у рантаймі та форматі виводу агента.
- •На реальних тестах InterCode CTF точність агента зростає з 40‑45% до 54,2% завдяки чистому стану.
- •Архітектуру можна застосувати до будь‑якої моделі, включаючи закриті API, замінивши лише функцію формування промпту.
Як це змінить ваш ринок?
Компанії, що використовують довгострокові AI‑агенти для автоматизації бізнес‑процесів, часто стикаються з височними витратами на токени через квадратичний рост промпту. SKILL.state лінеризує це споживання, дозволяючи збільшити довжину сесій та складність завдань без пропорційного зростання рахунку. Це робить AI‑агентів доступнішими для середнього бізнесу, знижує бар’єр входження та підвищує ROI від інтеграції ШІ.
Визначення: SKILL.state — архітектура, яка замість передачі повної історії диалогу на кожному кроці надсилає структуроване, змінюване стан виконання (execution state) у вигляді JSON‑блока з командою та патчем змін.
Для кого це і за яких умов
Для інтеграції достатньо мати доступ до LLM API або власну модель з можливістю кастомного промпту; потрібен один розробник знання Python/JSON. Впровадження займає від 4 до 8 годин (включаючи тестування промпту). Масштаб — будь‑який: від соло‑предприємця, що використовує API, до企业 з власною інфраструктую. Якщо модель запускається локально, потрібен GPU достатній для інференсу (наприклад, RTX 3060+ для 7B‑моделей); для хмарних API додаткового заліза не потрібне.
Альтернативи
| Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|
| Безкоштовно (стандартний ReAct‑стиль prompting) | У будь‑якому середовищі з доступом до LLM | Доступ до LLM API або модель | Квадратичний рост токенів при довгих сесіях, низька точність через шуми в контексті |
| Файн‑тюнинг моделі для скорочення контексту | Там, де можливе перетренування | GPU, датасет для фінетюнингу, навички ML | Потребує перетренування, не гнучке до змін завдання, витрати на обчислення та дані |
| Комерційний сервіс стиснення токенів (наприклад, proprietary API) | Як middleware між клієнтом і моделлю | Інтернет‑з’єднання, реєстрація у сервісі | Додаткова затримка, залежність від стороннього постачальника, вартість ~$0.001/1K токенів |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Data Secrets — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live