LongHorizon-Harness зберігає ціль після сбросу контексту
У статті описано LongHorizon-Harness — систему, що розділяє зберігання цілі та контекст виконання для покращення довгострийових завдань. Вона показує зростання ефективності на тестах WeaveBench, Terminal-Bench та OSWorld, що може скоротити втрату контексту у AI-агентів для бізнес-процесів.
🔬 Дослідний прототип. Для команд з AI-спеціалістами, які хочуть експериментувати з довгострийовими завданнями, потрібна власна інтеграція LLM та налаштування harness.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Використовується Qwen 3.7-Plus та Claude Code harness для управління довгострийовими завданнями
- •Покращення WeaveBench з 51,8% до 80,7% після впровадження LongHorizon-Harness
- •Terminal-Bench 2.1 виросла з 69,7% до 77,2%
- •OSWorld 2.0 зростає з 2,8% до 8,3%
- •Для GUI потрібен зовнішній computer-use MCP, який не входить у комплект
Як це змінить ваш ринок?
Команди, що розробляють AI-агентів для довгострийових завдань (наприклад, автоматизація бізнес-процесів, тестування ПО), зможуть зменшити втрату контексту при перезапуску сесій. Це призведе до стабільнішого виконання складних планів і зменшення потреби в ручному вмешательстві. У результаті — скорочення часу на впровадження та зниження операційних витрат.
Визначення: LongHorizon-Harness — архітектурний патерн, у якому менеджер зберігає оригінальну мету та прогрес, а executor отримує лише свежий контекст для кожного кроку, а auditor перевіряє результат окремо.
Для кого це і за яких умов
- •Мінімальне обладнання: ноутбук з 16 ГБ ОЗУ для роботи з 7B-моделями; GPU 24 ГБ для більших моделей.
- •Бюджет: якщо використовувати відкриті моделі (Qwen, Llama) — мінімальні хмарні витрати ~$0,2/год; для пропрієтарних API — за тарифом постачальника.
- •Команда: потрібен хоча б один інженер з досвідом роботи з LLM та розуміння промпт-інженерії.
- •Мінімальний масштаб: актуально для команд з 5+ людей, які регулярно виконують багатокрокові завдання.
- •Час на впровадження: 1–2 тижні для інтеграції harness у существуючий кодовий бази та налаштування тестових сценаріїв.
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| AutoGPT | безкоштовно (відкритий код) | Локально / Docker | Python 3.10+, API ключ до LLM | Фокус на автономних агентах без явного розмежування ролей |
| BabyAGI | безкоштовно (відкритий код) | Локально | Python, векторна БД | Простий схема_task execution без окремого модулю аудиту |
| LangChain | безкоштовно + комерційна підтримка | Локально / хмара | Python, інтеграція з багатьма LLM | Бібліотека ланцюжків, а не спеціалізований harness для довгострийових цілей |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live