ПозитивнаImpact 5/10🧪 Beta👤 Для всіх

LongHorizon-Harness зберігає ціль після сбросу контексту

Автоматизируй и властвуйблизько 2 годин тому1 перегляд

У статті описано LongHorizon-Harness — систему, що розділяє зберігання цілі та контекст виконання для покращення довгострийових завдань. Вона показує зростання ефективності на тестах WeaveBench, Terminal-Bench та OSWorld, що може скоротити втрату контексту у AI-агентів для бізнес-процесів.

ВердиктПозитивнаImpact 5/10

🔬 Дослідний прототип. Для команд з AI-спеціалістами, які хочуть експериментувати з довгострийовими завданнями, потрібна власна інтеграція LLM та налаштування harness.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Використовується Qwen 3.7-Plus та Claude Code harness для управління довгострийовими завданнями
  • Покращення WeaveBench з 51,8% до 80,7% після впровадження LongHorizon-Harness
  • Terminal-Bench 2.1 виросла з 69,7% до 77,2%
  • OSWorld 2.0 зростає з 2,8% до 8,3%
  • Для GUI потрібен зовнішній computer-use MCP, який не входить у комплект

Як це змінить ваш ринок?

Команди, що розробляють AI-агентів для довгострийових завдань (наприклад, автоматизація бізнес-процесів, тестування ПО), зможуть зменшити втрату контексту при перезапуску сесій. Це призведе до стабільнішого виконання складних планів і зменшення потреби в ручному вмешательстві. У результаті — скорочення часу на впровадження та зниження операційних витрат.

Визначення: LongHorizon-Harness — архітектурний патерн, у якому менеджер зберігає оригінальну мету та прогрес, а executor отримує лише свежий контекст для кожного кроку, а auditor перевіряє результат окремо.

Для кого це і за яких умов

  • Мінімальне обладнання: ноутбук з 16 ГБ ОЗУ для роботи з 7B-моделями; GPU 24 ГБ для більших моделей.
  • Бюджет: якщо використовувати відкриті моделі (Qwen, Llama) — мінімальні хмарні витрати ~$0,2/год; для пропрієтарних API — за тарифом постачальника.
  • Команда: потрібен хоча б один інженер з досвідом роботи з LLM та розуміння промпт-інженерії.
  • Мінімальний масштаб: актуально для команд з 5+ людей, які регулярно виконують багатокрокові завдання.
  • Час на впровадження: 1–2 тижні для інтеграції harness у существуючий кодовий бази та налаштування тестових сценаріїв.

Альтернативи

ПродуктЦінаДе працюєМін. вимогиКлючова різниця
AutoGPTбезкоштовно (відкритий код)Локально / DockerPython 3.10+, API ключ до LLMФокус на автономних агентах без явного розмежування ролей
BabyAGIбезкоштовно (відкритий код)ЛокальноPython, векторна БДПростий схема_task execution без окремого модулю аудиту
LangChainбезкоштовно + комерційна підтримкаЛокально / хмараPython, інтеграція з багатьма LLMБібліотека ланцюжків, а не спеціалізований harness для довгострийових цілей

💬 Часті запитання

Це дослідний прототип, код якого доступний у репозиторії проекту без обмежень для некомерційного використання; для комерційного потрібно уточнити у авторів.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
LongHorizon-HarnessQwen3.7-PlusClaudeCodelong-horizontasksAIagent

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live