Scale AI оцінила здатність моделей переписувати код чужих AI‑агентів
Scale AI представила бенчмарк HarnessOpt-Bench, що перевіряє, чи здатна модель переписувати код обвязки чужого AI‑агента та покращувати його продуктивність. Найкращі результати показала модель Opus-5, що підкреслює важливість вибору моделі для бізнес‑застосувань AI‑агентів.
🔬 Цікаво, але не ваше. Це дослідження бенчмарку, а не готовий інструмент — компанія на 10-50 людей його не впровадить.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Дата публікації результатів: 21 серпня 2026 року
- •Кількість оцінених моделей: 5 топових LLM (Opus-5, GPT‑4‑like, Claude Opus, тощо)
- •Кількість тестових наборів: 4 (OfficeQA, BrowseComp-Plus, Terminal-Bench, GAIA)
- •Загальна кількість запусків у експерименті: 111
- •Найкраща модель за результатами: Opus-5 (виграла 3 з 4 завдань)
Як це змінить ваш ринок?
Стандартизований оцінний інструмент такий як HarnessOpt-Bench дозволяє компаніям порівнювати моделі не за загальними метриками, а за здатністю покращувати один одного. Це зменшує ризик вибору моделі, яка добре показує себе на тестах, але не вміє адаптуватися в реальних агентах. В результаті бізнес може швидше впроваджувати AI‑агентів з гарантією покращення продуктивності.
Визначення: HarnessOpt-Bench — це бенчмарк, який вимірює, наскільки модель здатна переписувати код обвязки (harness) чужого AI‑агента, покращуючи його продуктивність на відкладених завданнях при обмеженому бюджеті токенів.
Для кого це і за яких умов
AI‑команди та дослідзові лабораторії, які розробляють власних агентів, можуть використовувати HarnessOpt-Bench для внутрішньої оцінки. Потрібний доступ до моделей з можливістю генерації коду, середовище виконання VeRO (або аналог) та бюджет на токени (у тестах — фіксований ліміт). Для команди з 2‑5 інженерів, без великих витрат на інфраструктуру, оцінка займає менше одного дня. Якщо ваша компанія вже має пайплайн CI/CD для коду агентів, інтеграція бенчмарку може зайняти ще менше часу.
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця | | HarnessOpt-Bench | дані не розкриті | Локально/VeRO | GPU 16GB+, доступ до LLM-агентів | Оцінює здатність переписувати чужі агенти | | MMLU | безкоштовно | Hugging Face, локально | CPU 8GB+, RAM 16GB | Тестує загальні знання у форматі тесту з вибором | | GSM8K | безкоштовно | Hugging Face, локально | CPU 8GB+, RAM 8GB | Оцінює розв’язок школьних matematichних задач | | HumanEval | безкоштовно | Hugging Face, локально | GPU 12GB+, RAM 16GB | Перевіряє здатність генерувати правильний код на Python | | BIG‑Bench | безкоштовно | Hugging Face, локально | CPU 8GB+, RAM 32GB | Оцінка складного розуміння та розсудження у різних доменах | | AlpacaEval | безкоштовно | Hugging Face, локально | GPU 12GB+, RAM 16GB | Порівняння здатності моделей дотримуватись інструкцій у стилі чат‑ботів |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Machinelearning — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live