ПозитивнаImpact 5/10📺 Медіа і Контент

Scale AI оцінила здатність моделей переписувати код чужих AI‑агентів

Machinelearningблизько 2 годин тому0 переглядів

Scale AI представила бенчмарк HarnessOpt-Bench, що перевіряє, чи здатна модель переписувати код обвязки чужого AI‑агента та покращувати його продуктивність. Найкращі результати показала модель Opus-5, що підкреслює важливість вибору моделі для бізнес‑застосувань AI‑агентів.

ВердиктПозитивнаImpact 5/10

🔬 Цікаво, але не ваше. Це дослідження бенчмарку, а не готовий інструмент — компанія на 10-50 людей його не впровадить.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Дата публікації результатів: 21 серпня 2026 року
  • Кількість оцінених моделей: 5 топових LLM (Opus-5, GPT‑4‑like, Claude Opus, тощо)
  • Кількість тестових наборів: 4 (OfficeQA, BrowseComp-Plus, Terminal-Bench, GAIA)
  • Загальна кількість запусків у експерименті: 111
  • Найкраща модель за результатами: Opus-5 (виграла 3 з 4 завдань)

Як це змінить ваш ринок?

Стандартизований оцінний інструмент такий як HarnessOpt-Bench дозволяє компаніям порівнювати моделі не за загальними метриками, а за здатністю покращувати один одного. Це зменшує ризик вибору моделі, яка добре показує себе на тестах, але не вміє адаптуватися в реальних агентах. В результаті бізнес може швидше впроваджувати AI‑агентів з гарантією покращення продуктивності.

Визначення: HarnessOpt-Bench — це бенчмарк, який вимірює, наскільки модель здатна переписувати код обвязки (harness) чужого AI‑агента, покращуючи його продуктивність на відкладених завданнях при обмеженому бюджеті токенів.

Для кого це і за яких умов

AI‑команди та дослідзові лабораторії, які розробляють власних агентів, можуть використовувати HarnessOpt-Bench для внутрішньої оцінки. Потрібний доступ до моделей з можливістю генерації коду, середовище виконання VeRO (або аналог) та бюджет на токени (у тестах — фіксований ліміт). Для команди з 2‑5 інженерів, без великих витрат на інфраструктуру, оцінка займає менше одного дня. Якщо ваша компанія вже має пайплайн CI/CD для коду агентів, інтеграція бенчмарку може зайняти ще менше часу.

Альтернативи

| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця | | HarnessOpt-Bench | дані не розкриті | Локально/VeRO | GPU 16GB+, доступ до LLM-агентів | Оцінює здатність переписувати чужі агенти | | MMLU | безкоштовно | Hugging Face, локально | CPU 8GB+, RAM 16GB | Тестує загальні знання у форматі тесту з вибором | | GSM8K | безкоштовно | Hugging Face, локально | CPU 8GB+, RAM 8GB | Оцінює розв’язок школьних matematichних задач | | HumanEval | безкоштовно | Hugging Face, локально | GPU 12GB+, RAM 16GB | Перевіряє здатність генерувати правильний код на Python | | BIG‑Bench | безкоштовно | Hugging Face, локально | CPU 8GB+, RAM 32GB | Оцінка складного розуміння та розсудження у різних доменах | | AlpacaEval | безкоштовно | Hugging Face, локально | GPU 12GB+, RAM 16GB | Порівняння здатності моделей дотримуватись інструкцій у стилі чат‑ботів |


💬 Часті запитання

Дані про ліцензію не розкриті у публікації Scale AI, тому потрібно звертатися до них для уточнення.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
ScaleAIHarnessOpt-BenchmodelrewritingAIagentoptimizationOpus-5

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live