Берклі представив Agents' Last Exam — бенчмарк з 1500 задач із 55 професій для тестування ШІ
Дослідники Берклі випустили Agents' Last Exam — бенчмарк з 1500 практичних задач із 55 професій, де найкраща модель GPT-5.5 вирішила лише 24% кейсів, а на найскладнішому рівні всі моделі показали нульовий результат. Це підтверджує: автоматизація залежить від природи роботи, а не від галузі, і заразні агенти без людського експертного нагляду не придатні для складних бізнес-завдань.
🔬 Суровий реаліті-чек. Академічний бенчмарк підтверджує: сучасні агенти не тягнуть складні експертні задачі без людського нагляду — для CEO та CTO, які планують автоматизацію за межами рутини.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Бенчмарк містить 1500 задач від практикуючих фахівців 55 професій
- •GPT-5.5 вирішив 24% задач, на рівні "hard" всі моделі дали 0%
- •Fable 5 коштує в 4-12 разів дорожче за GPT-5.5 при порівняній якості
- •Дослідниця Dawn Song: автоматизація залежить від природи роботи, не галузі
- •Моделі далекі від людських здатностей у задачах з довгим рассудженням та вузькою експертизою
Як це змінить ваш ринок?
Бенчмарк стає новим еталоном для оцінки готовності агентів до робочих задач. Компанії, що планують замінити експертів ШІ, отримають чіткий сигнал: зараз це небезпечно. Ринок зсуне фокус на гібридні процеси "людина + агент" для складної когнітивної праці.
Визначення: Agents' Last Exam — академічний бенчмарк для оцінки здатностей ШІ-агентів вирішувати реальні професійні задачі з довгим горизонтом планування та нечіткими критеріями якості.
Для кого це і за яких умов
Для стратегічного планування автоматизації — лідерам компаній 50+ людей, які оцінюють ризики заміни експертів. Потрібна команда: аналітик даних або AI-лід для інтерпретації результатів. Час на оцінку: 2-3 дні для вивчення повного звіту. Обладнання: не потрібне, це дослідження.
Альтернативи
| SWE-bench | MMLU | HumanEval | |
|---|---|---|---|
| Ціна | безкоштовно | безкоштовно | безкоштовно |
| Де працює | GitHub, локально | GitHub, локально | GitHub, локально |
| Мін. вимоги | Python, Docker | Python | Python |
| Ключова різниця | Фокус на інженерії ПЗ | Загальні знання | Генерація коду |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
Vibecoder — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live