НегативнаImpact 5/10🔬 Research🎓 Освіта👥 HR і Рекрутинг

Берклі представив Agents' Last Exam — бенчмарк з 1500 задач із 55 професій для тестування ШІ

Vibecoderблизько 1 години тому0 переглядів

Дослідники Берклі випустили Agents' Last Exam — бенчмарк з 1500 практичних задач із 55 професій, де найкраща модель GPT-5.5 вирішила лише 24% кейсів, а на найскладнішому рівні всі моделі показали нульовий результат. Це підтверджує: автоматизація залежить від природи роботи, а не від галузі, і заразні агенти без людського експертного нагляду не придатні для складних бізнес-завдань.

ВердиктНегативнаImpact 5/10

🔬 Суровий реаліті-чек. Академічний бенчмарк підтверджує: сучасні агенти не тягнуть складні експертні задачі без людського нагляду — для CEO та CTO, які планують автоматизацію за межами рутини.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Бенчмарк містить 1500 задач від практикуючих фахівців 55 професій
  • GPT-5.5 вирішив 24% задач, на рівні "hard" всі моделі дали 0%
  • Fable 5 коштує в 4-12 разів дорожче за GPT-5.5 при порівняній якості
  • Дослідниця Dawn Song: автоматизація залежить від природи роботи, не галузі
  • Моделі далекі від людських здатностей у задачах з довгим рассудженням та вузькою експертизою

Як це змінить ваш ринок?

Бенчмарк стає новим еталоном для оцінки готовності агентів до робочих задач. Компанії, що планують замінити експертів ШІ, отримають чіткий сигнал: зараз це небезпечно. Ринок зсуне фокус на гібридні процеси "людина + агент" для складної когнітивної праці.

Визначення: Agents' Last Exam — академічний бенчмарк для оцінки здатностей ШІ-агентів вирішувати реальні професійні задачі з довгим горизонтом планування та нечіткими критеріями якості.

Для кого це і за яких умов

Для стратегічного планування автоматизації — лідерам компаній 50+ людей, які оцінюють ризики заміни експертів. Потрібна команда: аналітик даних або AI-лід для інтерпретації результатів. Час на оцінку: 2-3 дні для вивчення повного звіту. Обладнання: не потрібне, це дослідження.

Альтернативи

SWE-benchMMLUHumanEval
Цінабезкоштовнобезкоштовнобезкоштовно
Де працюєGitHub, локальноGitHub, локальноGitHub, локально
Мін. вимогиPython, DockerPythonPython
Ключова різницяФокус на інженерії ПЗЗагальні знанняГенерація коду

💬 Часті запитання

Так, бенчмарк відкритий для використання дослідниками та компаніями для оцінки своїх агентів.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
AIbenchmarkGPT-5.5AIagentsautomationBerkeleyresearch

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live