Не все втрачено для людей: новий бенчмарк Agent's Last Exam показує низькі результати моделей AI
Берклі та 30 організацій запустили бенчмарк Agent's Last Exam, який оцінює AI-агентів на довгострокових практичних економічних задачах. Низький результат найкращих моделей (~1%) свідчить, що люди залишаються незамінними у галузях поза IT, права та фінанси, що важливо для планування інвестицій у автоматизацію.
🔬 Цікаво, але не критично. Для планування AI‑інвестицій у реальних економічних задачах люди залишаються ключовими.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Дата публікації: 5 серпня 2026 р.
- •Розроблено Берклі та 30 організацій
- •Назва бенчмарку: Agent's Last Exam
- •Тестувалися моделі Opus 4.7 та GPT 5.5 — результат ~1%
- •Оцінюються довгострокові практичні економічні задачі (ноти, гра розробка, медичні описи тощо)
Як це змінить ваш ринок?
Бенчмарк показує, що поточні AI моделі не готові до автономного виконання складних, междисциплінарних завдань. Це змушує компанії переглядати очікування від автоматизації та орієнтуватися на співпрацю людей з AI.
Paragraphs
Більшість економічних процесів вимагає не лише розпізнавання шаблонів, а й творчого переосмислення, координації та контекстуального розуміння. Agent's Last Exam саме такі навички вимірює, тому результати моделей настільки низькі.
Визначення: Agent's Last Exam — це набір довгострокових практичних завдань з економіки, створений для оцінки здатності AI-агентів діяти в реальних сценаріях, а не лише в тестових середовищах.
Для кого це і за яких умов
Для аналізу достатньо доступ до публічного набору даних та базових обчислювальних ресурсів (CPU/GPU), без спеціалізованої команди, 1‑2 дні для запуску тесту на доступних моделях. Підходить для компаній будь‑якого розміру, які планують інвестувати в AI‑рішення та хочуть оцінити реальні обмеження технології.
Альтернативи
| MMLU | GSM8K | BigBench | |
|---|---|---|---|
| Ціна | безкоштовно | безкоштовно | безкоштовно |
| Де працює | академічні дослідження | академічні дослідження | академічні дослідження |
| Мін. вимоги | базовий CPU | базовий CPU | базовий CPU |
| Ключова різниця | тестує розуміння природної мови | фокус на математичному розумінні | zbірник різноманітних завдань |
💬 Часті запитання
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
e/acc chat — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live