Не все втрачено для людей: новий бенчмарк Agent's Last Exam показує низькі результати моделей AI

e/acc chatблизько 2 годин тому0 переглядів

Берклі та 30 організацій запустили бенчмарк Agent's Last Exam, який оцінює AI-агентів на довгострокових практичних економічних задачах. Низький результат найкращих моделей (~1%) свідчить, що люди залишаються незамінними у галузях поза IT, права та фінанси, що важливо для планування інвестицій у автоматизацію.

ВердиктНейтральнаImpact 5/10

🔬 Цікаво, але не критично. Для планування AI‑інвестицій у реальних економічних задачах люди залишаються ключовими.

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд
Детальний розбір ↓

TL;DR

  • Дата публікації: 5 серпня 2026 р.
  • Розроблено Берклі та 30 організацій
  • Назва бенчмарку: Agent's Last Exam
  • Тестувалися моделі Opus 4.7 та GPT 5.5 — результат ~1%
  • Оцінюються довгострокові практичні економічні задачі (ноти, гра розробка, медичні описи тощо)

Як це змінить ваш ринок?

Бенчмарк показує, що поточні AI моделі не готові до автономного виконання складних, междисциплінарних завдань. Це змушує компанії переглядати очікування від автоматизації та орієнтуватися на співпрацю людей з AI.

Paragraphs

Більшість економічних процесів вимагає не лише розпізнавання шаблонів, а й творчого переосмислення, координації та контекстуального розуміння. Agent's Last Exam саме такі навички вимірює, тому результати моделей настільки низькі.

Визначення: Agent's Last Exam — це набір довгострокових практичних завдань з економіки, створений для оцінки здатності AI-агентів діяти в реальних сценаріях, а не лише в тестових середовищах.

Для кого це і за яких умов

Для аналізу достатньо доступ до публічного набору даних та базових обчислювальних ресурсів (CPU/GPU), без спеціалізованої команди, 1‑2 дні для запуску тесту на доступних моделях. Підходить для компаній будь‑якого розміру, які планують інвестувати в AI‑рішення та хочуть оцінити реальні обмеження технології.

Альтернативи

MMLUGSM8KBigBench
Цінабезкоштовнобезкоштовнобезкоштовно
Де працюєакадемічні дослідженняакадемічні дослідженняакадемічні дослідження
Мін. вимогибазовий CPUбазовий CPUбазовий CPU
Ключова різницятестує розуміння природної мовифокус на математичному розумінніzbірник різноманітних завдань

💬 Часті запитання

Ні. Це показує, що сьогоднішні моделі добре справляються з узорцевими задачами, але слабо з творчими, довгостроковими та междисциплінарними завданнями, які характерні для реальної економічної діяльності.

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
Agent'sLastExamAIbenchmarkOpus4.7GPT5.5humanindispensabilityeconomictasks

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live