Вчені устроїли для штучного інтелекту «екзамен при наймі» — всі моделі провалили найскладніші завдання
Вчені провели тест у форматі співбесіди для штучного інтелекту, і всі моделі отримали 0% на найскладніших завданнях. Це показує, що навіть найпродвинутіші моделі не готові замінити людей у складних практичних задачах, що важливо для планування інвестувань у AI.
⚠️ Рано покладатися на ІК для складних завдань: навіть GPT‑5.5 вирішує лише 24% найскладніших кейсів, тому для простих операцій достатньо, а для аналітичних задач потрібна людська перевірка.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундTL;DR
- •Дослідження проведено 15 липня 2026 року командой з Інституту штучного інтелекту МГУ.
- •У тесті брали участь чотири моделі: GPT‑5.5, Claude 3 Opus, LLaMA 3 70B та Gemini Ultra 2.0.
- •Кожна модель отримала 0% на найскладніших 20% завдань, які вимагали багатокрокового розуміння та контексту.
- •Загальний бал GPT‑5.5 становить 24% через пропуск найскладніших питань, решта — менше 10%.
- •Тест схожий на реальну співбесіду при наймі: оцінка розв’язку практичних кейсів, а не теоретичних запитань.
Як це змінить ваш ринок?
Фінансові instituції, які планують повністю автоматизувати кредитний скоринг або інвестиційний аналіз, тепер повинні переглянути свої стратегії. Низка помилок у складних кейсах може призвести до регуляторних штрафів і втрати довіри клієнтів. Впровадження обов’язкового людського надзору над ІК‑виходами зменшить ризик на 25‑30% без значного зростання витрат.
Визначення: Job‑interview тест — оцінка моделі на основі розв’язку практичних, багатокрокових завдань, що симулюють реальні сценарії працевлаштування.
Для кого це і за яких умов
- •Фінанси та консалтинг: потрібна доступ до API моделей (GPT‑5.5, Claude тощо) та середовище для запуску скриптів валідації; бюджет ~ $500/міс на токени + $1 000 на інструменти тестування.
- •Мінімальна команда: один аналітик даних та один QA‑інженер; можливо без окремого відділу IT, якщо використовується хмарний сервіс.
- •Мінімальний масштаб: актуально для компаній з 10+ співробітниками, де приймаються рішення на основі аналізу даних.
- •Час на впровадження: 1‑2 тижні для налаштування пайплайну тестування та інтеграції з существуючими системами.
Альтернативи
| Продукт | Ціна | Де працює | Мін. вимоги | Ключова різниця |
|---|---|---|---|---|
| GPT‑5.5 (API) | $0.008 / 1K токенів | Хмарний (Azure/OpenAI) | Інтернет, обліковий запис | Найвища загальна продуктивність, але потребує зовнішнього доступу |
| Claude 3 Opus | $0.012 / 1K токенів | Хмарний (AWS Bedrock) | Інтернет, обліковий запис | Краща стійкість до hallucinations у довгих розмовах |
| LLaMA 3 70B (локально) | Безкоштовно (Apache 2.0) | Локальний сервер/ПК | GPU 24 GB+ RAM, 120 GB диску | Повна контроль над даними, без витрат на токени |
| Gemini Ultra 2.0 | $0.010 / 1K токенів | Хмарний (Google Cloud) | Інтернет, обліковий запис | Інтеграція з Google Workspace та avançоване розуміння контексту |
💬 Часті запитання
🔒 Підтекст (Insider)
Дослідження показує розрив між маркетинговими обещаннями ІК і її реальною здатністю виконувати практичні завдання. Компанії, що сподіваються на повну автоматизацію, ризикують отримати погані результати, якщо не передбачать людський контроль. Тому інвестування в ІК має поєднуватися з інвестуванням у процес валідації та надзору.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live