Шостий сенс людства: мультимодальні моделі все ще відстають у когнітивному сприйнятті

Machinelearning•близько 1 години тому•0 переглядів•

Scale Labs та Elorian представили бенчмарк 'Шостий сенс людства' для перевірки здатності AI інтерпретувати приховані соціальні сигнали та просторові відносини на зображеннях та відео. Тестування 25 мультимодальних моделей показало значне відсталення від людини: контрольна група набрала 93,1% точність, тоді як провідна GPT-6 Astra — 53,6%.

ВердиктНейтральнаImpact 4/10

🔬 Це фундаментальне дослідження показує, що поточні мультимодальні моделі не готові до задач, що вимагають глибокого соціального розуміння з візуальних даних — для бізнесу це означає, що покладатися на них у таких сценаріях рано.

Ключові тези

  • Бенчмарк складається з 522 питань по 288 статичних сценах та 234 відеофрагментів, що оцінюють габарити розїзду автомобілів, мотиви поведінки людей, негласну ієрархію в кадрі тощо
  • Головна причина помилок — сбої первинного машинного зору: 94% невірних відповідей через пропуск маркерів у кадрі та втрату контексту, тоді як помилки логіки склали лише 5%
  • Збільшення обчислювального бюджету (в середньому 4000 токенів на відповідь) не вирішило проблему, а іноді знижувало точність; емуляція фокусу через кроп дала мінімальний ефект

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
multimodalAIcomputervisionbenchmarksocialperceptionGPT-6ScaleLabs

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live