Бенчмарки ШІ застарішають швидше, ніж створюються нові: MirrorCode перевіряє довгострокове кодування
Епоха та METR випустили MirrorCode — бенчмарк, де моделі повинні створювати складні програми з нуля без інтернету. Попереднє покоління моделей вже показує ~70% успіху, а найдорожчий тест коштував $2600 за 19 днів автономної роботи.
🔬 Цікавий дослідчий реліз, але не для вашого бізнесу. MirrorCode — це бенчмарк для оцінки довгострокових агентів, а не інструмент для продакшену. Компаніям до 200 людей тут нема дії: це сигнал про напрямок розвитку, а не готовий продукт.
Ключові тези
- Бенчмарки застарішають швидше, ніж вдається створювати нові
- MirrorCode перевіряє здатність моделей працювати дні/тижні без перерв на створенні проєктів з нуля
- Opus 4.7 переписав gotree (16 тис. рядків) за 14 годин і $251 проти 17 тижнів у людини
- Попереднє покоління моделей вже досягає ~70% на MirrorCode
- Найдорожчий запуск тесту коштував $2600, агент працював 19 днів без людського втручання
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секунд🔒 Підтекст (Insider)
Epoch і METR зсувають фокус оцінки ШІ від іграшкових задач до реального інженерного кодування, яке у людей займає місяці. Це сигнал: індустрія вважає автономне кодування на довгій дистанції наступним веховим етапом. Вартість $2600 за 19 днів показує, що для бізнесу це ще надто дорого.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
e/acc — оригіналНавчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live