Бенчмарки ШІ застарішають швидше, ніж створюються нові: MirrorCode перевіряє довгострокове кодування
Епоха та METR випустили MirrorCode — бенчмарк, де моделі повинні створювати складні програми з нуля без інтернету. Попереднє покоління моделей вже показує ~70% успіху, а найдорожчий тест коштував $2600 за 19 днів автономної роботи.
ВердиктНейтральнаImpact 5/10
🔬 Цікавий дослідчий реліз, але не для вашого бізнесу. MirrorCode — це бенчмарк для оцінки довгострокових агентів, а не інструмент для продакшену. Компаніям до 200 людей тут нема дії: це сигнал про напрямок розвитку, а не готовий продукт.
Ключові тези
- Бенчмарки застарішають швидше, ніж вдається створювати нові
- MirrorCode перевіряє здатність моделей працювати дні/тижні без перерв на створенні проєктів з нуля
- Opus 4.7 переписав gotree (16 тис. рядків) за 14 годин і $251 проти 17 тижнів у людини
- Попереднє покоління моделей вже досягає ~70% на MirrorCode
- Найдорожчий запуск тесту коштував $2600, агент працював 19 днів без людського втручання
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундТакий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Джерела
e/acc — оригіналAIbenchmarksMirrorCodeEpochAIMETRsoftwareengineeringagentslong-horizontasks
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live