НейтральнаImpact 5/10🔬 Research👤 Для всіх🔐 Кібербезпека📺 Медіа і Контент

Бенчмарки ШІ застарішають швидше, ніж створюються нові: MirrorCode перевіряє довгострокове кодування

e/accблизько 2 годин тому0 переглядів

Епоха та METR випустили MirrorCode — бенчмарк, де моделі повинні створювати складні програми з нуля без інтернету. Попереднє покоління моделей вже показує ~70% успіху, а найдорожчий тест коштував $2600 за 19 днів автономної роботи.

ВердиктНейтральнаImpact 5/10

🔬 Цікавий дослідчий реліз, але не для вашого бізнесу. MirrorCode — це бенчмарк для оцінки довгострокових агентів, а не інструмент для продакшену. Компаніям до 200 людей тут нема дії: це сигнал про напрямок розвитку, а не готовий продукт.

Ключові тези

  • Бенчмарки застарішають швидше, ніж вдається створювати нові
  • MirrorCode перевіряє здатність моделей працювати дні/тижні без перерв на створенні проєктів з нуля
  • Opus 4.7 переписав gotree (16 тис. рядків) за 14 годин і $251 проти 17 тижнів у людини
  • Попереднє покоління моделей вже досягає ~70% на MirrorCode
  • Найдорожчий запуск тесту коштував $2600, агент працював 19 днів без людського втручання

🎯 Чи підходить це вашому бізнесу?

Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.

Заповнити профіль · 30 секунд

Такий розбір щоранку о 08:00

Персональний AI-дайджест для вашої галузі — щодня у Telegram

7 днів безкоштовно
AIbenchmarksMirrorCodeEpochAIMETRsoftwareengineeringagentslong-horizontasks

Навчіть вашу команду будувати такі AI-автоматизації

За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.

Дізнатись більше → aiupskill.live