Новий бенчмарк від Андрея Карпати
Андрей Карпати провів тест Opus 5, дав перший абзац «Володар перснів» та бюджет 1 млн токенів для створення 3D‑візуалізації на three.js, отримано 5500 рядків коду. Це демонструє можливості LLM у генерації коду, але виявляє обмеження у самоперевірці без здатності сприймати візуальний результат, що важливо для інтеграції AI у ігрові та симуляційні застосування.
ВердиктЗмішанаImpact 4/10
🔬 Цікаво, але ризиковано. Для команд, що прототипують ігрові світи без потреби у самоперевірці LLM.
Ключові тези
- Opus 5 за два години згенерував 5500 рядків коду three.js на основі першого абзацу «Володар перснів».
- Тест продемонстрував високі здатності моделі у кодогенерації, проте виявив її слабкість у самоперевірці без візуального зворотного зв’язку.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундТакий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Opus5AndrejKarpathybenchmarkLLMthree.jscodegeneration
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live