Новий бенчмарк від Андрея Карпати
Андрей Карпати провів тест Opus 5, дав перший абзац «Володар перснів» та бюджет 1 млн токенів для створення 3D‑візуалізації на three.js, отримано 5500 рядків коду. Це демонструє можливості LLM у генерації коду, але виявляє обмеження у самоперевірці без здатності сприймати візуальний результат, що важливо для інтеграції AI у ігрові та симуляційні застосування.
🔬 Цікаво, але ризиковано. Для команд, що прототипують ігрові світи без потреби у самоперевірці LLM.
Ключові тези
- Opus 5 за два години згенерував 5500 рядків коду three.js на основі першого абзацу «Володар перснів».
- Тест продемонстрував високі здатності моделі у кодогенерації, проте виявив її слабкість у самоперевірці без візуального зворотного зв’язку.
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секунд🔒 Підтекст (Insider)
Карпати демонструє, що великомасштабні токенові бюджети дозволяють LLM генерувати складний код, проте відсутність мультимодальної обратної зв’язку обмежує практичне застосування. Це сигнал, що для креативних індустрій потрібні інтегровані візуальні оцінки у циклах генерації коду.
Такий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live