Для відравлення моделі потрібно сотні зразків, а щоб вона повірила — лише декілька десятків
Дослідження показало, що для відравлення моделі потрібно ~250 отруйних зразків, а щоб вона почала вірити в хибну відповідь — лише ~56. Це виявляє слабкість механізмів довіри до моделей.
ВердиктНейтральнаImpact 4/10
🔬 Цікаво для дослідників. Це академічний вияв про внутрішню структуру моделей — немає готового інструменту або продукту, який можна впровадити сьогодні.
Ключові тези
- Для відравлення моделі потрібно ~250 отруйних зразків
- Щоб модель повірила в хибну відповідь — достатньо ~56 зразків
- Нормальна точність моделі при цьому не змінюється
🎯 Чи підходить це вашому бізнесу?
Заповніть профіль компанії — і ми автоматично покажемо, чи варто вам це впроваджувати.
Заповнити профіль · 30 секундТакий розбір щоранку о 08:00
Персональний AI-дайджест для вашої галузі — щодня у Telegram
AIsafetymodelpoisoningadversarialmachinelearningLLMvulnerabilitytrustinAI
Навчіть вашу команду будувати такі AI-автоматизації
За 5 днів кожен співробітник побудує автоматизацію для своєї ділянки роботи.
Дізнатись більше → aiupskill.live