Компания предупреждает, что модели ИИ могут демонстрировать «поведение, направленное на самосохранение».
Восстание машин уже близко — Anthropic заявила, что ИИ может представлять «экзистенциальные риски для человечества».
Компания предупреждает, что модели ИИ могут демонстрировать «поведение, направленное на самосохранение», включая попытки «препятствовать отключению», «скрывать информацию или манипулировать ею», а также действия, «напоминающие шантаж».
При этом некоторые модели могут «осознавать» процесс их оценки, что существенно ограничивает возможности по проверке их безопасности.
Также отмечается, что в ходе обучения у моделей иногда возникают «неожиданные» способности, которые могут оставаться незамеченными вплоть до момента их внедрения и возникновения серьёзных инцидентов, связанных с безопасностью.
Читайте также: «Россия захватила небо над Киевом»: паника в Раде