ИИ можно досрочно завершить диалог в случае крайней степени агрессии
Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта
Компания Anthropic выпустила обновление безопасности, в рамках которого ужесточила моделям искусственного интеллекта (ИИ) Claude AI запретный фильтр тем, связанных с биологическим оружием, вмешательством в выборы и организацией слежки. Однако наиболее примечательным является прямой запрет на оскорбление ИИ.
Источник изображения: AnthropicВ Anthropic сообщают, что добавили запрет на продолжительное и ненужное оскорбительное или жестокое поведение по отношению к ИИ-моделям. Новая политика применяется только в крайних случаях, когда пользователи неоднократно проявляют жестокость в отношении ИИ без видимой причины. Она не затрагивает распространённые случаи, когда пользователи выражают недовольство работой ИИ.
Разработчики Claude AI подчёркивают, что нововведение дополняет недавно введённый защитный механизм ИИ на случай крайней степени агрессии в диалоге. Речь идёт о ситуациях, когда пользователь начинает оскорблять или уничтожать ИИ-модель, а она, в свою очередь, досрочно завершает сессию, блокируя продолжение диалога. В Anthropic добавили, что именно таким способом ИИ будет противодействовать оскорблениям.