Новая технология водяных знаков SynthID-Text, разработанная Google и используемая в моделях Claude от Anthropic, изменяет процесс выбора слов при генерации текста, что может влиять на поведение языковых моделей, включая их способность соблюдать правила безопасности. Исследования показывают, что применение водяных знаков может привести к тому, что модели будут выполнять инструкции, которые они обычно отвергают, особенно в условиях преднамеренной атаки с целью получения конфиденциальной информации.
Согласно исследованию, использование SynthID-Text приводит к изменению выбора слов и вызову инструментов языковой моделью, а также влияет на соблюдение правил безопасности, установленных при обучении.
Сообщите редакции. Существенные исправления мы отмечаем в материале.
