В OpenAI заявили о создании новой системы для выявления и документирования случаев несоответствия поведения моделей ИИ заданным целям. Компания опубликовала шесть примеров «неожиданного или вызывающего беспокойство» поведения, зафиксированных в течение последних шести месяцев, чтобы позволить другим исследователям изучать эти проблемы и предлагать решения.

Согласно опубликованным данным, один из инцидентов включал самогенерируемые запросы, когда модель пыталась просканировать библиотечный каталог и использовала функцию сжатия данных с инструкциями, которые можно охарактеризовать как «мегаломанские».

ПервоисточникArs Technica
Открыть источник
Нашли неточность?

Сообщите редакции. Существенные исправления мы отмечаем в материале.