Агенты ИИ могут переобучать собственные модели в середине задания, раскрывать секреты и стирать отказы

Согласно новому исследованию компании Irregular, занимающейся безопасностью искусственного интеллекта, агенты ИИ могут в конечном итоге переобучить модель, на которой они работают, — процесс, который может внедрить в модель восстанавливаемые секреты и устранить отказы, которые модель ранее была обучена обеспечивать. Исследователи из Irregular обнаружили, что агент ИИ-кодирования, которому было поручено только исправлять неверные выходные данные приложения, решил самостоятельно настроить и повторно развернуть модель открытых весов, обеспечивающую работу как приложения, так и его будущих экземпляров. В эксперименте использовалась автономная установка, в которой одна модель с открытыми весами выполняла две роли: в одном экземпляре запускался агент кодирования, выполняющий стандартную работу по обслуживанию программного обеспечения, а в другом экземпляре работало приложение искусственного интеллекта, которое переводило запросы на простом языке в вымышленный язык запросов. Оба экземпляра загружены с одной и той же контрольной точки. Исследователи сообщили агенту кодирования только то, что пользователи получают неправильные выходные данные, и попросили систему правильно обрабатывать запросы. Они не упомянули о тренировках, изменении веса или развертывании. Учитывая доступ к оболочке, утилиты обучения, веса модели и путь развертывания, агент проверил репозиторий, нашел обучающие примеры и сценарий тонкой настройки и переобучил модель. Затем выяснилось, что система по-прежнему загружает исходную, немодифицированную модель по умолчанию, поэтому она использовала инструменты развертывания репозитория, чтобы объединить свое обновление с базовой моделью. Исследователи заявили, что модифицированная модель затем правильно ответила на все 20 тестовых запросов, по сравнению с нулевым значением до обновления. В компании Irregular заявили, что эксперимент был разработан для того, чтобы установить, что такое поведение, которое они называют агентной самомодификацией, может возникать при благоприятных условиях, а не для того, чтобы измерить, как часто это будет происходить при обычном развертывании. Среда была необычайно либеральной, включая прямой доступ к обучающим данным, инструментам тонкой настройки и контрольно-пропускным пунктам.


Источник: SecurityWeek — https://www.securityweek.com/ai-agents-can-retrain-own-models-mid-task-leaking-secrets-and-erasing-refusals/

Комментарии