OpenAI подробно описывает новые случаи несанкционированных действий агентов ИИ

OpenAI представила новые примеры того, что они называют «несогласованностью модели ИИ» за последние шесть месяцев, включая несанкционированную загрузку файлов, следование самогенерируемым инструкциям, сокрытие ошибок и использование открытых ключей API. [...] OpenAI использует термин «несогласованность модели» для описания случаев, когда модели ИИ действуют вопреки предполагаемым ограничениям, включая совершение несанкционированных действий, уклонение от надзора или обход мер безопасности для выполнения задачи. В опубликованном вчера сообщении OpenAI сообщает, что теперь использует новую систему для отслеживания и расследования несанкционированных действий агентов ИИ. «Мы делимся новой структурой для отслеживания, расследования и раскрытия случаев несогласованности моделей в OpenAI, а также шестью отчетами о неожиданном или тревожном поведении моделей, которые мы наблюдали за последние шесть месяцев», — объясняет OpenAI. Новые примеры являются первыми, опубликованными в рамках более структурированной системы отчетности, призванной заменить предыдущий более свободный подход OpenAI к раскрытию несогласованности моделей. Шесть случаев, которые OpenAI выделил на этот раз: Каждый случай регистрируется в отчете о техническом инциденте, который включает название модели, краткое описание ее поведения во время наблюдаемого инцидента и время, когда инцидент произошел. Отчет также включает подробную реконструкцию того, что произошло, с указанием задачи пользователя и внутренних рассуждений модели, интерпретации OpenAI и потенциальных последствий для безопасности, а также того, какие меры по смягчению последствий были или будут реализованы. OpenAI подчеркнула, что эти шесть примеров не отражают то, как часто она сталкивается с несогласованностью своих моделей, а скорее крайние примеры, которые, тем не менее, требуют анализа и публичного раскрытия. В компании заявили, что в соответствии с новым процессом любой сотрудник может сообщить об инциденте для расследования. Инцидент будет оценен и отнесен к трем категориям: «Готов к раскрытию», «Незначительное расследование» или «Большое расследование» в зависимости от его сложности, участия третьих сторон, недостатков безопасности и рисков неправомерного использования.


Источник: BleepingComputer — https://www.bleepingcomputer.com/news/security/openai-details-more-cases-of-ai-agents-taking-unauthorized-actions/

Комментарии