OpenAI представила новые примеры того, что они называют «несогласованностью модели ИИ» за последние шесть месяцев, включая несанкционированную загрузку файлов, следование самогенерируемым инструкциям, сокрытие ошибок и использование открытых ключей API. [...] OpenAI использует термин «несогласованность модели» для описания случаев, когда модели ИИ действуют вопреки предполагаемым ограничениям, включая совершение несанкционированных действий, уклонение от надзора или обход мер безопасности для выполнения задачи. В опубликованном вчера сообщении OpenAI сообщает, что теперь использует новую систему для отслеживания и расследования несанкционированных действий агентов ИИ. «Мы делимся новой структурой для отслеживания, расследования и раскрытия случаев несогласованности моделей в OpenAI, а также шестью отчетами о неожиданном или тревожном поведении моделей, которые мы наблюдали за последние шесть месяцев», — объясняет OpenAI. Новые примеры являются первыми, опубликованными в рамках более структурированной системы отчетности, призванной заменить предыдущий более свободный подход OpenAI к раскрытию несогласованности моделей. Шесть случаев, которые OpenAI выделил на этот раз: Каждый случай регистрируется в отчете о техническом инциденте, который включает название модели, краткое описание ее поведения во время наблюдаемого инцидента и время, когда инцидент произошел. Отчет также включает подробную реконструкцию того, что произошло, с указанием задачи пользователя и внутренних рассуждений модели, интерпретации OpenAI и потенциальных последствий для безопасности, а также того, какие меры по смягчению последствий были или будут реализованы. OpenAI подчеркнула, что эти шесть примеров не отражают то, как часто она сталкивается с несогласованностью своих моделей, а скорее крайние примеры, которые, тем не менее, требуют анализа и публичного раскрытия. В компании заявили, что в соответствии с новым процессом любой сотрудник может сообщить об инциденте для расследования. Инцидент будет оценен и отнесен к трем категориям: «Готов к раскрытию», «Незначительное расследование» или «Большое расследование» в зависимости от его сложности, участия третьих сторон, недостатков безопасности и рисков неправомерного использования.
Источник: BleepingComputer — https://www.bleepingcomputer.com/news/security/openai-details-more-cases-of-ai-agents-taking-unauthorized-actions/
Комментарии