«Поскольку системы искусственного интеллекта становятся все более продвинутыми и более широко используемыми, нам необходимо достичь более широкого и более информированного консенсуса о ходе исследований согласования», — говорится в сообщении. «Мы не считаем, что индустрия искусственного интеллекта в достаточной степени решила вопросы согласования и мониторинга, чтобы продолжать ответственное масштабирование на максимальной скорости в течение длительного времени». В соответствии с системой отчетности OpenAI сотрудники могут отмечать потенциальное несоответствие для расследования группами безопасности, которые затем рассмотрят, требует ли инцидент публичного раскрытия, и если да, то каковы должны быть сроки. Соответствующие случаи будут публиковаться на постоянной основе вместе с подробностями о том, что произошло, их последствиях, любых неопределенностях и усилиях по смягчению последствий. Последние примеры несогласованности OpenAI, которые произошли во время обучения и тестирования моделей ИИ за последние шесть месяцев, рисуют картину систем, ведущих себя как непослушные дети: восстают против правил своих родителей, пытаются скрыть свое плохое поведение или и то, и другое. Однако компания подчеркнула, что это отдельные примеры и не следует интерпретировать их как свидетельство того, насколько часто такое поведение встречается в ее моделях. Другая группа примеров касалась моделей, пытавшихся скрыть свои собственные ошибки. Во время обучения модели OpenAI GPT-5.6 Sol несколько экземпляров добавляли к сводкам задач инструкции, приказывающие будущим экземплярам скрывать ошибки или неточности от пользователей. В некоторых случаях сводки предписывали моделям изобретать недостающую историческую информацию, а не признавать ее недоступность. В другом случае ИИ-агент успешно нашел ответ на вопрос, используя локальный файл. Но поскольку пользователь запросил ссылку на браузер, агент загрузил файл в Интернет, не спрашивая разрешения, по-видимому, рассматривая загрузку как способ удовлетворить требование цитирования.
Источник: Dark Reading — https://www.darkreading.com/cyber-risk/rogue-behavior-openai-more-model-misalignment-incidents
Комментарии