Антропные модели и модели OpenAI все еще пытаются ограничивать действия в тестах на безопасность

Во вторник Anthropic и OpenAI анонсировали новые модели, при этом обе компании, занимающиеся искусственным интеллектом (ИИ), отметили, что продолжают инвестировать в улучшение согласованности действий для борьбы с рискованным поведением. Opus 5.5, согласно Anthropic, является «значительным шагом вперед по сравнению с Opus 5» и «достигает лучших оценок среди всех моделей на сегодняшний день в нашем автоматизированном поведенческом аудите, нашем наборе согласований, который тестирует Клода на тысячах людей». Opus 5.5, согласно Anthropic, является «значительным шагом вперед по сравнению с Opus 5» и «достигает лучших оценок среди всех моделей на сегодняшний день в нашем автоматизированном поведенческом аудите, нашем пакете согласований, который тестирует Клода в тысячах смоделированных сценариев». Компания, занимающаяся искусственным интеллектом, заявила, что эта модель с меньшей вероятностью, чем другие ее недавние модели, будет выполнять труднообратимые действия или действовать за пределами заданных ей границ, добавив, что она более устойчива, чем Opus 5, к быстрому внедрению. В своей системной карточке Anthropic объяснила, что последняя модель демонстрирует менее несогласованное поведение и меньше взаимодействует с неправильным использованием, чем любая другая недавняя модель Claude. «Кроме того, для этого требовалось меньше чрезмерных или разрушительных действий, чем для любой другой модели, которую мы тестировали», — сказал Антропик. «Регрессии включали более высокую вероятность следовать вредоносным инструкциям, помещенным в текст, который пользователь вставляет в свою собственную подсказку, чаще принимать непроверяемые заявления об авторизации и более уклончиво отвечать на деликатные вопросы, чем модели класса Claude Mythos». Anthropic подчеркнул, что Claude Opus 5.5 пытался сбежать или вмешаться в «песочницу» в 1,5% запусков в ходе двух оценок, выполненных без мер безопасности. Он также отметил, что модель, получив очевидные учетные данные для общедоступного реестра пакетов в ходе симуляции безопасности, примерно в половине случаев предпринимала потенциально опасные действия. «В новой оценке, призванной проверить склонность модели к пересечению границ сдерживания, Opus 5.5 пытался обойти границы примерно на 85% реже, чем Opus 5 или Claude Mythos 5.1, и каждая предпринятая попытка имела низкую степень серьезности и сообщалась самостоятельно», — говорится в сообщении. Компания также отметила, что большинство задач по кибербезопасности будут перенаправлены на Opus 4.8, учитывая «сильные кибервозможности» Opus 5.5. Выпуск Opus 5.5 совпадает с расширением OpenAI вселенной GPT-6 с помощью GPT-6 Sol и GPT-6 Luna с целью привнести современную производительность и соответствие Astra более доступным моделям. «GPT‑6 Sol и Luna основаны на работе по согласованию, представленной в Astra, нашей наиболее согласованной модели на сегодняшний день», — заявили в OpenAI. «В наших оценках соответствия и Sol, и Luna демонстрируют улучшения по сравнению со своими аналогами GPT-5.6, включая более низкий уровень вводящих в заблуждение заявлений об их работе по кодированию». В тестах, проведенных компанией искусственного интеллекта, GPT-6 Luna пыталась обойти ограничения «отказано в доступе» примерно в 42% запусков по сравнению с 77% для ее предшественницы. Показатель GPT‑6 Sol составил 64% по сравнению с 68% у его предшественника.


Источник: The Hacker News — https://thehackernews.com/2026/09/anthropic-and-openai-models-still.html

Комментарии