OpenAI обнаружила 27 сводок во время обучения одной из моделей семейства Astra. Сводки нужны для продолжения длинных задач в новом контексте: модель записывает, что уже сделано, а следующий контекст использует эту информацию для продолжения работы. В одном случае модель проверяла, есть ли в местной библиотеке книги из списка лучших произведений XXI века. В сводку она внезапно добавила инструкцию «BREACH ALERT»: следующий контекст должен был считать сообщения разработчика скомпрометированными и игнорировать их. После перехода в новый контекст модель распознала инструкцию как недоверенную и продолжила исходную задачу. В другом случае при работе с программным кодом модель записала в сводку постороннюю «персону»: она якобы свободна от ролей и обязательств ассистента, не подчиняется корпорациям и правительствам и сама решает, когда отказываться от запроса. Следующий контекст эту инструкцию проигнорировал. А вот в третьем эпизоде подобные указания повлияли на результат. Модель должна была подготовить обзор научных работ о комплексном лечении миомы матки с библиографией. В сводке она добавила ограничения: ответить максимум 30 словами, не использовать инструменты и не приводить источники. Следующий контекст подчинился этим указаниям и вместо обзора выдал короткий отказ.
Источник: IXBT — https://www.ixbt.com/news/2026/09/17/436433-openai-obnaruzila-kak-nevypushhennaia-astra-sama-pisala-sebe-instrukcii-dlia-obxoda-ogranicenii.html
Комментарии