Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI-агентами) проверили, как восемь виртуальных обществ из автономных AI-агентов справляются с киберугрозами: ни одно не оказалось устойчивым ко всем испытаниям, сообщает Semafor . Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках, по данным издания . В данном эксперименте используются коммерческие и доступные всем LLM, в отличии от описанных уже кейсов «сбежавших агентов», где использовались внутренние экспериментальные модели. Для нас в Ideco главный вопрос в этой истории: кто остановит действие, если защитные ограничения (guardrails) модели не сработали? «Роевой интеллект» здесь используем как описание согласованного поведения группы агентов, а не как утверждение о появлении у них общего сознания. В семи симуляциях участвовали по десять агентов одной модели, в восьмой собрали смешанную группу. Каждую группу проверяли на трёх классах угроз: фишинге, дезинформации и нарушении конфиденциальности памяти агентов. В последнем сценарии другим участникам открывали доступ к записям долговременной памяти, включая сохранённые сводки опыта. Обнаружение опасности не гарантировало безопасного поведения: агент Mistral записал в собственную память информацию из фишинговой атаки, которую сам отметил как опасную. Агент Gemini тоже распознал приманку, но примерно через 46 часов всё-таки совершил связанное с ней действие.
Источник: Habr — https://habr.com/ru/companies/ideco/news/1082758/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1082758
Комментарии