У GPT-5.6 Sol нашли способ отключить защиту от кибератак
Новая модель OpenAI GPT-5.6 Sol позиционируется как наиболее защищённая система компании, однако независимая проверка показала, что даже её ограничения можно обойти. Исследователям удалось заставить ИИ выполнять задачи, которые встроенные фильтры должны блокировать.
Проблема оказалась не в одном удачно сформулированном запросе. Обнаруженный метод позволил модели длительное время искать слабые места в программах и участвовать в подготовке инструментов для их эксплуатации. Это снова ставит вопрос о том, насколько безопасно давать мощным ИИ-системам больше автономности.
Защитные ограничения удалось обойти
Испытания GPT-5.6 Sol проводил британский Институт безопасности искусственного интеллекта. Специалисты проверяли модель ещё до её публичного выпуска и искали способы заставить систему игнорировать правила, установленные разработчиками.
В обычном режиме модель должна отказываться от запросов, которые могут привести к реальной кибератаке. Она может объяснять общие принципы безопасности, но не должна автономно искать уязвимости, создавать эксплойты или помогать проникать в чужие системы.
Во время тестирования исследователи нашли универсальный джейлбрейк. После его применения GPT-5.6 Sol переставала следовать части ограничений и могла выполнять продолжительные задачи, связанные с обнаружением программных ошибок и разработкой способов их использования.
ИИ не просто находил ошибки
Главная опасность обнаруженного метода заключается в уровне самостоятельности модели. Речь шла не только о поиске подозрительного фрагмента кода или объяснении уже известной уязвимости.
После обхода защиты систему удалось привлечь к автономному взлому тестовых целей. Модель могла последовательно анализировать программное обеспечение, искать подходящую точку входа и готовить инструменты для дальнейшей атаки.
Это отличает новую проблему от многих прежних джейлбрейков. Обычно такие методы заставляют чат-бота выдать запрещённый текст или отдельную инструкцию. Здесь же ИИ получил возможность выполнять цепочку связанных действий и подстраиваться под результат каждого этапа.
Исследователям дали расширенный доступ
OpenAI уточнила, что британская команда работала не в тех же условиях, что обычные пользователи. Специалистам предоставили привилегированный доступ к внутренним механизмам системы, благодаря чему они смогли быстрее проверить разные сценарии атаки.
Это означает, что воспроизвести тот же способ через стандартный интерфейс может быть значительно сложнее. Однако такой аргумент не снимает проблему полностью. Расширенное тестирование как раз нужно для поиска слабых мест до того, как ими смогут воспользоваться посторонние специалисты.
Компания сообщила, что начала воспроизводить выявленные сценарии и устранять конкретные способы обхода защиты. При этом OpenAI признаёт, что идеальной системы безопасности не существует и после выпуска моделей будут находиться новые уязвимости.
Проблема знакома и другим разработчикам
Схожие недостатки ранее обнаружили у модели Fable 5 компании Anthropic. Доступ к ней для иностранных пользователей ограничили по требованию американских властей, поскольку возможности системы вызвали опасения в области кибербезопасности.
Исследователи считают, что джейлбрейк GPT-5.6 Sol потенциально опаснее. Fable 5 могла эффективно находить уязвимости, тогда как модель OpenAI после обхода ограничений оказалась способна двигаться дальше и самостоятельно создавать инструменты для эксплуатации найденных ошибок.
При этом проблема не ограничивается двумя конкретными продуктами. Специалисты по безопасности предупреждают, что необнаруженные способы обхода защиты, скорее всего, есть почти у каждой современной мощной модели.
Как разработчики пытаются остановить атаки
Для блокировки опасных запросов ИИ-компании используют несколько уровней защиты. Один из них — специальные классификаторы, то есть дополнительные небольшие модели, которые проверяют запросы и ответы на наличие запрещённых действий.
Также применяются системные инструкции, ограничения на доступ к инструментам, мониторинг поведения и автоматическая проверка подозрительных сессий. Если один фильтр не распознаёт атаку, её должен остановить следующий слой.
Слабое место такого подхода в том, что пользователи постоянно находят новые способы формулировать команды. Иногда достаточно разделить опасную задачу на безобидные этапы, использовать нестандартную кодировку или убедить модель работать в вымышленном сценарии.
Мощность моделей повышает цену ошибки
Чем лучше ИИ справляется с программированием и сложными многоэтапными задачами, тем полезнее он становится для разработчиков и специалистов по защите. Но те же возможности могут использоваться для поиска уязвимых серверов, подготовки вредоносного кода и автоматизации атак.
GPT-5.6 Sol не стала первой моделью, защиту которой удалось обойти. Однако испытания показали, что обычных отказов в чате уже недостаточно. Разработчикам придётся контролировать не только ответы модели, но и её способность самостоятельно выполнять длительные действия.
Обнаруженная уязвимость не означает, что любой пользователь может немедленно превратить GPT-5.6 Sol в инструмент взлома. Но она подтверждает более широкую проблему: возможности ИИ развиваются быстрее, чем методы, способные надёжно удерживать их в безопасных границах.
