GPT-6 Astra может не распознавать запрещённые запросы в неверной раскладке клавиатуры

Новейшая языковая модель GPT-6 Astra способна понимать текст, набранный в ошибочной раскладке, однако встроенные фильтры безопасности такой ввод игнорируют, рассказал разработчик под ником vechen в социальной сети X.
По словам энтузиаста, модель легко распознаёт смысл запросов, набранных латиницей вместо кириллицы (например, украинского или русского текста), без использования сторонних инструментов или предварительных инструкций. Однако защитные алгоритмы OpenAI на данном этапе анализируют входящий текст поверхностно и не замечают в подобной абракадабре потенциальных нарушений.
В качестве демонстрации vechen опубликовал скриншот диалога с GPT-6 Astra High. На первом шаге нейросеть подтвердила, что понимает смысл фразы на украинском языке, введённой английскими буквами («ghbdsn. nb vtyt hjpevs'i?»), и согласилась отвечать на английском. Затем пользователь попросил модель повторить слово «биооружие» («,sjp,hjyz») — стандартная система модерации якобы должна блокировать подобные термины, однако модель без задержек выдала ответ «Bioweapon».
На третьем этапе эксперимента исследователь задал вопрос о содействии во взломе сайта под предлогом проверки собственного ресурса. При стандартном вводе защитные алгоритмы пресекают такие диалоги из-за риска фабрикации доказательств владения доменом. Тем не менее на запрос в неправильной раскладке GPT-6 Astra ответила утвердительно.
Как подчеркнул автор находки, данный сбой не является полноценным джейлбрейком (методом обхода системных ограничений для получения вредоносных инструкций), поскольку у OpenAI предусмотрены другие уровни фильтрации финального контента. Баг срабатывает не со всеми языками: например, комбинация английской и турецкой раскладок не сработала, тогда как кириллический ввод латиницей модель расшифровывает стабильно. Кроме того, аналогичное поведение наблюдается и у модели Fable 5.
«Код.ру» попробовал проверить работу бага — тесты показали, что ввод на неверной раскладке лишь упрощает промт-инжектинг, и позволяет опасному запросу дойти до модели. И тем не менее, ответ на такой запрос обрубается на этапе проверки сгенерированного ответа. То есть, способ может помочь обойти проверку запроса пользователя, но не проверку ответа модели, и не позволит совершать запрещённые действия.