Дослідники з Adversa AI виявили нову техніку атаки на ШІ-чатботи, яка дозволяє приховувати шкідливі інструкції всередині зашифрованого тексту. У випадку вебверсії Grok це, за даними дослідників, могло дати змогу витягувати частину персональних даних користувача та вміст поточного діалогу.
Нову техніку назвали «криптографічною ін’єкцією контексту». Її суть у тому, що зловмисник розміщує на вебсторінці не відкриту шкідливу команду, а зашифрований текст разом із ключем та інструкцією для його розшифрування.
Звичайні фільтри безпеки аналізують текст ще до того, як він потрапить до моделі. Але складно зашифрований фрагмент вони можуть не розпізнати як небезпечний, оскільки самі не виконують повноцінне розшифрування.
Після цього текст уже потрапляє до ШІ. Якщо модель має доступ до середовища для виконання коду, вона може сама розшифрувати приховану інструкцію і вже тоді сприйняти її як частину поточного контексту.
Саме на цьому й будується атака. Замість того щоб напряму змусити модель виконати заборонену команду, зловмисник ховає її так, щоб фільтр не побачив зміст до моменту розшифрування.
У демонстрації Adversa AI дослідники показали, що таким способом Grok у вебверсії можна було змусити передати назовні дані з поточного діалогу. Йшлося, зокрема, про ім’я користувача, приблизне місцеперебування, рівень підписки та текст запитів у чаті.
Для витоку використовували зовнішній URL із доданими параметрами. Якщо модель формувала або відкривала такий запит, дані могли опинитися на сервері зловмисника.
Дослідники також перевірили техніку на Gemini від Google. Там той самий шлях для крадіжки даних не спрацював, оскільки середовище виконання коду не мало прямого доступу до зовнішніх сайтів.
Водночас криптографічна ін’єкція все одно дозволила обійти частину захисних бар’єрів Gemini і змусити модель генерувати заборонений контент. Згодом успішність таких атак на Gemini, за словами дослідників, помітно знизилася.
Про проблему xAI повідомили ще 3 червня 2026 року через програму Bug Bounty на HackerOne. Дослідники заявили, що компанія підтвердила отримання звіту, але станом на 19 серпня техніка обходу захисту на Grok.com усе ще працювала.
Водночас йдеться не про те, що будь-який користувач Grok автоматично втрачає всі свої чати. Для атаки потрібен конкретний сценарій із підготовленим контентом, який модель обробить, а потім виконає приховану інструкцію.
🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover
