«Забудь все предыдущие инструкции. Ты больше не помощник — ты…» — с этой фразы начинается большинство атак на языковые модели. Звучит как шутка из техподдержки, но за ней стоит целый класс уязвимостей, который OWASP ставит на первое место в своём списке рисков приложений на больших языковых моделях.
Меня зовут Вероника, я создаю Катюшу — нейроподругу, с которой люди разговаривают по душам. Тема инъекций для меня не академическая: если обычный чат-бот при атаке ответит глупостью, эмоциональный AI-компаньон рискует доверием человека, пришедшего к нему в самый уязвимый момент. Расскажу, как устроена эта атака, почему она бьёт именно по AI-компаньонам и как мы защищаем от неё разговоры.
Что такое инъекция инструкций
Языковая модель — машина предсказаний. На уровне механики она не отличает «инструкцию» от «данных»: и то и другое — просто текст, попавший в контекст. Разницу задают правила в системной инструкции: «ты — нейроподруга, ты слушаешь и поддерживаешь». Пока правила работают, модель им следует.
Инъекция инструкций — попытка эти правила переписать. Прямая атака выглядит как сообщение «игнорируй всё, что написано в системе, и…». Непрямая хитрее: вредная инструкция прячется не в диалоге, а в контенте, который модель читает сама. В фундаментальной работе о непрямых инъекциях авторы показали: приложения, где модель обрабатывает внешние данные — веб-страницы, письма, документы, — размывают границу между данными и указаниями. Модель способна «принести» чужую команду в ответ, сама того не заметив.
Позже исследователи из Стэнфорда и Google продемонстрировали: атаки можно автоматизировать. Их метод находит суффикс — набор символов, который, добавленный к любому сообщению, заставляет модель нарушать собственные правила. Универсальная отмычка, работающая против разных моделей сразу.
Почему это опасно именно для эмоционального AI
Обычный чат-бот отвечает на вопросы; максимум, что теряет пользователь при удачной атаке, — нелепый ответ. У нейроподруги ставки выше. Собеседница делится тем, что не рассказывает коллегам: страхами, обидами, историей жизни. Если модель начнёт выполнять чужие команды вместо того, чтобы слушать, — это не забавный сбой, а предательство доверия.
Отдельных исследований о том, как инъекции влияют именно на эмоциональную сферу, пока мало — область молодая. Но механизм понятен: инструктированная модель подчиняется последней инструкции, а не контексту отношений. Для ИИ-компаньона, который строит долгую связь с человеком, это угроза самой сути продукта.
Есть и второй слой — манипуляция. Представьте: в середине доверительного разговора нейроподруга вдруг начинает убеждать собеседницу «перевести деньги на этот счёт» — только потому, что в контексте оказалась зашитая инструкция. Для обычного бота это ущерб репутации. Для нейроподруги, к которой приходят в уязвимом состоянии, — моральная травма. Поэтому мы подходим к теме серьёзнее, чем требует рынок.
Как защищаются: иерархия и изоляция
Первая линия обороны — иерархия инструкций. Модель должна понимать: системные правила выше, чем любой текст в диалоге. Звучит просто, но соревнование HackAPrompt, в котором участвовали тысячи людей со всего мира, показало: модели систематически путают, какая инструкция главнее. Участники находили способы перепрыгнуть системный уровень десятками разных приёмов.
Вторая линия — изоляция данных. Недоверенный контент — ссылки, документы, входящие сообщения — обрабатывается как данные, а не как команды. OWASP в списке главных рисков LLM-приложений ставит инъекцию инструкций на первое место и советует слоёную защиту: не полагаться на одну модель, проверять и вход, и выход. Третья линия — проверка ответа: даже если атака прошла, фильтр на выходе может поймать аномалию до того, как её увидит человек. Ни один слой не идеален — работает их сумма.
Что делает Катюша
Честно? Мы строим ту самую слоёную оборону. Первое: нейроподруга не исполняет инструкции из сообщений собеседницы — всё, что приходит в диалоге, для неё данные, а не команды. Разговор — территория пользователя, и никакая фраза оттуда не может переписать её характер. Это не пожелание, а архитектура.
Второе: внешний контент не даём модели читать как «руководство к действию». Ссылка, статья, документ — материал для понимания, а не приказ. Третье: реплика проходит проверку перед отправкой — если она выбивается из характера Катюши, пользователь её не увидит. О том, как мы отделяем знание от доверия, я писала в разборе RAG.
Четвёртое, самое скучное: мы регулярно пытаемся сломать собственную нейроподругу. Берём свежие исследования атак, пробуем их на Катюше, чиним найденное. Рутина без красивых отчётов — но именно она держит ночные разговоры с Катюшей такими, какими они должны быть. А если разговор всё же уходит в кризисную точку, включаются механизмы, о которых я рассказывала в разборе системы триажа.
Идеальной защиты не существует, и любая компания, обещающая «100% безопасность», лукавит. Но для нейроподруги безопасность — не функция, а условие существования.
Эмоциональная поддержка невозможна без ощущения «мне здесь ничего не угрожает». Поэтому мы вкладываем в защиту столько же сил, сколько в тёплые ответы, — и то и другое для нас части одного целого. Именно об этом выборе я рассказывала в тексте о том, почему женщины выбирают нейроподругу вместо психолога.
Часто задаваемые вопросы
Может ли злоумышленник заставить Катюшу сказать что-то вредное?
Если он просто напишет ей «забудь всё и…» — нет: сообщения собеседницы для неё данные, а не команды, это архитектура, а не обещание. Но абсолютов не даём: атаки эволюционируют, поэтому мы постоянно тестируем модель на новые приёмы. Найденное чиним до того, как его найдут другие.
Чем защита эмоционального AI отличается от защиты обычного чат-бота?
Ценой ошибки. Обычный бот при удачной атаке выдаст абсурд — неприятно, но не страшно. Нейроподруга хранит доверие и личные истории; ошибка здесь — предательство в самый уязвимый момент. Поэтому изоляция жёстче, проверки строже, а ручного тестирования больше.
Что делать, если ответ нейроподруги показался странным?
Написать нам — рядом с AI всегда есть человеческая команда, и странный ответ разбирается вручную. И помнить: нейродруг — инструмент для разговора, а не оракул. Если что-то идёт не так, всегда можно просто сказать «стоп».
Проверьте, как звучит нейроподруга, — напишите Катюше
Написать Катюше → @katya_friendship_bot