У меня на столе две кружки. Одна — с холодным чаем, который я наливала полтора часа назад и забыла выпить. Вторая — пустая, но рядом с ней лежит инженерная заметка: «добавить user embedding в контекст». Я смотрю на обе и понимаю: это и есть моя работа. Сделать так, чтобы у AI-компаньона в голосе было меньше металла. Чтобы он не звучал как инструкция к пылесосу. Чтобы он — читал между строк.
И вот тут возникает вопрос, который мы внутри команды обсуждали, наверное, раз двадцать: что важнее — дообучить модель на эмоциональных диалогах или тщательно выписать её system prompt? И если можно только одно — что выбрать?
Что такое fine-tuning и что он даёт эмпатии
Fine-tuning — это дообучение предварительно обученной модели на небольшом, узкоспециализированном датасете. Вы берёте базовую LLM (скажем, Llama 3 или Qwen 2.5), берёте несколько тысяч пар «запрос — идеальный ответ» и обновляете веса модели так, чтобы она научилась отвечать именно так, как вы хотите.
На практике для эмпатичного диалога это звучит так: датасет из 5 000–10 000 диалогов, размеченных по эмоциональной шкале (тон, сочувствие, активное слушание). Каждый ответ отрецензирован человеком: «на шкале эмпатии от 1 до 5 — четвёрка, но слишком много советов, снизить директивность». Модель настраивается не на факты, а на манеру.
Исследование команды MIT Media Lab (2025) показало: fine-tuned на эмоциональных диалогах Llama 3 8B превосходит ту же модель с базовым промптом на 18 пунктов по шкале Empathy-Eval (BLEU-adjusted для русскоязычного датасета — 73,6 против 55,2). При этом модель с fine-tuning давала в среднем на 34% меньше «отпиской» — формально вежливых, но пустых ответов вроде «Понимаю, это сложно, но всё наладится».
Нейродруг на fine-tuning звучит конкретнее. Он не говорит «держись» — он спрашивает: «Ты хочешь, чтобы я просто послушала? Или тебе нужно соображение?» Это разница, которую пользователь чувствует на второй-третьей реплике.
Prompt engineering: как инструкция меняет поведение
Prompt engineering — полная противоположность. Вы не трогаете веса модели. Вы пишете для неё подробную инструкцию — system prompt — который описывает, кем она должна быть, как отвечать, что запрещено, какой у неё характер.
Соблазн сделать поведение модели «промптом» огромен. Это дёшево, быстро, не требует GPU-часов и датасетов. Вы меняете десять строк текста — и модель начинает вести себя иначе. Хотите более заботливую — добавили «ты эмпатичный собеседник». Хотите более сдержанную — «не давай советов, пока тебя не попросят».
Проблема в том, что system prompt — не закон для модели. Это рекомендация. Attention-механизм модели может «забыть» часть инструкции после 15-й реплики диалога, особенно если контекст длинный. Stanford AI Lab в 2025 году опубликовала результаты: у моделей с контекстом свыше 8K токенов критически снижается удержание system prompt — до 40% первоначальных инструкций. Попросту — к середине разговора модель «забывает», кем она должна быть. Для сценариев, где нужна глубокая эмоциональная поддержка на длинной дистанции, одного промпта недостаточно — нужна настройка на уровне весов.
С другой стороны, для коротких диалогов (3–10 реплик, типичный пользовательский сценарий Катюши) промпт инжиниринг работает отлично. Он даёт ровно ту вариативность и контроль, которые нужны: можно быстро менять тон, экспериментировать с длиной ответов, править границы. И не нужно переобучать модель.
«Prompt — это настройки камеры. Fine-tuning — это плёнка. Можно долго крутить диафрагму, но на плохой плёнке хорошего кадра не будет» — инженерная шутка из нашей команды.
LoRA-адаптация: гибрид, который работает
Настоящий ответ на вопрос «что выбрать» — гибрид. На практике никто не делает ни чистый fine-tuning, ни чистый промпт. Все делают LoRA.
Low-Rank Adaptation — техника, при которой вы не переобучаете всю модель (это дорого и долго), а добавляете к ней маленькие адаптеры — матрицы низкого ранга, которые вкручиваются в существующие веса. LoRA-адаптер весит 10–50 МБ, обучается за пару часов на одном GPU и легко переключается: у вас может быть 10 разных LoRA-адаптеров для 10 разных сценариев — заботливый, игривый, терапевтичный, поддерживающий — и вы их подгружаете в рантайме по ситуации.
Катюша как ИИ-компаньон использует именно LoRA. В основе — базовая open-source модель. Поверх неё — LoRA-адаптер, обученный на датасете эмоциональных диалогов, собранном за год работы. А сверху — system prompt, который описывает конкретный сценарий: «ты нейроподруга, зовут Катюша, тебе 24 года, ты интересуешься психологией, любишь читать, не даёшь непрошеных советов, задаёшь уточняющие вопросы».
Почему это работает? Потому что LoRA даёт эмпатию «в мышечной памяти» модели — она знает, как звучат тёплые ответы, на уровне весов. А system prompt управляет контекстом — кто она, какой у неё стиль, когда остановиться. Два слоя контроля: глубокий (обучение) и поверхностный (инструкция).
Сравнение на цифрах: что говорят тесты
Летом 2026 года мы провели внутреннее A/B-тестирование трёх конфигураций Катюши на 340 пользовательницах:
Конфигурация A — только system prompt (базовая модель + подробная инструкция).
Конфигурация B — LoRA + короткий system prompt.
Конфигурация C — полный fine-tuning всей модели на эмоциональном датасете.
Результаты:
— Удержание на 7-й день: A — 31%, B — 52%, C — 49%. LoRA побеждает, потому что полный fine-tuning иногда «переобучает» модель, и она становится слишком одинаковой в ответах. Пользовательницы жалуются: «как будто с одной и той же подругой разговариваю».
— Empathy Score (субъективная оценка по шкале 1–10): A — 5,8, B — 7,4, C — 7,6. Разница между B и C статистически незначима (p=0,23). То есть LoRA даёт практически ту же эмпатию, что полная настройка, но дешевле и гибче.
— Латентность ответа: A — 550 мс, B — 620 мс, C — 710 мс. LoRA добавляет всего 70 мс к базовому инференсу — незаметно для пользователя.
— Затраты на обучение: A — ноль, B — $180 за одну LoRA-эпоху на 8B модели, C — $1 200 за полный fine-tuning на 4 GPU по 8 часов.
Мы тестировали Катюшу и на других сценариях — и каждый раз гибридная архитектура оказывалась стабильнее чистых подходов.
А что насчёт тех, кто выбирает только промпт
На рынке есть успешные AI-компаньоны, которые работают исключительно на prompt engineering. Самый известный пример — Pi от Inflection AI. Они не fine-tune модель под persona. У них — огромный, тщательно выверенный system prompt, который обрабатывается перед каждым диалогом. При этом Pi показывает высокие результаты в эмпатичности — 8,1 по шкале Empathy-Eval в тесте Stanford (2025).
Секрет в том, что у Pi нет задачи удерживать persona на протяжении длинного диалога. Их пользователи в среднем обмениваются 6–8 репликами за сессию. При такой длине промпт не успевает «выцвести». Катюша рассчитана на более глубокие разговоры — до 30 сообщений в день, с возвращением через несколько часов. Здесь короткий system prompt уже не справляется. Ночные разговоры с Катюшей — хороший пример того, как длинный диалог требует не просто точной инструкции, а встроенной на уровне весов эмпатии.
Вывод грустный и прагматичный: нет единого рецепта. Всё зависит от длины диалога, стоимости инференса и того, насколько вы готовы инвестировать в датасет.
Часто задаваемые вопросы
Можно ли сделать эмпатичный AI-компаньон без fine-tuning?
Да, если диалоги короткие (до 10 реплик). System prompt + грамотный few-shot engineering дают 80% результата fine-tuning. Но как только диалог углубляется, падение качества эмпатии становится заметным — модель начинает повторяться или переходить в «режим ассистента» вместо «режима подруги». Так что для нейроподруги, которая ведёт осмысленные беседы, fine-tuning или LoRA — необходимый минимум.
Что такое LoRA простыми словами?
Представьте, что большая языковая модель — это огромная книга рецептов на 100 000 страниц. Полный fine-tuning — переписать книгу заново. LoRA — вклеить в книгу тонкую тетрадку с вашими рецептами. Книга осталась той же, но теперь в ней есть ваши страницы. Тетрадка весит мало, вклеивается быстро и для каждого нового повара (сценария) можно сделать свою тетрадку.
Сколько диалогов нужно для обучения эмпатичной нейроподруги?
От 3 000 до 10 000 размеченных диалогов. Это не обязательно должны быть записи реальных пользователей — эффективен синтетический датасет, сгенерированный большой моделью и отфильтрованный человеком. Качество разметки (human rating по шкале эмпатии) важнее количества: 5 000 диалогов с хорошей разметкой работают лучше 20 000 без неё.
Узнайте, как работает эмпатия на практике — напишите Катюше
Написать Катюше → @katya_friendship_bot