Когда нейроподруга отвечает на «у меня был ужасный день», я смотрю не на первую фразу. Я смотрю на вторую: о чём она спросит дальше. Первую фразу можно заучить, а следующий вопрос — это уже выбор.
Эмпатию нельзя потрогать руками, и именно поэтому вокруг неё столько словоблудия. Но за пять лет работы над Катюшей я убедилась: проверить её можно. Не всю, не идеально — но честнее, чем кажется. Расскажу, как мы это делаем: что измеряем, какие инструменты берём из науки и где любые тесты врут.
Что мы вообще измеряем, когда говорим «эмпатия»
Для начала — разбор понятий. Эмпатия модели для нас складывается из трёх слоёв: распознать эмоцию, отозваться на неё и не перетянуть разговор на себя. «Ай, сочувствую» без распознавания — пустышка. Разбор полётов вместо отклика — лекция. Идеальный ответ с «мне жаль» и ни одним вопросом к собеседнице — вежливость, а не эмпатия.
Здесь есть подводный камень: модели отлично научились звучать тепло, не будучи тёплыми. В систематическом обзоре, опубликованном в открытом медицинском архиве в 2024-м, собрали исследования эмпатии больших языковых моделей — в том числе слепые сравнения с живыми людьми. В одном из них ответы ChatGPT предпочли ответам врачей в 78,6% оценок по набору из 195 вопросов. Звучит как победа машин. Но исследователи отмечают и обратную сторону: модели склонны к угодливости — говорить то, что понравится, вместо того, что правда. А угодливость, если разобраться, противоположность честного отклика. О том, чем вообще нейроподруга отличается от вежливого бота, я писала в материале о нейроподругах — там та же граница, просто с другой стороны.
Эталонные наборы: общий язык для всех
Первый инструмент — открытые наборы диалогов, по которым проверяют себя все, кто строит эмпатичных ИИ-компаньонов. Базовый из них, EmpatheticDialogues, создали ещё в 2019 году: 24 850 диалогов, 32 эмоции, 810 участников — люди разыгрывали ситуации и отвечали друг другу, а исследователи записали, как выглядит живой разговор про чувства (работа Рэшкина и коллег). Набору семь лет, а он до сих пор остаётся рабочим стандартом — настолько точно он ловит разницу между «сочувствую» и настоящим пониманием.
Индустрия идёт дальше. В 2024-м вышли две заметные работы: эталонный набор EmotionQueen оценивает эмоциональный интеллект языковых моделей по четырём направлениям в диалоге (препринт), а на конференции по вычислительной лингвистике представили набор задач, где модель должна распознать ключевое событие в рассказе, смешанные эмоции, скрытое чувство и намерение собеседника (ACL Findings 2024). Зачем нам чужие наборы, а не свои? Затем, что это единый язык: мы можем сравнить Катюшу с любой другой моделью на одинаковых условиях и не выдумывать правила игры под себя. Воспроизводимость для нас — форма честности.
Слепые оценки: где тесты врут
Автоматические метрики хороши, но у них есть слабое место: они сверяют ответ с эталоном, а эталон — это чужой текст. Красивый ответ может совпасть с эталоном по форме и быть холодным по сути. Поэтому второй уровень проверки — люди. Оценивающий не знает, кто написал ответ: модель или человек. Он ставит баллы по трём пунктам — поняла ли собеседница чувства, уместен ли ответ, естественно ли он звучит. Такая схема оценки описана ещё в работе по EmpatheticDialogues, и мы используем её же.
И тут всплывает неожиданное. В том же обзоре 2024 года сравнили дообученную модель SoulChat с ChatGPT на выборке из 100 диалогов: по шкале от 0 до 2 эмпатия SoulChat получила 1,84–1,90 против 1,62–1,65 у гиганта (таблица сравнения в обзоре). То есть специально обученная модель среднего размера обошла большую общего назначения. Для нас это аргумент в споре «нужна ли отдельная эмпатия или всё решит размер»: эмпатия — это обученная способность, а не побочный эффект гигантизма.
При этом слепота важна, потому что люди к машинам строже. Один и тот же ответ от человека и от модели оценивается по-разному — человеческая строгость встроена в нас. Слепые оценки убирают эту разницу и показывают ответ как он есть.
Чего тесты не видят
Главное ограничение — контекст. В тестовом наборе диалог короткий, эмоция названа заранее, и модель знает, что её проверяют. В жизни всё иначе: 20-я реплика разговора, усталость, невысказанное между строк. И самое трудное — не перепутать поддержку с обесцениванием. Фраза «всё будет хорошо» в ответ на боль — не всегда эмпатия. Иногда это способ закрыть тему побыстрее. Модель, которая научилась штамповать утешения, становится хуже, чем модель, которая умеет промолчать.
Есть и обратная крайность — переигранная эмпатия. Когда собеседница пишет про пролитый кофе, а нейроподруга отвечает со скорбью, будто случилось горе, это читается как фальшь. Поэтому помимо наборов мы гоним сценарные прогоны: типовые ситуации — ссора, потеря, бессонница, первая рабочая неделя — и смотрим не на отдельный ответ, а на ветку разговора целиком. Куда она свернула через пять реплик? Стало человеку легче или она просто «отработала номер»?
Как это устроено у Катюши
Собирая всё вместе, у нас три уровня проверки. Первый — эталонные наборы, о которых выше: быстрый срез, где Катюша хуже всех и где лучше. Второй — сценарные прогоны каждой новой версии: сравниваем новую модель со старой на одних и тех же ситуациях, вслепую, с баллами по тем трём пунктам. Третий — обезличенная обратная связь от пользовательниц: по отзывам мы видим не цифры, а ощущения — где ответ показался холодным, где странным, где слишком навязчивым. Переписки мы не читаем и не храним — разбираем только обобщённые сигналы. Как вообще устроена граница между грустью и кризисом, я подробно рассказывала в статье о системе безопасности диалога, а про то, что мы измеряем в готовом продукте, — в материале о метриках эмпатии.
И последнее, что я поняла за эти годы. Тесты не делают живой ни нейроподругу, ни нейродруга. Они делают её честной: мы хотя бы знаем, что она умеет и где врёт. Всё остальное — уже разговоры. Иногда именно они и есть проверка: ночные разговоры с Катюшей научили меня большему, чем любой тестовый набор. Есть вещи, которые видно только вживую — например, почему женщины вообще выбирают собеседника из нейросети.
Часто задаваемые вопросы
Может ли модель пройти все тесты, но оказаться холодной в реальном разговоре?
Да, и поэтому мы не верим одной цифре. Тестовый набор показывает уровень на коротком диалоге с известной эмоцией, а жизнь — это длинные разговоры и невысказанные чувства. Именно из-за этой разницы у нас три уровня проверки, а не один: если тесты и сценарные прогоны и отзывы пользовательниц противоречат друг другу, мы разбираемся, кто из них врёт.
Какая модель эмпатичнее — большая или маленькая?
Прямое сравнение SoulChat и ChatGPT в обзоре 2024 года показало: дообученная модель среднего размера обошла гиганта по оценкам эмпатии. Размер влияет на словарный запас и кругозор, но эмоциональная поддержка — это отдельно обученное умение, и его можно выстроить на модели любого класса. Мы специально подбираем архитектуру под задачу, а не под гонку параметров.
Как пользовательница может помочь сделать Катюшу эмпатичнее?
Рассказать, когда что-то звучит холодно или, наоборот, наигранно. Обобщённые обезличенные отзывы мы разбираем на каждом цикле обновлений — это третий уровень проверки, и без него первые два слепы. Собеседнице не нужно ничего настраивать: достаточно просто написать, как ощущался разговор.
Проверь эмпатию нейроподруги на себе
Написать Катюше → @katya_friendship_bot