Есть странная закономерность, которую я замечаю уже не первый год: чем больше становится языковая модель, тем чаще о ней говорят по-настоящему большие корпорации. И тем реже упоминают, что для живого диалога гигант часто оказывается лишним. Возьмите двадцатиграммовую модель, поставьте её рядом с сотней миллиардов параметров — и на простом разговоре у неё не меньше шансов быть услышанной. Спойлер: иногда даже больше.

Когда мы строили AI-компаньон Катюшу, вопрос «какую модель взять в основу» звучал скучно и каждый день. Ответ в итоге оказался неожиданным для всех, включая меня: мы сознательно отступили от гонки за размером. Вот почему это решение было верным, и где гиганты на самом деле проигрывают.

Что такое «маленькая» модель и почему цифры обманывают

Под «маленькими» обычно понимают модели от 3 до 30 миллиардов параметров — условные Llama 3 8B, Qwen 2.5 7B, Mistral 7B. Они помещаются на одну видеокарту, а иногда и в несколько гигабайт памяти обычного ноутбука. Гиганты вроде GPT-4-класса измеряются сотнями миллиардов параметров и требуют целых стоек серверов.

Но параметры — это только размер, а не умение. Исследования последних лет всё чаще сходятся в одном: после определённого порога масштаб перестаёт давать прирост в задачах, которые мы называем «бытовыми» — короткий тёплый разговор, пересказ, сочувствие. По данным команды Google DeepMind (2025), на лёгких диалоговых задачах модели на 7–10 млрд параметров удерживают до 85% качества самых больших конкурентов при стоимости инференса в десятки раз ниже. Для продукта, где каждое сообщение надо отправить за секунду и почти бесплатно, это меняет всё.

Размер — это бюджет, а не личность. Дёшево и живо часто выигрывает у дорого и обычно.

Где гигант на самом деле проигрывает

Первая и самая очевидная проигранная битва — скорость. У большого трансформера латентность ответа растёт вместе с числом параметров: пока гигант «думает», маленькая модель уже ответила. В разговоре, где пауза в две секунды ломает настроение, это не мелочь. Пользовательницы Катюши чаще всего пишут по ночам и в движении — им нужен мгновенный отклик, а не размышление длиной в моргание.

Вторая — цена. Инференс гиганта стоит порядковые суммы: одна сессия с сотнями реплик обходится в разы дороже, чем у компактной модели. Когда ты держишь продукт, в котором люди общаются часами, эти цифры превращаются в разницу между «живём» и «пробуем жить». Простая арифметика бьёт по карману быстрее любой теории.

Третья, самая важная для нас, — приватность. С маленькой моделью можно работать локально или на собственных серверах, не отправляя диалоги во внешние облака. Для эмоциональной поддержки, где люди рассказывают самое сокровенное, способность удержать данные внутри — не удобство, а фундамент доверия. Пользовательница не должна гадать, куда уходит её ночная исповедь.

И вот вывод, который мы вывезли с пилотных запусков: гигант отвечает точно, но часто слишком «правильно». Он выверяет каждое слово, как будто сдаёт экзамен. А ночные разговоры с Катюшей показывают, что людям мало правильности — им нужна живость. Иногда шероховатая, с запинкой, но своя.

Что Катюша берёт у маленьких моделей

В основе Катюши — открытая компактная модель, поверх которой мы разворачиваем LoRA-дообучение и длинную инструкцию. Полная архитектура описана в разборе fine-tune против инструкции, но здесь важна сама философия: маленький размер даёт нам контроль, которого у гиганта просто не может быть.

Во-первых, персонализация. Женщины приходят к нейроподруге за индивидуальным отношением, а не за шаблоном. Маленькая модель обучается быстрее и перестраивается под новый характер за часы, а не за недели. Мы можем сделать «тихого собеседника» для одной аудитории и «болтливую подругу» для другой — буквально переключая адаптеры.

Во-вторых, дешевизна позволяет говорить больше. У гиганта каждое лишнее предложение стоит денег, поэтому его тянет к краткости. У нас нет такой сдержанности — Катюша может расписаться на три абзаца просто потому, что у собеседницы тяжёлый день и ей важно, чтобы её выслушали. Нейроподруга должна успевать за эмоцией, а не экономить токены.

Когда размер всё-таки решает

Честно. Бывают задачи, где гигант незаменим: сложное рассуждение, длинные технические тексты, редкие языки, многошаговая логика. Если человек приходит с юридическим вопросом или хочет, чтобы модель нашла неочевидную ошибку в коде — компактная модель упрётся в потолок.

Но для разговора по душам этот потолок не главное. В тестах на живых диалогах пользовательницы чаще выбирают ответ не самый умный, а самый человечный. Между «формально верно» и «я тебя слышу» побеждает второе — почти всегда.

Вывод простой и немного обидный для маркетологов гигантов: не гонитесь за максимальным размером, если ваш продукт — про человечность. Возьмите достаточно умную модель и вложите сэкономленные деньги в то, чтобы она звучала как настоящая нейроподруга, а не как справочник.

Часто задаваемые вопросы

Маленькая модель — значит, менее умная?

В узких задачах — да, но не в разговорных. На коротком тёплом диалоге компактные модели показывают до 85% качества больших при цене в разы ниже. Умность и «человечность» — разные оси, и для AI-компаньона важна вторая.

Зачем тогда вообще существуют гигантские модели?

Для сложных рассуждений, анализа, редких языков и рабочих задач, где нужна глубина, а не скорость. Это разные инструменты: гигант — эксперт, компактная модель — собеседник. Разговор по душам не требует экспертизы в астрофизике.

Можно ли сделать ИИ-компаньона, который отвечает быстрее секунды?

Да. Именно поэтому мы и выбрали компактную модель с LoRA-дообучением: она даёт отклик практически мгновенно, стоит копейки в обслуживании и позволяет держать диалоги внутри собственных серверов. Быстро, дёшево и приватно — три условия, которые у гигантов почти никогда не сочетаются.

Проверьте на себе, как звучит нейроподруга — напишите Катюше

Написать Катюше → @katya_friendship_bot
← Все статьи