Денис Лузиков@deni_vitoБесплатный разбор

Голосовой ИИ-агент: где он ломается

Коротко

Голосовой агент — это связка из трёх частей: распознавание речи, языковая модель и синтез голоса. Он справляется с короткими предсказуемыми разговорами: подтвердить запись, напомнить о визите, собрать данные для заявки. Ломается там, где клиент перебивает, злится или говорит нестандартно. Голос дороже переписки: к оплате модели добавляются распознавание и синтез, считаемые по минутам.

Интерес к голосовым агентам растёт вместе с качеством синтеза речи: голос перестал звучать как робот из нулевых, и бизнес снова начал смотреть в эту сторону.

Выдача по запросу состоит из лендингов компаний, которые голосовых агентов продают. Это не делает их тексты плохими, но объясняет, чего в них нет: разбора, где голос ломается и когда он не нужен вовсе.

Начнём с устройства, потому что почти все ограничения растут именно оттуда.

Из чего это собрано

Голосовой агент — не одна программа, а цепочка из четырёх звеньев.

Что происходит за одну реплику
ТелефонияПринимает или совершает звонок
РаспознаваниеРечь клиента → текст
МодельРешает, что ответить
СинтезТекст ответа → голос
Клиент слышитЧерез 1–2 секунды после паузы
В переписке звеньев два: сообщение и модель. В голосе — четыре, и каждое добавляет задержку и свою вероятность ошибки.

Что из этой схемы следует. Все проблемы голосовых агентов растут из двух добавленных звеньев. Распознавание может услышать не то. Синтез добавляет время. И оба работают в реальном времени, где нельзя подумать лишнюю секунду.

Звено 1. Распознавание речи

Превращает звук в текст. Качество зависит от линии, фонового шума, дикции и от того, встречаются ли в разговоре редкие слова: названия товаров, фамилии, адреса.

Что здесь ломается: артикулы и названия распознаются хуже всего. «Модель ЭйБиСи двести сорок» превращается в набор, который модель дальше честно пытается понять.

Как лечат: словарь ожидаемых слов. Если система знает список ваших товаров и городов, точность резко растёт.

Звено 2. Языковая модель

Тот же механизм, что в текстовом агенте: разбирает смысл, обращается к вашим системам, формулирует ответ. Как устроен агент в целом — в статье что такое ИИ-агент.

Отличие от переписки одно, но важное: ответ должен быть коротким. Реплика на четыре предложения, которую в чате пробегают глазами, в разговоре звучит бесконечно. Клиент перебивает на середине — и агент должен это выдержать.

Звено 3. Синтез речи

Превращает ответ в голос. Современный синтез звучит естественно, и это главное, что изменилось за последние годы.

Что здесь ломается: ударения в редких словах и названиях, интонация в вопросах, паузы в длинных числах. Номер заказа из двенадцати цифр, произнесённый без пауз, не воспринимается на слух.

Звено 4. Телефония

Связывает всё с реальной линией. От неё зависит качество звука и то, как быстро агент подхватывает звонок.

Главная проблема голоса: время

В переписке пауза в две секунды незаметна. В разговоре это провал, после которого человек говорит «алло?».

Складывается задержка из всей цепочки: распознать сказанное, дождаться конца фразы, обратиться к модели, дождаться ответа, синтезировать голос. Каждое звено — доли секунды, вместе получается ощутимо.

Что происходитПочему занимает время
Ожидание конца фразыСистема должна понять, что человек договорил
РаспознаваниеОбработка записанного фрагмента
Обращение к системамПосмотреть заказ, проверить слот
Ответ моделиТем дольше, чем длиннее ответ
Синтез голосаПропорционально длине реплики

Что из этого следует для сценария. Голосовому агенту нельзя давать задачи, требующие долгих обращений к внешним системам во время разговора. Если проверка статуса занимает три секунды, разговор рассыпается. Данные должны быть под рукой заранее.

Какие звонки можно отдавать

Пройдёмся по порядку: где голос работает предсказуемо.

Исходящие напоминания. Напомнить о визите, о записи, о платеже. Разговор короткий, сценарий понятный, клиент ждёт такого звонка. Самый благодарный сценарий из всех.

Подтверждение и перенос записи. «Ваша запись завтра в 15:00, подтверждаете?» Три варианта ответа, каждый обрабатывается.

Сбор данных для заявки. Адрес, удобное время, тип услуги. Разговор структурированный, ошибки видны сразу.

Опрос после покупки. Оценка, короткий комментарий. Нет цены ошибки: если клиент не захотел говорить, ничего не потеряно.

Первичная маршрутизация входящих. Понять, зачем человек звонит, и перевести на нужный отдел — вместо меню с восемью пунктами.

Голос справляется
  • Короткий предсказуемый диалог
  • Мало вариантов развития
  • Низкая цена ошибки
  • Клиент ожидает звонка
  • Данные известны заранее
Голос не справляетсяЗдесь нужен человек
  • Переговоры и торг
  • Недовольный клиент
  • Сложный продукт с вариантами
  • Разговор с пожилым человеком
  • Всё, что требует сочувствия
Граница проходит не по сложности задачи, а по предсказуемости разговора: чем больше ветвлений, тем хуже держится голос.

Где ломается: пять честных сценариев

То, о чём не пишут продавцы решений.

Клиент перебивает. Живой человек перебивает постоянно. Агент должен уметь остановиться на середине фразы и начать слушать. Это техническая возможность, которую надо специально закладывать, и она есть не везде.

Шум и плохая линия. Клиент в машине, на улице, в цехе. Распознавание падает, агент переспрашивает, клиент раздражается.

Нестандартная формулировка. Вместо «да» человек говорит «ну давайте», вместо «нет» — «я подумаю ещё». Текстовый бот увидит это и разберётся, голосовой получит расшифровку с искажениями и справится хуже.

Эмоции. Раздражённый клиент говорит быстрее, сбивчивее, перебивает. Именно в этот момент агент справляется хуже всего — а именно тогда важнее всего не потерять человека.

Ожидание живого голоса. Есть аудитория, для которой автоматический звонок сам по себе раздражитель. Пожилые клиенты, дорогие услуги, сложные ситуации.

Сколько это стоит

Здесь голос отличается от переписки принципиально, и это надо понимать до начала.

СтатьяКак считаетсяЕсть ли в переписке
Телефонияпо минутамнет
Распознавание речипо минутам аудионет
Синтез голосапо символам или минутамнет
Языковая модельпо токенамда
Разработка сценарияразовода
Отладкадольше, чем в текстеда

Ключевое отличие: три из шести строк считаются по минутам разговора. Значит стоимость растёт не от числа обращений, а от длительности. Разговор на четыре минуты стоит вчетверо дороже минутного, даже если полезного в нём столько же.

Что из этого следует: экономика голосового агента улучшается, когда разговор короткий. Отсюда правило проектирования — сценарий должен вести к цели за минимум реплик, а не «поддерживать беседу».

Часть по модели считается так же, как в текстовом агенте: по токенам, где один токен в русском тексте — это 3–4 символа. Порядок цифр и способ расчёта разобраны в статье про то, сколько стоит ИИ-агент.

Почему сначала текст, потом голос

Правило, которое экономит больше всего денег.

Голосовой агент — это текстовый агент плюс два дополнительных звена. Если текстовый сценарий не работает, добавление распознавания и синтеза его не починит: наоборот, к логическим проблемам добавятся ошибки распознавания.

Правильный порядок
  1. 1
    Собрать сценарий в перепискеТам дёшево и видно каждую ошибку
  2. 2
    Довести до рабочего состоянияПроверить на реальных клиентах
  3. 3
    Проверить длину репликТо, что читается, не всегда слушается
  4. 4
    Добавить голосовой слойРаспознавание, синтез, телефония
  5. 5
    Отладить паузы и перебиванияЭто отдельная работа, и она долгая
Третий шаг обычно пропускают: реплики, нормальные в чате, в разговоре звучат как лекция, и их приходится переписывать целиком.

Входящие и исходящие: две разные задачи

Их часто смешивают, а требования у них противоположные.

Исходящие звонкиНачинать стоит отсюда
  • Вы задаёте тему разговора
  • Сценарий предсказуем
  • Данные известны заранее
  • Можно звонить в удобное время
  • Отказ не критичен
Входящие звонкиСложнее в разы
  • Тему задаёт клиент
  • Может позвонить с чем угодно
  • Часто звонят с проблемой
  • Ожидание ответа здесь и сейчас
  • Ошибка стоит клиента
В исходящих агент ведёт разговор, во входящих — догоняет. Поэтому первые запускают за недели, а вторые доводят месяцами.

Практическая рекомендация. Если хочется голос, начинайте с исходящих напоминаний. Там результат виден сразу, сценарий короткий, а недовольство клиента маловероятно: ему просто напомнили о записи.

Входящие имеет смысл отдавать агенту только после того, как отработана маршрутизация: понять тему обращения и перевести на нужного человека — уже полезно и гораздо безопаснее, чем пытаться закрыть вопрос целиком.

Что должно быть в сценарии обязательно

Пять элементов, без которых голосовой агент раздражает даже при хорошем распознавании.

Обязательные элементы
  1. 1
    Представление в первой фразеКто звонит и зачем — до того, как задан первый вопрос
  2. 2
    Честное «я ассистент»Маскировка раскрывается и злит сильнее, чем робот
  3. 3
    Быстрый переход на человекаПо первой же просьбе, без уговоров
  4. 4
    Обработка молчанияЧто делать, если клиент не отвечает три секунды
  5. 5
    Понятное завершениеЧем закончился разговор и что будет дальше
Третий пункт проверяется первым делом: агент, который не отдаёт разговор человеку по просьбе, гарантированно принесёт жалобы.

Про первую фразу отдельно. У голосового звонка есть три-четыре секунды, за которые человек решает, слушать или класть трубку. Если за это время не прозвучало, кто звонит и по какому поводу, дальше сценарий уже не важен.

Как проверить агента перед запуском

Голос проверяется иначе, чем переписка: часть проблем слышна только на слух.

Прослушать двадцать разговоров целиком. Не расшифровки, а записи. В тексте не видно ни задержек, ни неестественных пауз, ни неправильных ударений.

Проверить на плохой линии. Позвонить из машины, из шумного места, с плохим сигналом. Именно так будет звонить половина клиентов.

Перебить агента. Специально начать говорить в середине его реплики. Если он продолжает говорить как ни в чём не бывало — сценарий не готов.

Сказать что-то за рамками сценария. Задать вопрос, которого нет в логике. Агент должен передать человеку, а не выкручиваться.

Замерить длину разговора. Если типовой диалог занимает четыре минуты вместо полутора, экономика ухудшается втрое — и часто это лечится сокращением реплик.

ПроверкаЧто выявляетКак часто пропускают
Прослушивание записейПаузы, ударения, интонациюЧасто
Плохая линияРеальное качество распознаванияПочти всегда
ПеребиваниеГотовность к живому разговоруПочти всегда
Вопрос вне сценарияРаботает ли передача человекуИногда
Длина разговораЭкономику всего проектаЧасто

Юридическая и этическая сторона

Три вещи, которые стоит решить до запуска обзвона.

Согласие на звонки. Автоматический обзвон базы — это не то же самое, что звонок менеджера. Основания для связи с человеком и наличие его согласия стоит проверить с юристом до того, как система наберёт первый номер.

Запись разговора. Если разговор записывается, об этом принято предупреждать в начале. Плюс запись — это данные, у которых должен быть срок хранения.

Честность про машину. Отдельно от закона: практика показывает, что прямое «вас приветствует ассистент» вызывает меньше негатива, чем попытка выдать агента за сотрудника. Раскрытие обмана обходится дороже, чем изначальная честность.

Когда голос не нужен

Список случаев, где те же деньги дадут больше в другом месте.

Клиенты пишут, а не звонят. Если основной канал — мессенджеры, вкладываться в голос странно. Посмотрите, откуда реально приходят обращения.

Мало звонков. Голос дороже переписки на старте и в обслуживании. При двадцати звонках в день выгоднее нанять человека или закрыть поток текстом.

Каждый звонок уникален. Консалтинг, сложные B2B-продажи, ситуации с эмоциями. Голосовой агент здесь скорее навредит.

Нет данных под рукой. Если для ответа нужно лезть в три системы, задержка убьёт разговор. Сначала интеграции, потом голос.

Текстовый сценарий ещё не работает. Самый частый случай. Голос не чинит логику, он добавляет к ней проблемы.

Сроки внедрения

Реалистичные, а не рекламные.

ЭтапСрокЧто занимает время
Текстовый сценарий1–2 неделиЛогика и база ответов
Подключение телефониинесколько днейДоступы и настройка
Распознавание и синтезнесколько днейПодбор голоса, словарь терминов
Отладка на реальных звонках2–4 неделиПаузы, перебивания, краевые случаи
Выход на потокпостепенноЧасть звонков, потом расширение

Где сроки обычно уезжают: последняя строка. Голосовой агент, запущенный сразу на весь поток, даёт всплеск жалоб, после которого проект обычно и закрывают. Постепенный вывод — не осторожность, а способ дожить до результата.

Голосовой агент против старого автоответчика

Меню «нажмите один для отдела продаж» знакомо всем и всех раздражает. Разберём, чем принципиально отличается новый подход.

Меню с кнопкамиГолосовой агент
Как отвечает клиентНажимает цифрыГоворит словами
Что понимаетТолько предусмотренные вариантыСвободную формулировку
Что делаетПереводит по веткамОтвечает, уточняет, действует
Когда ломаетсяВопрос не подходит ни под один пунктКлиент говорит нестандартно или перебивает
РаздражаетДлиной менюЗадержкой и роботичностью

Главное отличие в одной фразе: меню заставляет клиента подстраиваться под вашу структуру, агент подстраивается под клиента. Человек говорит «у меня не работает заказ, который вчера пришёл» — и не должен угадывать, это второй пункт или четвёртый.

Честная оговорка: для простой маршрутизации из трёх вариантов меню быстрее и надёжнее. Агент выигрывает там, где вариантов много или где клиент всё равно не понимает, в какую категорию попадает его вопрос.

Разбор одного разговора

Абстракции заканчиваются на конкретике. Типовой исходящий звонок — напоминание о записи.

Агент: Здравствуйте! Это ассистент клиники «Ромашка», звоню напомнить: вы записаны на завтра, на пятнадцать ноль-ноль, к терапевту. Всё в силе?

За кадром: представился, назвал компанию и повод за пять секунд. Данные о записи подставлены заранее — во время разговора никуда не ходим.

Клиент: Ой, а можно перенести? Я завтра не смогу.

Агент: Конечно. Есть свободное время в четверг в одиннадцать и в пятницу в шестнадцать тридцать. Что удобнее?

За кадром: слоты подгружены до звонка. Вариантов ровно два — не список из десяти, который на слух не удержать.

Клиент: Давайте в пятницу.

Агент: Записал вас на пятницу, шестнадцать тридцать. Пришлю подтверждение сообщением. Хорошего дня!

За кадром: перенёс запись, отправил подтверждение в мессенджер, завершил разговор.

Что здесь сделано правильно. Разговор занял меньше минуты. Каждая реплика агента — одно-два предложения. Вариантов ответа немного. Данные были готовы заранее. Подтверждение продублировано текстом — то, что произнесено голосом, забывается.

Чего агент не делал. Не уговаривал, не предлагал дополнительные услуги, не выяснял причину отказа. Всё это удлиняет разговор и увеличивает шанс, что что-то пойдёт не по сценарию.

Готовая платформа или своя разработка

Как и везде, развилка, и в голосе она острее из-за цены ошибки.

Готовая платформаБыстрый старт
  • Телефония, распознавание и синтез уже связаны
  • Типовые сценарии из коробки
  • Запуск за недели
  • Логика ограничена их конструктором
  • Записи разговоров хранятся у них
Своя сборкаКогда сценарий нетиповой
  • Любая логика и любые интеграции
  • Выбор каждого компонента отдельно
  • Данные под вашим контролем
  • Дороже и дольше
  • Отладка целиком на вас
Для напоминаний и подтверждений платформа обычно достаточна. Своя сборка нужна там, где агент должен глубоко ходить в ваши системы.

Разумный порядок: собрать первый сценарий на готовой платформе, убедиться, что клиенты нормально реагируют на голос, и только потом решать, нужна ли своя сборка. Ошибка в обратную сторону дороже: месяцы разработки ради сценария, который аудитория не приняла.

Как измерять результат

Голос даёт метрики, которых нет в переписке, и смотреть надо именно на них.

МетрикаЧто показываетТревожный признак
Доля дослушавших до концаПринимают ли клиенты форматМеньше половины бросают трубку
Средняя длина разговораЭкономику проектаРастёт от месяца к месяцу
Доля переводов на человекаГраницы сценарияСлишком мало — агент не отдаёт разговор
Доля достигнутых целейРади чего звонилиНиже, чем у живого обзвона
Повторные обращения после звонкаПонял ли клиент, о чём речьЛюди перезванивают уточнить

Последняя строка — самая недооценённая. Если после звонка агента клиент перезванивает в компанию с тем же вопросом, автоматизация не сэкономила, а добавила работы. Это видно только при сопоставлении звонков агента с входящим потоком.

Что сравнивать. Правильная база сравнения — не «до автоматизации вообще», а тот же сценарий, выполненный людьми. Если раньше напоминания не делались вовсе, любой результат выглядит победой, и это мешает увидеть проблемы.

Отраслевые сценарии: где голос прижился

Не рекламный список, а те области, где формат совпадает с привычками аудитории.

Медицина и услуги по записи. Напоминания о визите, подтверждение, перенос. Люди привыкли, что из клиники звонят, и воспринимают это спокойно. Снижение неявок — измеримый результат.

Логистика и доставка. Подтвердить адрес, согласовать интервал, предупредить об опоздании. Разговор короткий, цель ясная.

Финансовые напоминания. Ранняя просрочка, продление подписки. Работает, но требует особой аккуратности в формулировках: тема чувствительная.

Опросы после обслуживания. Оценка качества, короткий комментарий. Голосом отвечают охотнее, чем заполняют формы.

Реактивация базы. Обзвон старых клиентов с конкретным поводом. Здесь важно именно наличие повода: звонок «просто напомнить о себе» раздражает.

Где голос не прижился: сложные консультации, продажа дорогих услуг, техподдержка с диагностикой. Везде, где разговор ветвится непредсказуемо. Общая закономерность здесь простая и устойчивая: чем дороже и сложнее то, о чём идёт разговор, тем выше у клиента ожидание именно живого собеседника — и тем дороже обходится попытка это ожидание обмануть.

Что нужно от компании до старта

Голосовой агент требует большей подготовки, чем текстовый, и часть её невозможно переложить на подрядчика.

Что подготовить
  1. 1
    Список сценариевКакие именно звонки отдаём и с какой целью
  2. 2
    Данные под рукойВсё, что понадобится в разговоре, — заранее, а не запросом во время
  3. 3
    Словарь терминовНазвания товаров, услуг, районов — для распознавания
  4. 4
    Границы полномочийЧто агент говорит сам, чего не говорит никогда
  5. 5
    Правила передачи человекуВ каких случаях и кому именно
  6. 6
    Тексты репликКороткие, произносимые вслух, без канцелярита
Шестой пункт кажется мелочью, а на деле переписывается по три раза: фраза, отлично выглядящая на бумаге, часто звучит неестественно.

Про второй пункт подробнее. Это самое частое техническое ограничение. Если во время разговора агент должен сходить в вашу систему за статусом заказа, и запрос идёт три секунды, разговор ломается. Решение — готовить данные заранее: перед обзвоном выгрузить всё, что понадобится.

Про третий. Распознавание речи гораздо лучше справляется, когда знает, чего ожидать. Список ваших услуг, названий и районов города даёт заметный прирост точности без всякой доработки моделей.

Требования к телефонии

Техническая часть, которую обычно обнаруживают в середине проекта.

ТребованиеЗачемЧто если нет
Возможность подключить роботаАгент должен получать и отдавать аудиопотокПридётся менять телефонию
Приемлемое качество линииРаспознавание падает на плохом звукеПоловина разговоров не состоится
Определение конца репликиПонять, что человек договорилАгент будет перебивать или тормозить
Перевод на живого сотрудникаКлючевая функция сценарияАгент станет тупиком
Запись разговоровДля отладки и разбораНе на чем учиться

Что обычно всплывает. Старая телефония либо не умеет отдавать поток в реальном времени, либо делает это с задержкой. Это выясняется на этапе подключения и способно сдвинуть весь проект — поэтому проверять совместимость нужно до начала работ, а не после.

Как голос работает с базой знаний

Отдельный разговор, потому что требования здесь жёстче, чем в переписке.

В тексте агент может дать развёрнутый ответ, и человек его прочитает. В голосе тот же ответ превращается в монолог на полминуты, который никто не дослушает.

Что из этого следует:

  • Ответы должны быть короче. Одна мысль в реплике, максимум две.
  • Списки не работают. Пять вариантов, произнесённых подряд, не удерживаются в памяти. Максимум два-три, а лучше уточняющий вопрос.
  • Числа требуют осторожности. Длинные номера, адреса и суммы лучше дублировать сообщением.
  • Сложное лучше не пересказывать. Если ответ занимает абзац, правильнее сказать «отправлю подробности сообщением» и передать текстом.

Как устроен слой поиска по документам, разобрано в статье про RAG — механизм тот же, отличаются только требования к длине ответа.

Частые ошибки внедрения

Шесть, которые встречаются почти в каждом первом проекте.

Агент пытается изображать человека. Даёт имя, «эмоции», уходит от вопроса «вы робот?». Раскрытие обмана обходится дороже, чем изначальная честность, а раскрывается оно почти всегда.

Реплики написаны для чтения. «В соответствии с условиями предоставления услуги вам необходимо…» — на бумаге привычно, вслух невыносимо. Тексты надо проговаривать вслух при написании.

Нет обработки тишины. Клиент отвлёкся, молчит четыре секунды. Агент либо ждёт вечно, либо кладёт трубку. Оба варианта плохи, нужен третий: переспросить.

Слишком много вариантов в одной реплике. «Вам удобно в понедельник, вторник, среду, четверг или пятницу?» — человек запомнит последний.

Обзвон без повода. Звонок «мы решили вам напомнить о себе» раздражает и в исполнении человека, и в исполнении машины. Нужен конкретный повод: запись, доставка, срок, изменение.

Запуск сразу на всю базу. Ошибки в сценарии умножаются на объём. Начинать надо с небольшой части и слушать записи.

Считаем экономику на примере

Посчитаем на конкретных числах, чтобы было понятно, как складывается стоимость.

Возьмём напоминания о записи: тысяча звонков в месяц, средняя длина разговора — минута.

Что считаемКакЗамечание
Телефония1 000 минутПо вашему тарифу
Распознавание~1 000 минут аудиоСчитается по длительности
Синтезпо объёму произнесённогоРеплик агента меньше, чем всего разговора
Модель~1 000 коротких диалоговСамая дешёвая часть
РазработкаразовоОсновные вложения

Наблюдение, которое меняет проектирование. Модель — наименьшая статья расходов: короткий диалог занимает мало токенов, а токены дёшевы. Основной счёт формируют минуты. Поэтому сокращение разговора с двух минут до одной снижает стоимость почти вдвое, а на качестве не сказывается — наоборот, короткий разговор приятнее.

Что сравнивать с этим. Тысяча звонков-напоминаний руками — это несколько полных рабочих дней сотрудника. Если раньше напоминания не делались вовсе, считать надо не экономию, а результат: сколько неявок предотвращено.

Когда лучше вложиться в переписку

Прямое сравнение, потому что бюджет обычно один.

ГолосКогда клиент не пишет
  • Аудитория старшего возраста
  • Срочные и выездные услуги
  • Напоминания, которые важно донести
  • Дороже в разработке и в минутах
ПерепискаВ большинстве случаев
  • Дешевле на порядок
  • Клиент отвечает, когда удобно
  • Можно отправить ссылку и файл
  • Ошибки видны и исправимы
Если аудитория пишет в мессенджерах, деньги, вложенные в голос, почти всегда дали бы больше в переписке.

Практический тест. Посмотрите, откуда за последний месяц приходили обращения. Если восемьдесят процентов — из мессенджеров и с сайта, начинать с голоса не стоит: вы будете автоматизировать канал, которым почти не пользуются.

Второй тест, для исходящих. Возьмите список того, что вы сообщаете клиентам сами: напоминания, подтверждения, статусы. Если раньше это не делалось вообще из-за нехватки рук, голос окупится почти наверняка — сравнивать будет не с чем, любой результат станет приростом. Если это уже делается сообщениями и доходит, голос добавит расходов без нового результата.

Что происходит через полгода

То, о чём узнают уже в процессе эксплуатации.

Клиенты привыкают. Первое время автоматический звонок вызывает удивление, потом становится обычным делом. Негатив, который был на старте, обычно снижается — если агент честно представляется и не пытается изображать человека.

Сценарий обрастает исключениями. Каждый месяц находится ситуация, которую не предусмотрели. Через полгода сценарий вдвое сложнее исходного, и его надо периодически пересматривать целиком, а не только дополнять.

Растёт длина разговоров. Добавили уточнение здесь, вежливую формулировку там — и минутный разговор стал двухминутным, а счёт вырос вдвое. Длину нужно контролировать так же, как расходы.

Меняется качество распознавания. Модели обновляются, и это чаще хорошо, но проверять после обновления нужно обязательно: изменившееся поведение на ваших специфических словах заметно не сразу.

Появляется вопрос про второй язык. Если среди клиентов есть говорящие на другом языке, это отдельная работа, а не переключатель в настройках.

Голос и мессенджеры вместе

Схема, которая на практике работает лучше, чем каждый канал по отдельности, и о которой редко думают заранее.

Идея простая: голос доносит, текст фиксирует. Всё, что человек должен запомнить или сохранить, дублируется сообщением.

Как это выглядит. Агент звонит и напоминает о записи. Клиент переносит время. Сразу после разговора приходит сообщение: новое время, адрес, ссылка на маршрут, кнопка для отмены.

Что это даёт. Голос решает задачу «дозвониться и получить ответ» — с ним не сравнится ни одно сообщение, которое можно не прочитать. Текст решает задачу «не забыть детали» — их невозможно удержать на слух.

Обратный порядок тоже работает. Сообщение уходит первым, и только тем, кто не отреагировал за сутки, звонит агент. Так снижается и стоимость, и раздражение: звонок получают только те, до кого не дошли дешёвым способом.

Комбинированный сценарий
  1. 1
    Сообщение в мессенджерСамый дешёвый канал, отправляем первым
  2. 2
    Ждём реакции суткиБольшая часть ответит здесь
  3. 3
    Звонок тем, кто молчитГолос только там, где текст не сработал
  4. 4
    Итог сообщениемДоговорённости дублируем текстом
Такая последовательность снижает число звонков в несколько раз — и вместе с ними стоимость всего сценария.

Что для этого нужно. Связка мессенджера и телефонии в одном сценарии и общая история клиента: агент должен знать, что человеку уже писали и что он не ответил. Без этого получится два независимых канала, которые дублируют друг друга и раздражают вдвойне.

Короткий вывод

Если убрать детали, всё сводится к трём утверждениям.

Первое. Голосовой агент — это текстовый агент плюс два звена, каждое из которых добавляет задержку и ошибки. Поэтому сценарий всегда сначала отрабатывается в переписке.

Второе. Голос работает на коротких предсказуемых разговорах и ломается там, где нужны гибкость, эмоции или долгие обращения к системам. Граница проходит по предсказуемости, а не по сложности.

Четвёртое, и оно важнее остальных. Голос стоит начинать только после того, как посмотрели, каким каналом клиенты пользуются на самом деле. Автоматизировать телефон в бизнесе, где восемьдесят процентов обращений приходит в мессенджеры, — самая дорогая из типовых ошибок: деньги уходят в канал, которым почти не пользуются, а очевидные улучшения в переписке остаются несделанными.

Третье. Экономика голоса считается по минутам, а не по обращениям. Значит проектировать надо не «хороший разговор», а самый короткий путь к цели — это одновременно дешевле и приятнее клиенту.

Что делаю я

Первый вопрос у меня всегда один: нужен ли вам голос вообще. Смотрю, откуда приходят обращения и какие звонки повторяются. Обычно оказывается, что половина звонков — это «где мой заказ», и закрывается она уведомлением в мессенджере, а не разговором с роботом.

Если голос действительно нужен, делаю ИИ-агентов целиком: сначала текстовый сценарий, потом голосовой слой, подключение телефонии, отладка на реальных звонках. Начинаем с исходящих напоминаний — там результат виден быстрее всего. Если вижу, что задача закрывается чат-ботом в переписке, говорю об этом прямо: голос дороже, и платить за него без нужды незачем.

Где заканчивается разбор и начинается ваша телефония

Понять устройство — половина дела. Вторая половина в том, какие именно звонки у вас есть и сколько из них укладываются в короткий предсказуемый сценарий. Расскажите, что за звонки и сколько их в день, — скажу честно, окупится ли голос в вашем случае или те же деньги дадут больше в переписке.

Денис Лузиков
Денис ЛузиковРазработчик ИИ-агентов и чат-ботов

5 лет работаю с ИИ, 120+ проектов в разных нишах. Четыре продукта в Telegram, которые можно открыть и попробовать прямо сейчас, — суммарно 477 016 пользователей в месяц. Разработку веду сам, без агентства.

Вопросы

Частые вопросы

Из чего состоит голосовой ИИ-агент

Из трёх частей плюс телефония. Распознавание превращает речь клиента в текст, языковая модель решает, что ответить, синтез превращает ответ обратно в голос. Телефония связывает всё это с реальным звонком. Каждая часть добавляет задержку и свою вероятность ошибки — поэтому голос сложнее и дороже переписки.

Какие звонки можно отдать голосовому агенту

Короткие и предсказуемые: подтвердить запись, напомнить о визите, уточнить адрес доставки, собрать данные для заявки, опросить после покупки. Общее у них — мало вариантов развития разговора и низкая цена ошибки. Переговоры, работу с недовольным клиентом и продажу сложного продукта отдавать нельзя.

Отличит ли клиент голосового агента от человека

Чаще всего да, и это нормально. Синтез речи стал заметно лучше, но задержка перед ответом, отсутствие живой реакции на перебивание и слишком ровная интонация выдают машину. Рабочая практика — не маскироваться, а сразу говорить, что звонит ассистент, и быстро переводить на человека по просьбе.

Почему голосовой агент дороже текстового

К оплате языковой модели добавляются распознавание речи и синтез голоса, а они считаются по минутам разговора, а не по количеству сообщений. Плюс голос требует более серьёзной отладки: паузы, перебивания, шум на линии и ошибки распознавания — проблемы, которых в переписке не существует.

С чего начать, если хочется голосового агента

С проверки сценария в переписке. Если бот не справляется с задачей текстом, в голосе он справится хуже: добавятся ошибки распознавания и давление реального времени. Когда текстовый сценарий работает, его переносят в голос — и начинают с исходящих напоминаний, где разговор короткий и предсказуемый.