Интерес к голосовым агентам растёт вместе с качеством синтеза речи: голос перестал звучать как робот из нулевых, и бизнес снова начал смотреть в эту сторону.
Выдача по запросу состоит из лендингов компаний, которые голосовых агентов продают. Это не делает их тексты плохими, но объясняет, чего в них нет: разбора, где голос ломается и когда он не нужен вовсе.
Начнём с устройства, потому что почти все ограничения растут именно оттуда.
Из чего это собрано
Голосовой агент — не одна программа, а цепочка из четырёх звеньев.
Что из этой схемы следует. Все проблемы голосовых агентов растут из двух добавленных звеньев. Распознавание может услышать не то. Синтез добавляет время. И оба работают в реальном времени, где нельзя подумать лишнюю секунду.
Звено 1. Распознавание речи
Превращает звук в текст. Качество зависит от линии, фонового шума, дикции и от того, встречаются ли в разговоре редкие слова: названия товаров, фамилии, адреса.
Что здесь ломается: артикулы и названия распознаются хуже всего. «Модель ЭйБиСи двести сорок» превращается в набор, который модель дальше честно пытается понять.
Как лечат: словарь ожидаемых слов. Если система знает список ваших товаров и городов, точность резко растёт.
Звено 2. Языковая модель
Тот же механизм, что в текстовом агенте: разбирает смысл, обращается к вашим системам, формулирует ответ. Как устроен агент в целом — в статье что такое ИИ-агент.
Отличие от переписки одно, но важное: ответ должен быть коротким. Реплика на четыре предложения, которую в чате пробегают глазами, в разговоре звучит бесконечно. Клиент перебивает на середине — и агент должен это выдержать.
Звено 3. Синтез речи
Превращает ответ в голос. Современный синтез звучит естественно, и это главное, что изменилось за последние годы.
Что здесь ломается: ударения в редких словах и названиях, интонация в вопросах, паузы в длинных числах. Номер заказа из двенадцати цифр, произнесённый без пауз, не воспринимается на слух.
Звено 4. Телефония
Связывает всё с реальной линией. От неё зависит качество звука и то, как быстро агент подхватывает звонок.
Главная проблема голоса: время
В переписке пауза в две секунды незаметна. В разговоре это провал, после которого человек говорит «алло?».
Складывается задержка из всей цепочки: распознать сказанное, дождаться конца фразы, обратиться к модели, дождаться ответа, синтезировать голос. Каждое звено — доли секунды, вместе получается ощутимо.
| Что происходит | Почему занимает время |
|---|---|
| Ожидание конца фразы | Система должна понять, что человек договорил |
| Распознавание | Обработка записанного фрагмента |
| Обращение к системам | Посмотреть заказ, проверить слот |
| Ответ модели | Тем дольше, чем длиннее ответ |
| Синтез голоса | Пропорционально длине реплики |
Что из этого следует для сценария. Голосовому агенту нельзя давать задачи, требующие долгих обращений к внешним системам во время разговора. Если проверка статуса занимает три секунды, разговор рассыпается. Данные должны быть под рукой заранее.
Какие звонки можно отдавать
Пройдёмся по порядку: где голос работает предсказуемо.
Исходящие напоминания. Напомнить о визите, о записи, о платеже. Разговор короткий, сценарий понятный, клиент ждёт такого звонка. Самый благодарный сценарий из всех.
Подтверждение и перенос записи. «Ваша запись завтра в 15:00, подтверждаете?» Три варианта ответа, каждый обрабатывается.
Сбор данных для заявки. Адрес, удобное время, тип услуги. Разговор структурированный, ошибки видны сразу.
Опрос после покупки. Оценка, короткий комментарий. Нет цены ошибки: если клиент не захотел говорить, ничего не потеряно.
Первичная маршрутизация входящих. Понять, зачем человек звонит, и перевести на нужный отдел — вместо меню с восемью пунктами.
- Короткий предсказуемый диалог
- Мало вариантов развития
- Низкая цена ошибки
- Клиент ожидает звонка
- Данные известны заранее
- Переговоры и торг
- Недовольный клиент
- Сложный продукт с вариантами
- Разговор с пожилым человеком
- Всё, что требует сочувствия
Где ломается: пять честных сценариев
То, о чём не пишут продавцы решений.
Клиент перебивает. Живой человек перебивает постоянно. Агент должен уметь остановиться на середине фразы и начать слушать. Это техническая возможность, которую надо специально закладывать, и она есть не везде.
Шум и плохая линия. Клиент в машине, на улице, в цехе. Распознавание падает, агент переспрашивает, клиент раздражается.
Нестандартная формулировка. Вместо «да» человек говорит «ну давайте», вместо «нет» — «я подумаю ещё». Текстовый бот увидит это и разберётся, голосовой получит расшифровку с искажениями и справится хуже.
Эмоции. Раздражённый клиент говорит быстрее, сбивчивее, перебивает. Именно в этот момент агент справляется хуже всего — а именно тогда важнее всего не потерять человека.
Ожидание живого голоса. Есть аудитория, для которой автоматический звонок сам по себе раздражитель. Пожилые клиенты, дорогие услуги, сложные ситуации.
Сколько это стоит
Здесь голос отличается от переписки принципиально, и это надо понимать до начала.
| Статья | Как считается | Есть ли в переписке |
|---|---|---|
| Телефония | по минутам | нет |
| Распознавание речи | по минутам аудио | нет |
| Синтез голоса | по символам или минутам | нет |
| Языковая модель | по токенам | да |
| Разработка сценария | разово | да |
| Отладка | дольше, чем в тексте | да |
Ключевое отличие: три из шести строк считаются по минутам разговора. Значит стоимость растёт не от числа обращений, а от длительности. Разговор на четыре минуты стоит вчетверо дороже минутного, даже если полезного в нём столько же.
Что из этого следует: экономика голосового агента улучшается, когда разговор короткий. Отсюда правило проектирования — сценарий должен вести к цели за минимум реплик, а не «поддерживать беседу».
Часть по модели считается так же, как в текстовом агенте: по токенам, где один токен в русском тексте — это 3–4 символа. Порядок цифр и способ расчёта разобраны в статье про то, сколько стоит ИИ-агент.
Почему сначала текст, потом голос
Правило, которое экономит больше всего денег.
Голосовой агент — это текстовый агент плюс два дополнительных звена. Если текстовый сценарий не работает, добавление распознавания и синтеза его не починит: наоборот, к логическим проблемам добавятся ошибки распознавания.
- 1Собрать сценарий в перепискеТам дёшево и видно каждую ошибку
- 2Довести до рабочего состоянияПроверить на реальных клиентах
- 3Проверить длину репликТо, что читается, не всегда слушается
- 4Добавить голосовой слойРаспознавание, синтез, телефония
- 5Отладить паузы и перебиванияЭто отдельная работа, и она долгая
Входящие и исходящие: две разные задачи
Их часто смешивают, а требования у них противоположные.
- Вы задаёте тему разговора
- Сценарий предсказуем
- Данные известны заранее
- Можно звонить в удобное время
- Отказ не критичен
- Тему задаёт клиент
- Может позвонить с чем угодно
- Часто звонят с проблемой
- Ожидание ответа здесь и сейчас
- Ошибка стоит клиента
Практическая рекомендация. Если хочется голос, начинайте с исходящих напоминаний. Там результат виден сразу, сценарий короткий, а недовольство клиента маловероятно: ему просто напомнили о записи.
Входящие имеет смысл отдавать агенту только после того, как отработана маршрутизация: понять тему обращения и перевести на нужного человека — уже полезно и гораздо безопаснее, чем пытаться закрыть вопрос целиком.
Что должно быть в сценарии обязательно
Пять элементов, без которых голосовой агент раздражает даже при хорошем распознавании.
- 1Представление в первой фразеКто звонит и зачем — до того, как задан первый вопрос
- 2Честное «я ассистент»Маскировка раскрывается и злит сильнее, чем робот
- 3Быстрый переход на человекаПо первой же просьбе, без уговоров
- 4Обработка молчанияЧто делать, если клиент не отвечает три секунды
- 5Понятное завершениеЧем закончился разговор и что будет дальше
Про первую фразу отдельно. У голосового звонка есть три-четыре секунды, за которые человек решает, слушать или класть трубку. Если за это время не прозвучало, кто звонит и по какому поводу, дальше сценарий уже не важен.
Как проверить агента перед запуском
Голос проверяется иначе, чем переписка: часть проблем слышна только на слух.
Прослушать двадцать разговоров целиком. Не расшифровки, а записи. В тексте не видно ни задержек, ни неестественных пауз, ни неправильных ударений.
Проверить на плохой линии. Позвонить из машины, из шумного места, с плохим сигналом. Именно так будет звонить половина клиентов.
Перебить агента. Специально начать говорить в середине его реплики. Если он продолжает говорить как ни в чём не бывало — сценарий не готов.
Сказать что-то за рамками сценария. Задать вопрос, которого нет в логике. Агент должен передать человеку, а не выкручиваться.
Замерить длину разговора. Если типовой диалог занимает четыре минуты вместо полутора, экономика ухудшается втрое — и часто это лечится сокращением реплик.
| Проверка | Что выявляет | Как часто пропускают |
|---|---|---|
| Прослушивание записей | Паузы, ударения, интонацию | Часто |
| Плохая линия | Реальное качество распознавания | Почти всегда |
| Перебивание | Готовность к живому разговору | Почти всегда |
| Вопрос вне сценария | Работает ли передача человеку | Иногда |
| Длина разговора | Экономику всего проекта | Часто |
Юридическая и этическая сторона
Три вещи, которые стоит решить до запуска обзвона.
Согласие на звонки. Автоматический обзвон базы — это не то же самое, что звонок менеджера. Основания для связи с человеком и наличие его согласия стоит проверить с юристом до того, как система наберёт первый номер.
Запись разговора. Если разговор записывается, об этом принято предупреждать в начале. Плюс запись — это данные, у которых должен быть срок хранения.
Честность про машину. Отдельно от закона: практика показывает, что прямое «вас приветствует ассистент» вызывает меньше негатива, чем попытка выдать агента за сотрудника. Раскрытие обмана обходится дороже, чем изначальная честность.
Когда голос не нужен
Список случаев, где те же деньги дадут больше в другом месте.
Клиенты пишут, а не звонят. Если основной канал — мессенджеры, вкладываться в голос странно. Посмотрите, откуда реально приходят обращения.
Мало звонков. Голос дороже переписки на старте и в обслуживании. При двадцати звонках в день выгоднее нанять человека или закрыть поток текстом.
Каждый звонок уникален. Консалтинг, сложные B2B-продажи, ситуации с эмоциями. Голосовой агент здесь скорее навредит.
Нет данных под рукой. Если для ответа нужно лезть в три системы, задержка убьёт разговор. Сначала интеграции, потом голос.
Текстовый сценарий ещё не работает. Самый частый случай. Голос не чинит логику, он добавляет к ней проблемы.
Сроки внедрения
Реалистичные, а не рекламные.
| Этап | Срок | Что занимает время |
|---|---|---|
| Текстовый сценарий | 1–2 недели | Логика и база ответов |
| Подключение телефонии | несколько дней | Доступы и настройка |
| Распознавание и синтез | несколько дней | Подбор голоса, словарь терминов |
| Отладка на реальных звонках | 2–4 недели | Паузы, перебивания, краевые случаи |
| Выход на поток | постепенно | Часть звонков, потом расширение |
Где сроки обычно уезжают: последняя строка. Голосовой агент, запущенный сразу на весь поток, даёт всплеск жалоб, после которого проект обычно и закрывают. Постепенный вывод — не осторожность, а способ дожить до результата.
Голосовой агент против старого автоответчика
Меню «нажмите один для отдела продаж» знакомо всем и всех раздражает. Разберём, чем принципиально отличается новый подход.
| Меню с кнопками | Голосовой агент | |
|---|---|---|
| Как отвечает клиент | Нажимает цифры | Говорит словами |
| Что понимает | Только предусмотренные варианты | Свободную формулировку |
| Что делает | Переводит по веткам | Отвечает, уточняет, действует |
| Когда ломается | Вопрос не подходит ни под один пункт | Клиент говорит нестандартно или перебивает |
| Раздражает | Длиной меню | Задержкой и роботичностью |
Главное отличие в одной фразе: меню заставляет клиента подстраиваться под вашу структуру, агент подстраивается под клиента. Человек говорит «у меня не работает заказ, который вчера пришёл» — и не должен угадывать, это второй пункт или четвёртый.
Честная оговорка: для простой маршрутизации из трёх вариантов меню быстрее и надёжнее. Агент выигрывает там, где вариантов много или где клиент всё равно не понимает, в какую категорию попадает его вопрос.
Разбор одного разговора
Абстракции заканчиваются на конкретике. Типовой исходящий звонок — напоминание о записи.
Агент: Здравствуйте! Это ассистент клиники «Ромашка», звоню напомнить: вы записаны на завтра, на пятнадцать ноль-ноль, к терапевту. Всё в силе?
За кадром: представился, назвал компанию и повод за пять секунд. Данные о записи подставлены заранее — во время разговора никуда не ходим.
Клиент: Ой, а можно перенести? Я завтра не смогу.
Агент: Конечно. Есть свободное время в четверг в одиннадцать и в пятницу в шестнадцать тридцать. Что удобнее?
За кадром: слоты подгружены до звонка. Вариантов ровно два — не список из десяти, который на слух не удержать.
Клиент: Давайте в пятницу.
Агент: Записал вас на пятницу, шестнадцать тридцать. Пришлю подтверждение сообщением. Хорошего дня!
За кадром: перенёс запись, отправил подтверждение в мессенджер, завершил разговор.
Что здесь сделано правильно. Разговор занял меньше минуты. Каждая реплика агента — одно-два предложения. Вариантов ответа немного. Данные были готовы заранее. Подтверждение продублировано текстом — то, что произнесено голосом, забывается.
Чего агент не делал. Не уговаривал, не предлагал дополнительные услуги, не выяснял причину отказа. Всё это удлиняет разговор и увеличивает шанс, что что-то пойдёт не по сценарию.
Готовая платформа или своя разработка
Как и везде, развилка, и в голосе она острее из-за цены ошибки.
- Телефония, распознавание и синтез уже связаны
- Типовые сценарии из коробки
- Запуск за недели
- Логика ограничена их конструктором
- Записи разговоров хранятся у них
- Любая логика и любые интеграции
- Выбор каждого компонента отдельно
- Данные под вашим контролем
- Дороже и дольше
- Отладка целиком на вас
Разумный порядок: собрать первый сценарий на готовой платформе, убедиться, что клиенты нормально реагируют на голос, и только потом решать, нужна ли своя сборка. Ошибка в обратную сторону дороже: месяцы разработки ради сценария, который аудитория не приняла.
Как измерять результат
Голос даёт метрики, которых нет в переписке, и смотреть надо именно на них.
| Метрика | Что показывает | Тревожный признак |
|---|---|---|
| Доля дослушавших до конца | Принимают ли клиенты формат | Меньше половины бросают трубку |
| Средняя длина разговора | Экономику проекта | Растёт от месяца к месяцу |
| Доля переводов на человека | Границы сценария | Слишком мало — агент не отдаёт разговор |
| Доля достигнутых целей | Ради чего звонили | Ниже, чем у живого обзвона |
| Повторные обращения после звонка | Понял ли клиент, о чём речь | Люди перезванивают уточнить |
Последняя строка — самая недооценённая. Если после звонка агента клиент перезванивает в компанию с тем же вопросом, автоматизация не сэкономила, а добавила работы. Это видно только при сопоставлении звонков агента с входящим потоком.
Что сравнивать. Правильная база сравнения — не «до автоматизации вообще», а тот же сценарий, выполненный людьми. Если раньше напоминания не делались вовсе, любой результат выглядит победой, и это мешает увидеть проблемы.
Отраслевые сценарии: где голос прижился
Не рекламный список, а те области, где формат совпадает с привычками аудитории.
Медицина и услуги по записи. Напоминания о визите, подтверждение, перенос. Люди привыкли, что из клиники звонят, и воспринимают это спокойно. Снижение неявок — измеримый результат.
Логистика и доставка. Подтвердить адрес, согласовать интервал, предупредить об опоздании. Разговор короткий, цель ясная.
Финансовые напоминания. Ранняя просрочка, продление подписки. Работает, но требует особой аккуратности в формулировках: тема чувствительная.
Опросы после обслуживания. Оценка качества, короткий комментарий. Голосом отвечают охотнее, чем заполняют формы.
Реактивация базы. Обзвон старых клиентов с конкретным поводом. Здесь важно именно наличие повода: звонок «просто напомнить о себе» раздражает.
Где голос не прижился: сложные консультации, продажа дорогих услуг, техподдержка с диагностикой. Везде, где разговор ветвится непредсказуемо. Общая закономерность здесь простая и устойчивая: чем дороже и сложнее то, о чём идёт разговор, тем выше у клиента ожидание именно живого собеседника — и тем дороже обходится попытка это ожидание обмануть.
Что нужно от компании до старта
Голосовой агент требует большей подготовки, чем текстовый, и часть её невозможно переложить на подрядчика.
- 1Список сценариевКакие именно звонки отдаём и с какой целью
- 2Данные под рукойВсё, что понадобится в разговоре, — заранее, а не запросом во время
- 3Словарь терминовНазвания товаров, услуг, районов — для распознавания
- 4Границы полномочийЧто агент говорит сам, чего не говорит никогда
- 5Правила передачи человекуВ каких случаях и кому именно
- 6Тексты репликКороткие, произносимые вслух, без канцелярита
Про второй пункт подробнее. Это самое частое техническое ограничение. Если во время разговора агент должен сходить в вашу систему за статусом заказа, и запрос идёт три секунды, разговор ломается. Решение — готовить данные заранее: перед обзвоном выгрузить всё, что понадобится.
Про третий. Распознавание речи гораздо лучше справляется, когда знает, чего ожидать. Список ваших услуг, названий и районов города даёт заметный прирост точности без всякой доработки моделей.
Требования к телефонии
Техническая часть, которую обычно обнаруживают в середине проекта.
| Требование | Зачем | Что если нет |
|---|---|---|
| Возможность подключить робота | Агент должен получать и отдавать аудиопоток | Придётся менять телефонию |
| Приемлемое качество линии | Распознавание падает на плохом звуке | Половина разговоров не состоится |
| Определение конца реплики | Понять, что человек договорил | Агент будет перебивать или тормозить |
| Перевод на живого сотрудника | Ключевая функция сценария | Агент станет тупиком |
| Запись разговоров | Для отладки и разбора | Не на чем учиться |
Что обычно всплывает. Старая телефония либо не умеет отдавать поток в реальном времени, либо делает это с задержкой. Это выясняется на этапе подключения и способно сдвинуть весь проект — поэтому проверять совместимость нужно до начала работ, а не после.
Как голос работает с базой знаний
Отдельный разговор, потому что требования здесь жёстче, чем в переписке.
В тексте агент может дать развёрнутый ответ, и человек его прочитает. В голосе тот же ответ превращается в монолог на полминуты, который никто не дослушает.
Что из этого следует:
- Ответы должны быть короче. Одна мысль в реплике, максимум две.
- Списки не работают. Пять вариантов, произнесённых подряд, не удерживаются в памяти. Максимум два-три, а лучше уточняющий вопрос.
- Числа требуют осторожности. Длинные номера, адреса и суммы лучше дублировать сообщением.
- Сложное лучше не пересказывать. Если ответ занимает абзац, правильнее сказать «отправлю подробности сообщением» и передать текстом.
Как устроен слой поиска по документам, разобрано в статье про RAG — механизм тот же, отличаются только требования к длине ответа.
Частые ошибки внедрения
Шесть, которые встречаются почти в каждом первом проекте.
Агент пытается изображать человека. Даёт имя, «эмоции», уходит от вопроса «вы робот?». Раскрытие обмана обходится дороже, чем изначальная честность, а раскрывается оно почти всегда.
Реплики написаны для чтения. «В соответствии с условиями предоставления услуги вам необходимо…» — на бумаге привычно, вслух невыносимо. Тексты надо проговаривать вслух при написании.
Нет обработки тишины. Клиент отвлёкся, молчит четыре секунды. Агент либо ждёт вечно, либо кладёт трубку. Оба варианта плохи, нужен третий: переспросить.
Слишком много вариантов в одной реплике. «Вам удобно в понедельник, вторник, среду, четверг или пятницу?» — человек запомнит последний.
Обзвон без повода. Звонок «мы решили вам напомнить о себе» раздражает и в исполнении человека, и в исполнении машины. Нужен конкретный повод: запись, доставка, срок, изменение.
Запуск сразу на всю базу. Ошибки в сценарии умножаются на объём. Начинать надо с небольшой части и слушать записи.
Считаем экономику на примере
Посчитаем на конкретных числах, чтобы было понятно, как складывается стоимость.
Возьмём напоминания о записи: тысяча звонков в месяц, средняя длина разговора — минута.
| Что считаем | Как | Замечание |
|---|---|---|
| Телефония | 1 000 минут | По вашему тарифу |
| Распознавание | ~1 000 минут аудио | Считается по длительности |
| Синтез | по объёму произнесённого | Реплик агента меньше, чем всего разговора |
| Модель | ~1 000 коротких диалогов | Самая дешёвая часть |
| Разработка | разово | Основные вложения |
Наблюдение, которое меняет проектирование. Модель — наименьшая статья расходов: короткий диалог занимает мало токенов, а токены дёшевы. Основной счёт формируют минуты. Поэтому сокращение разговора с двух минут до одной снижает стоимость почти вдвое, а на качестве не сказывается — наоборот, короткий разговор приятнее.
Что сравнивать с этим. Тысяча звонков-напоминаний руками — это несколько полных рабочих дней сотрудника. Если раньше напоминания не делались вовсе, считать надо не экономию, а результат: сколько неявок предотвращено.
Когда лучше вложиться в переписку
Прямое сравнение, потому что бюджет обычно один.
- Аудитория старшего возраста
- Срочные и выездные услуги
- Напоминания, которые важно донести
- Дороже в разработке и в минутах
- Дешевле на порядок
- Клиент отвечает, когда удобно
- Можно отправить ссылку и файл
- Ошибки видны и исправимы
Практический тест. Посмотрите, откуда за последний месяц приходили обращения. Если восемьдесят процентов — из мессенджеров и с сайта, начинать с голоса не стоит: вы будете автоматизировать канал, которым почти не пользуются.
Второй тест, для исходящих. Возьмите список того, что вы сообщаете клиентам сами: напоминания, подтверждения, статусы. Если раньше это не делалось вообще из-за нехватки рук, голос окупится почти наверняка — сравнивать будет не с чем, любой результат станет приростом. Если это уже делается сообщениями и доходит, голос добавит расходов без нового результата.
Что происходит через полгода
То, о чём узнают уже в процессе эксплуатации.
Клиенты привыкают. Первое время автоматический звонок вызывает удивление, потом становится обычным делом. Негатив, который был на старте, обычно снижается — если агент честно представляется и не пытается изображать человека.
Сценарий обрастает исключениями. Каждый месяц находится ситуация, которую не предусмотрели. Через полгода сценарий вдвое сложнее исходного, и его надо периодически пересматривать целиком, а не только дополнять.
Растёт длина разговоров. Добавили уточнение здесь, вежливую формулировку там — и минутный разговор стал двухминутным, а счёт вырос вдвое. Длину нужно контролировать так же, как расходы.
Меняется качество распознавания. Модели обновляются, и это чаще хорошо, но проверять после обновления нужно обязательно: изменившееся поведение на ваших специфических словах заметно не сразу.
Появляется вопрос про второй язык. Если среди клиентов есть говорящие на другом языке, это отдельная работа, а не переключатель в настройках.
Голос и мессенджеры вместе
Схема, которая на практике работает лучше, чем каждый канал по отдельности, и о которой редко думают заранее.
Идея простая: голос доносит, текст фиксирует. Всё, что человек должен запомнить или сохранить, дублируется сообщением.
Как это выглядит. Агент звонит и напоминает о записи. Клиент переносит время. Сразу после разговора приходит сообщение: новое время, адрес, ссылка на маршрут, кнопка для отмены.
Что это даёт. Голос решает задачу «дозвониться и получить ответ» — с ним не сравнится ни одно сообщение, которое можно не прочитать. Текст решает задачу «не забыть детали» — их невозможно удержать на слух.
Обратный порядок тоже работает. Сообщение уходит первым, и только тем, кто не отреагировал за сутки, звонит агент. Так снижается и стоимость, и раздражение: звонок получают только те, до кого не дошли дешёвым способом.
- 1Сообщение в мессенджерСамый дешёвый канал, отправляем первым
- 2Ждём реакции суткиБольшая часть ответит здесь
- 3Звонок тем, кто молчитГолос только там, где текст не сработал
- 4Итог сообщениемДоговорённости дублируем текстом
Что для этого нужно. Связка мессенджера и телефонии в одном сценарии и общая история клиента: агент должен знать, что человеку уже писали и что он не ответил. Без этого получится два независимых канала, которые дублируют друг друга и раздражают вдвойне.
Короткий вывод
Если убрать детали, всё сводится к трём утверждениям.
Первое. Голосовой агент — это текстовый агент плюс два звена, каждое из которых добавляет задержку и ошибки. Поэтому сценарий всегда сначала отрабатывается в переписке.
Второе. Голос работает на коротких предсказуемых разговорах и ломается там, где нужны гибкость, эмоции или долгие обращения к системам. Граница проходит по предсказуемости, а не по сложности.
Четвёртое, и оно важнее остальных. Голос стоит начинать только после того, как посмотрели, каким каналом клиенты пользуются на самом деле. Автоматизировать телефон в бизнесе, где восемьдесят процентов обращений приходит в мессенджеры, — самая дорогая из типовых ошибок: деньги уходят в канал, которым почти не пользуются, а очевидные улучшения в переписке остаются несделанными.
Третье. Экономика голоса считается по минутам, а не по обращениям. Значит проектировать надо не «хороший разговор», а самый короткий путь к цели — это одновременно дешевле и приятнее клиенту.
Что делаю я
Первый вопрос у меня всегда один: нужен ли вам голос вообще. Смотрю, откуда приходят обращения и какие звонки повторяются. Обычно оказывается, что половина звонков — это «где мой заказ», и закрывается она уведомлением в мессенджере, а не разговором с роботом.
Если голос действительно нужен, делаю ИИ-агентов целиком: сначала текстовый сценарий, потом голосовой слой, подключение телефонии, отладка на реальных звонках. Начинаем с исходящих напоминаний — там результат виден быстрее всего. Если вижу, что задача закрывается чат-ботом в переписке, говорю об этом прямо: голос дороже, и платить за него без нужды незачем.




