Три кубика, десять слоёв, сотрудник
Робот первого поколения — автоинформатор: проиграл запись, распознал «да» или «нет», перевёл на человека. Второе поколение — сценарный робот с распознаванием и нейросетью на подхвате. Он звучит живо на демо и ломается на десятом реальном звонке: не там замолчал, спросил дважды, не понял «через три дня».
Третье поколение отличает не «модель умнее», а устройство: всё происходит параллельно, у разговора есть состояние, а у нейросети — границы. Такого робота уместно называть цифровым сотрудником, и не ради красоты слова: он ведёт разговор к цели бизнеса, а не отрабатывает ветки.
Всё одновременно: поток вместо очереди
Старый робот работает по очереди: человек договорил, распознали целиком, подумали целиком, написали текст целиком, озвучили целиком — и только тогда начали говорить. Каждая стрелка — своя задержка, и они складываются. Отсюда знакомое: «Здравствуйте… [две секунды тишины] …да, слушаю вас».
Современный вариант делает всё сразу. Распознавание отдаёт слова по мере того, как человек говорит, нейросеть начинает думать над началом фразы, синтез озвучивает первое предложение, пока второе ещё пишется. Задержка перестаёт быть суммой и становится максимумом из нескольких параллельных дел. Поэтому задержка — свойство всей цепочки, а не скорости модели: самая быстрая нейросеть не спасёт, если распознавание ждёт конца фразы, а синтез — конца текста.
Человек договорил или думает? Конец реплики
Второй столп — понять, что человек закончил. Кажется мелочью, а это одна из самых трудных задач голосового ИИ. Детектор речи отвечает только на вопрос «сейчас звучит голос или тишина». Но пауза не равна концу фразы.
«Да…» может быть окончанием. «Да, я хотел спросить…» — очевидно нет. «Ну… я не знаю… наверное…» — человек думает вслух, и робот, который вклинится после первой паузы, будет выглядеть невоспитанным.
| Способ | Как работает | Что ломается |
|---|---|---|
| Таймер тишины | пауза дольше заданной — конец | режет думающего и заставляет ждать того, кто уже ждёт ответа |
| Таймер по контексту | после вопроса «да или нет?» пауза короче, после «расскажите» — длиннее; длинную реплику дослушивают дольше | нужен сигнал от дирижёра: какой вопрос задан |
| По смыслу | распознавание идёт потоком; фраза с открытым концом — «и», «а», «через», «в» — значит, ждём | нужен поток распознавания; сложнее всего |
В боевых системах работают все три слоя сразу: таймер страхует, контекст подстраивает, смысл решает спорные случаи.
Дайте себя перебить
Обычный робот
Робот: «Наш робот может напоминать клиентам о—»
Клиент: «Да понял, а сколько стоит?»
Робот: «—записи и принимать—»
Современный
Робот: «Наш робот может напоминать кли—»
Клиент: «Сколько стоит?»
Робот: «От семи рублей за минуту».
Это называется перебиванием, и архитектурно оно требует трёх вещей: слушать человека, пока говоришь сам; отличить речь от кашля; остановить озвучку и выбросить недосказанное, а не «доклевать» его после.
Самое трудное здесь — не замолчать, а не замолчать зря. Робот, который замирает от каждого «угу», шороха и второй линии в клинике, раздражает сильнее того, который договаривает.
- Громкость выше шума линии в несколько раз, а не выше фиксированного порога: у каждой линии свой фон.
- Речь, а не всплеск: срабатывает только полсекунды речи в скользящем окне, а не один громкий кусок звука.
- Глухота на старте своего хода: первые доли секунды нашей реплики — это хвост речи человека, не перебивание.
- Строгий порог в приветствии: пока робот представляется, перебить его труднее — иначе «алло?» в первую секунду рвёт вход.
- Пауза после перебивания: замолчал — не начинай следующий кусок сразу, дай человеку договорить.
Дуплекс: слушать и говорить одновременно
В живом разговоре двое могут говорить одновременно, вставлять «угу», начинать фразу, пока собеседник заканчивает, уступать слово. Агент с полным дуплексом умеет то же — это следующий уровень после перебивания.
Разница слышна на длинном рассказе клиента. Робот с очередью молчит всю минуту, и человек начинает сомневаться, слышат ли его. Дуплексный роняет «угу», «так», «поняла» в паузы, не перехватывая слово. По этой мелочи ухо и отличает живого собеседника от автоответчика.
Дирижёр: кто главный в разговоре
Вот здесь живёт главная технология — и здесь же у большинства роботов живёт проблема. Дирижёр знает: кто сейчас говорит; перебили ли нас; на каком этапе разговор; что мы уже знаем и что ещё надо узнать; какова цель звонка; можно ли сейчас позвать CRM; пора ли заканчивать.
Он принципиально отличается от «поставили нейросеть в телефон и дали ей промпт». В той схеме нейросеть — всё сразу: и понимание, и решение, и речь, и память. В современной — она один из исполнителей у дирижёра.
Состояние: правда о разговоре
Клиент говорит: «Перезвоните через три дня». Скриптовый робот, у которого следующая ветка спрашивает «сегодня или завтра?», спросит «сегодня или завтра?». Клиент повторит. Робот спросит «до обеда или после?». Так выглядит автоответчик, спрятанный внутри «разговорного ИИ»: нейросеть человека поняла, а движок разговора не дал ей изменить траекторию.
Лечится это не более умной моделью, а состоянием разговора — карточкой, которая заполняется по ходу и является единственной правдой. И правилом: значение, названное клиентом, узел сценария перезаписать не может.
| Поле | Значение | Откуда |
|---|---|---|
| Имя | Елена Петровна | сказал клиент |
| Кто напоминает о записи | администраторы | сказал клиент |
| Канал напоминаний | СМС и звонки | сказал клиент |
| Интерес | есть | по ходу разговора |
| Цена | спросил | по ходу разговора |
| Перезвон | через три дня | сказал клиент — сценарий не перезаписывает |
| Время звонка | не определено | ещё спросить |
Карточка разговора после трёх минут. Состояние — это не история чата, а то, что верно прямо сейчас.
Память: не расшифровка, а факты
Раньше нейросети отдавали весь разговор: «вот тебе пять тысяч слов, разберись». Это дорого, медленно и ненадёжно — модель теряет то, что было в начале, и «вспоминает» то, чего не было. Современный подход — двухслойная память: сверху факты из карточки, снизу последние несколько реплик, чтобы понимать контекст фразы. Всё остальное модели не нужно.
Между звонками память живёт не в голове робота, а в базе: карточка компании, из которой берётся, кто снял трубку в прошлый раз, кто передал номер и о чём договорились. Так робот во втором звонке не обращается к администратору именем директора.
Намерение: что человек делает прямо сейчас
«А что ещё ваш робот умеет?» — для агента это не текст, а действие: спрашивает о возможностях. «Я уже это говорил» — уже сказал. «Через три дня» — назвал время перезвона. «Да вы меня достали» — раздражение. Нейросеть здесь очень хороша: она понимает смысл, а не ищет слова.
Но у неё есть недостаток — она всегда что-нибудь выберет. Поэтому понимание строится лестницей: быстрый словарь для типовых ответов, своя маленькая модель с мерой уверенности, которая умеет честно промолчать, и большая нейросеть на всё незнакомое.
Нейросеть не должна управлять всем
Это самый важный принцип современной архитектуры. Нейросеть хорошо понимает язык, строит гипотезы, выбирает тактику, работает с возражениями. Но ей нельзя без ограничений списывать деньги, менять CRM, назначать что угодно, раскрывать данные, игнорировать стоп-лист и нарушать правила бизнеса. Поэтому у зрелого агента есть шкала свободы, и уровень выбирается осознанно.
- A0 — только понимает реплику, говорит сценарий.
- A1 — говорит своё там, где у сценария нет ответа, но вопрос задаёт сценарий.
- A2 — исполняет приём, выбранный дирижёром: кейс, довод, гипотеза о потребности.
- A3 — меняет состояние голоса: серьёзно, спокойно, весело.
- A4 — зовёт инструменты: расчёт, календарь, CRM.
- A5 — принимает решения о скидках и условиях. Этого уровня у робота быть не должно — это руководитель.
Уровень растёт по подтверждённому качеству и снимается при ухудшении. А закон, то есть правила, работает так: запрещённые фразы срезаются на выходе, а не в промпте; цифры и сроки звучат только из справки; обещание у робота одно, заранее согласованное; стоп-лист сильнее любого приёма; трубка кладётся только по подтверждённому прощанию.
Руки: инструменты
Здесь чат-бот превращается в сотрудника. Клиент: «Запишите меня на завтра в три». Нейросеть понимает намерение, но сама запись не происходит — она зовёт инструмент: проверить слот в календаре. Календарь отвечает «свободно», и только тогда робот говорит: «Да, завтра в три есть время, записываю».
Два уточнения из практики. Инструмент должен быть детерминированным: цену считает код по прайсу, а не нейросеть «примерно». И большинству бизнесов на первом этапе хватает трёх рук — записать итог в CRM, поставить перезвон в очередь и отправить письмо. Календарь и оплата — когда клиенты сами начинают просить назначить время.
Знания компании
Клиент спрашивает: «А у вас можно перенести запись?». Нейросеть не должна гадать — она берёт ответ из базы знаний компании: «перенос возможен не позднее чем за три часа». Поиск по базе нужен там, где знаний много, они часто меняются или должны иметь источник.
Персонаж и профессиональный мозг
Промпт
Одна строка роли. Нейросеть сама додумывает характер, настойчивость, шутки и границы — каждый раз немного по-разному.
Паспорт сотрудника
Кто она, как думает, что считает хорошим результатом, как спорит, когда шутит и молчит, чего никогда не делает. Плюс продукт, отрасль, кейсы, экономика клиента и типовые возражения.
У такого сотрудника есть мнение: он может не согласиться, привести довод и рассказать случай «у нашего клиента». Но факты, кейсы и цифры он берёт только из своей базы, а не сочиняет.
Разговор, который подстраивается
Старый робот: вопрос, ответ, следующий вопрос. Современный после каждого ответа выбирает: уточнить, возразить, ответить на встречный вопрос, предложить гипотезу или продолжить квалификацию.
Старый
Робот: «Кто у вас напоминает пациентам о записи?»
Клиент: «Администраторы. А ваш робот может обзванивать тех, кто перестал ходить?»
Робот: «А сколько звонков делают администраторы?»
Современный
Робот: «Кто у вас напоминает пациентам о записи?»
Клиент: «Администраторы. А ваш робот может обзванивать тех, кто перестал ходить?»
Робот: «Да, может. И это как раз интересный сценарий — поднять тех, кто давно не был. А сколько таких у вас накапливается за месяц?»
Внутри это три механики: ответить на встречный вопрос из справки, вернуться к вопросу ветки другой формулировкой, а не слово в слово, и присоединиться — коротко пересказать сказанное клиентом, чтобы он слышал, что понят. Плюс сторож топтания: если один и тот же вопрос прозвучал дважды, третий раз робот идёт дальше, а не по кругу.
Эмоции меняют стратегию, а не только голос
Раньше эмоцию использовали для голоса: раздражён — говорим спокойнее. Современный подход — эмоция меняет стратегию разговора.
| Состояние клиента | Что делает агент |
|---|---|
| Нейтрален | обычный ход |
| Запутался | упрощает: короче, одна мысль на фразу |
| Скептик | объясняет: довод, кейс, цифра из базы |
| Раздражён | короче и признаёт: «да, повторилась — виновата», без бодрого тона и без уточняющих вопросов |
| Торопится | сразу к сути, приёмы выключены |
| Заинтересован | раскрывает: гипотеза, следующий шаг, время звонка |
Это важнее, чем красивый «эмоциональный синтез».
Голос: уместно, а не просто похоже
Современный синтезатор управляет темпом, паузами, ударениями, интонацией и окраской. Задача перестала быть «сделать голос как у человека» и стала «сделать речь уместной для ситуации». Слово «понятно» с одинаковым текстом звучит заинтересованно, нейтрально, сочувственно или устало — и это разная коммуникация.
Из практики: живость дают не только модели. Вдох перед фразой, «мм» на раздумье, короткий смешок, «секундочку», записанные тем же голосом и вставленные в нужные места, делают для уха больше, чем «эмоциональный» синтез.
Другой путь: модель работает со звуком
Всё описанное — классическая цепочка: звук, текст, нейросеть, текст, звук. Есть другой путь: модель, которая работает прямо со звуком и отвечает звуком, без текста посередине. Она лучше сохраняет живость речи и убирает промежуточные преобразования.
Классическая цепочка
Каждое звено видно и заменяемо. Можно проверить фразу до того, как она прозвучит, позвать инструмент, записать трассировку разговора.
Модель со звуком
Живее интонации, быстрее ответ, естественный дуплекс. Но сторожа на выходе поставить сложнее, а поменять один компонент, не трогая остальные, — нельзя.
Для бизнеса это не автоматическая победа. Мы следим за этим направлением, но в бой не берём.
Экзамен: агент тестируется как система
Раньше тест выглядел так: «правильно ли робот ответил на эту фразу?». Тысяча фраз, галочка. Современный тест — симулятор: персона клиента с характером, сценарий, многоходовый разговор бот-с-ботом, автоматический судья и метрики.
| Ось | Что проверяет судья |
|---|---|
| Смысл | понял вопрос, сохранил контекст, не потерял информацию |
| Поведение | не повторил вопрос, не проигнорировал, не зациклился, правильно завершил |
| Бизнес | достиг цели, корректно квалифицировал, не создал ложный лид, правильно записал в CRM |
| Голос | не перебил, верно определил конец реплики, остановился при перебивании, не завис на паузе |
| Техника | задержка, ошибки распознавания, отказы инструментов и синтеза, обрыв связи |
Так работают специализированные тесты голосовых агентов, и их результаты показательны: в реалистичных звуковых условиях агенты заметно теряют качество относительно текстовых. Тест текстом — не тест.
Из этого следуют два правила. Провалы из живых звонков должны сами становиться тестами — иначе они вернутся. И одну задачу гоняют несколько раз: агент, который прошёл один раз из одного, часто проходит один из четырёх.
Десять понятий вместо тридцати моделей
Не надо изучать тридцать моделей распознавания, двадцать синтезаторов и пятнадцать нейросетей. Полезнее понять десять технологий и уметь задать по ним вопрос.
| Технология | Простыми словами | Зачем бизнесу |
|---|---|---|
| Распознавание речи | услышать человека | понять, что сказано |
| Нейросеть | подумать | понять смысл и выбрать ответ |
| Синтез | заговорить | голос |
| Поток | делать всё одновременно | скорость ответа |
| Конец реплики | понять, что человек договорил | не перебивать и не тормозить |
| Перебивание | дать себя перебить | естественный разговор |
| Дирижёр | управлять всем разговором | цель звонка, а не ветки |
| Состояние и память | помнить факты | не спрашивать дважды |
| Инструменты | руки сотрудника | CRM, календарь, письмо |
| Экзамен | проверка перед выходом | понять, можно ли выпускать |
Второй уровень, когда первые десять освоены: знания компании, персонаж, эмоция как стратегия, планирование разговора, дуплекс и модель со звуком.
Где на этой карте стоим мы
Мы делаем голосового робота, который звонит клиникам и договаривается о звонке руководителя. Вот честная карта по тем же двадцати пунктам, снятая с кода и с боевого сервера 13 сентября. Провалы наравне с победами — иначе статья была бы рекламой.
| Статус | Что именно |
|---|---|
| Есть | понимание лестницей, дирижёр, состояние, память в два слоя, персонаж, адаптивный разговор, эмоция как стратегия, нейросеть под правилами, перебивание с пятью защитами |
| Частично | поток: распознавание стартует заранее в паузе, но не потоком, синтез кусками, но файлом · конец реплики: по тишине и длине, не по смыслу · выразительный голос: живые вставки есть, выделить слово во фразе нельзя · экзамен: сотни симулированных разговоров, но текстом |
| Нет | дуплекс в трубке, инструменты у мозга |
| Отложено | поиск по знаниям — справка маленькая; модель со звуком |
И наши секунды в трубке — медиана за неделю:
Норма до первого звука — 1,5 секунды, у нас 2,5. Распознавание почти ничего не стоит, потому что спрятано под паузу. Поток закрыл бы ещё около секунды — это наш следующий шаг.
Два вывода, которые мы вынесли из этой карты. Первый: главный разрыв у нас не в модели, а в слое реального времени и в экзамене. Наш экзамен — почти две тысячи симулированных разговоров за неделю против пятнадцати телефонных: 99' + NB + '% по тексту и ни одной проверки звуком. Второй: та самая ошибка «через три дня → сегодня или завтра?» у нас воспроизводима не потому, что нейросеть не поняла, а потому, что узел сценария мог перезаписать поле, названное клиентом. Это чинится схемой состояния, а не сменой архитектуры.
Семь вопросов вендору в 2026 году
В прошлой статье было шесть вопросов «под капот». Эти — уровнем выше: про то, робот перед вами или агент.
- Распознавание идёт потоком или ждёт конца фразы? Попросите показать задержку до первого звука на длинной реплике.
- Как робот понимает, что я договорил? Скажите «да… я хотел спросить…» с паузой. Вклинился — таймер, дождался — есть смысл.
- Покажите карточку разговора. Скажите «перезвоните через три дня» и посмотрите, что записано. «Сегодня» — значит, внутри автоответчик.
- Что нейросети запрещено? Ответ «всё в промпте» — плохой. Хороший — «фразы проверяются на выходе, цифры только из справки, обещание одно».
- Какие инструменты робот вызывает сам? CRM, календарь, письмо — и кто считает цену: код или модель.
- Как тестируете голосом? Симулятор персон, судья, прогон одного сценария несколько раз — или «прослушиваем выборочно».
- Что происходит, если нейросеть не ответила за три секунды? Правильно: робот говорит по сценарию и заполняет паузу. Неправильно: тишина.
Что забрать из статьи
- Голосовой агент 2026 года — система реального времени, а не цепочка из трёх сервисов. Главная технология в ней — дирижёр с состоянием, а не модель.
- Поток, конец реплики по смыслу и перебивание — это про то, дослушают ли робота. Тишина дороже ошибки.
- Нейросеть — мозг под правилами. Ей нужна шкала свободы и сторожа на выходе, а не «умный промпт».
- Состояние разговора — единственная правда. Сказанное клиентом сценарий не перезаписывает.
- Экзамен текстом — не экзамен. Голосовые агенты теряют качество именно на звуке, шуме и перебиваниях.
- Провалы из живых звонков должны сами становиться тестами.
Продолжение серии: как устроен один звонок изнутри — из чего сделан голосовой робот; четыре типа роботов и цены — какие бывают голосовые роботы; что нужно вокруг робота, чтобы он приносил деньги, — почему робот сам по себе не работает; и как ИИ-агенты меняют работу менеджеров.
Частые вопросы
Чем голосовой агент отличается от голосового робота?
Робот ведёт по сценарию и зовёт нейросеть на нестандартном. Агент держит состояние разговора, работает потоком, даёт себя перебить, вызывает инструменты — CRM, календарь, письмо — и сдаёт экзамен на симуляторе перед выходом на линию. Внешне разница видна в одном: агент не переспрашивает то, что вы уже сказали, и меняет ход разговора под вас.
Что такое оркестратор, дирижёр разговора?
Часть системы, которая знает, кто сейчас говорит, на каком этапе разговор, что уже известно, какова цель, можно ли позвать CRM и пора ли заканчивать. Нейросеть — мозг, дирижёр — нервная система: он решает, когда мозг спрашивают и что из его ответа можно произнести.
Нужна ли нейросеть на каждую реплику?
Нет. Типовые ответы решаются словарём и маленькой моделью с мерой уверенности за миллисекунды и бесплатно; большая нейросеть нужна на незнакомое. В нашем роботе она отвечает примерно за треть реплик: из 5 101 хода за неделю словарь решил 63 %, нейросеть — 31 %.
Что такое barge-in и full-duplex?
Barge-in — способность робота замолчать, когда его перебили, и ответить на сказанное, при этом не замолкая от кашля и шума. Full-duplex — следующий уровень: слушать и говорить одновременно, вставлять «угу» в паузы, не перехватывая слово.
Как проверять голосового агента перед запуском?
Симулятором: персоны клиентов с характером, динамические многоходовые разговоры, автоматический судья и метрики по смыслу, поведению, бизнесу, голосу и технике. Обязательно со звуком, шумом и перебиваниями: на тексте агент всегда выглядит лучше, чем в трубке. И каждый провал живого звонка — в тесты.
Источники
- Voice agent architecture: STT → LLM → TTS, explained — The Voice AI Wiki (Soniox).
- Voice Agent Architecture: Build STT-LLM-TTS Pipeline — AssemblyAI.
- The Voice Agent Architecture Guide: STT, LLM, and TTS Pipeline Design in 2026 — Deepgram.
- τ-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains — arXiv 2603.13686.
- EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents — arXiv 2605.13841.
- Замеры по нашему роботу — журнал боевого сервера за неделю 7–13 сентября 2026.