ГлавнаяСтатьи → Из чего состоят голосовые агенты
Разбор · как устроены голосовые агенты в 2026

Из чего состоят голосовые агенты: десять технологий и одна главная

Год назад голосового робота рисовали тремя кубиками: распознать речь, ответить нейросетью, озвучить. В 2026 году его собирают как сотрудника: он слушает и говорит одновременно, помнит правду о разговоре, замолкает, когда его перебили, и сдаёт экзамен перед выходом на линию. Ниже — десять технологий, из которых это складывается, и честная карта: что из этого есть у нас, чего нет и сколько секунд в трубке.

Олег Полушин· · 14 мин чтения
Всё, что описано ниже, можно послушать прямо сейчасНаш робот разговаривает голосом в браузере: слушает, перебивается, помнит сказанное и принимает заявку внутри диалога. Без регистрации и звонка менеджера.
Поговорить с роботом →
Коротко. Современный голосовой агент — это система реального времени, а не цепочка из трёх сервисов. В ней десять технологий: потоковая обработка, определение конца реплики, перебивание, дуплекс, дирижёр, состояние разговора, память, намерения, инструменты и экзамен. Нейросеть в этой системе — мозг, но не начальник: маршрут, деньги, обещания и факты держит дирижёр с правилами. Главный признак сотрудника, а не автоответчика — он не переспрашивает то, что вы уже сказали, и меняет ход разговора под вас, а не тащит вас по скрипту.

Три кубика, десять слоёв, сотрудник

Робот первого поколения — автоинформатор: проиграл запись, распознал «да» или «нет», перевёл на человека. Второе поколение — сценарный робот с распознаванием и нейросетью на подхвате. Он звучит живо на демо и ломается на десятом реальном звонке: не там замолчал, спросил дважды, не понял «через три дня».

Разница не в модели, а в устройствеАвтоинформаторзапись, «да» или «нет»умеетдозвонитьсяломаетсяна любом вопросеСценарный робответки и нейросеть сбокуумеетпровести по скриптуломаетсяна «через три дня»Голосовой агентпоток, состояние, дирижёрумеетвести к целиломаетсяпредсказуемо
Агент ломается реже не потому, что модель умнее, а потому что ему там, где нельзя, запрещено думать самому.

Третье поколение отличает не «модель умнее», а устройство: всё происходит параллельно, у разговора есть состояние, а у нейросети — границы. Такого робота уместно называть цифровым сотрудником, и не ради красоты слова: он ведёт разговор к цели бизнеса, а не отрабатывает ветки.

Всё одновременно: поток вместо очереди

Старый робот работает по очереди: человек договорил, распознали целиком, подумали целиком, написали текст целиком, озвучили целиком — и только тогда начали говорить. Каждая стрелка — своя задержка, и они складываются. Отсюда знакомое: «Здравствуйте… [две секунды тишины] …да, слушаю вас».

Сколько ждёт человек до первого звука роботаПо очередираспознать 0,8подумать 1,2озвучить 0,9конец речи 0,4передать 0,23,5 с до первого звукаПотокомраспознаёт, пока человек говоритдумает с первых словозвучивает первый кусокпервый звук через 0,8–1,2 с0 с1 с2 с3 с
Порядок величин по открытым замерам; свои цифры — в конце статьи.

Современный вариант делает всё сразу. Распознавание отдаёт слова по мере того, как человек говорит, нейросеть начинает думать над началом фразы, синтез озвучивает первое предложение, пока второе ещё пишется. Задержка перестаёт быть суммой и становится максимумом из нескольких параллельных дел. Поэтому задержка — свойство всей цепочки, а не скорости модели: самая быстрая нейросеть не спасёт, если распознавание ждёт конца фразы, а синтез — конца текста.

Закон: тишина в трубке дороже ошибки. Человек ждёт ответа около секунды. Дальше — «алло?», «вы тут?» и трубка. Поэтому поток — не про красоту, а про то, дослушают ли робота вообще.

Человек договорил или думает? Конец реплики

Второй столп — понять, что человек закончил. Кажется мелочью, а это одна из самых трудных задач голосового ИИ. Детектор речи отвечает только на вопрос «сейчас звучит голос или тишина». Но пауза не равна концу фразы.

«Да…» может быть окончанием. «Да, я хотел спросить…» — очевидно нет. «Ну… я не знаю… наверное…» — человек думает вслух, и робот, который вклинится после первой паузы, будет выглядеть невоспитанным.

СпособКак работаетЧто ломается
Таймер тишиныпауза дольше заданной — конецрежет думающего и заставляет ждать того, кто уже ждёт ответа
Таймер по контекступосле вопроса «да или нет?» пауза короче, после «расскажите» — длиннее; длинную реплику дослушивают дольшенужен сигнал от дирижёра: какой вопрос задан
По смыслураспознавание идёт потоком; фраза с открытым концом — «и», «а», «через», «в» — значит, ждёмнужен поток распознавания; сложнее всего

В боевых системах работают все три слоя сразу: таймер страхует, контекст подстраивает, смысл решает спорные случаи.

Дайте себя перебить

Обычный робот

договаривает, что бы ни случилось

Робот: «Наш робот может напоминать клиентам о—»
Клиент: «Да понял, а сколько стоит?»
Робот: «—записи и принимать—»

Клиент кладёт трубку

Современный

замолкает и отвечает на сказанное

Робот: «Наш робот может напоминать кли—»
Клиент: «Сколько стоит?»
Робот: «От семи рублей за минуту».

Разговор продолжается

Это называется перебиванием, и архитектурно оно требует трёх вещей: слушать человека, пока говоришь сам; отличить речь от кашля; остановить озвучку и выбросить недосказанное, а не «доклевать» его после.

Самое трудное здесь — не замолчать, а не замолчать зря. Робот, который замирает от каждого «угу», шороха и второй линии в клинике, раздражает сильнее того, который договаривает.

Пять защит от ложного перебивания · наш рабочий набор
  • Громкость выше шума линии в несколько раз, а не выше фиксированного порога: у каждой линии свой фон.
  • Речь, а не всплеск: срабатывает только полсекунды речи в скользящем окне, а не один громкий кусок звука.
  • Глухота на старте своего хода: первые доли секунды нашей реплики — это хвост речи человека, не перебивание.
  • Строгий порог в приветствии: пока робот представляется, перебить его труднее — иначе «алло?» в первую секунду рвёт вход.
  • Пауза после перебивания: замолчал — не начинай следующий кусок сразу, дай человеку договорить.

Дуплекс: слушать и говорить одновременно

В живом разговоре двое могут говорить одновременно, вставлять «угу», начинать фразу, пока собеседник заканчивает, уступать слово. Агент с полным дуплексом умеет то же — это следующий уровень после перебивания.

Разница слышна на длинном рассказе клиента. Робот с очередью молчит всю минуту, и человек начинает сомневаться, слышат ли его. Дуплексный роняет «угу», «так», «поняла» в паузы, не перехватывая слово. По этой мелочи ухо и отличает живого собеседника от автоответчика.

Честно: полноценный дуплекс сегодня есть у единиц, и в основном там, где модель работает прямо со звуком. У большинства, включая наш робот в трубке, выход — одна очередь, и «угу» звучит между ходами, а не поверх речи.

Дирижёр: кто главный в разговоре

Вот здесь живёт главная технология — и здесь же у большинства роботов живёт проблема. Дирижёр знает: кто сейчас говорит; перебили ли нас; на каком этапе разговор; что мы уже знаем и что ещё надо узнать; какова цель звонка; можно ли сейчас позвать CRM; пора ли заканчивать.

НейросетьдумаетДирижёрсостояние · намерениепамять · правилаинструменты · очерёдностьЧеловекговоритРаспознаваниеслышитСинтезговоритЧеловекслышитCRM, календарь, письмо — руки, их зовёт только дирижёр
Нейросеть — мозг. Дирижёр — нервная система: он решает, когда спросить мозг и что из его ответа можно произнести.

Он принципиально отличается от «поставили нейросеть в телефон и дали ей промпт». В той схеме нейросеть — всё сразу: и понимание, и решение, и речь, и память. В современной — она один из исполнителей у дирижёра.

Нейросеть — мозг. Дирижёр — нервная система. Правила — закон. Инструменты — руки. CRM — память бизнеса. Робот, у которого мозг сам себе нервная система, закон и руки, однажды пообещает скидку.

Состояние: правда о разговоре

Клиент говорит: «Перезвоните через три дня». Скриптовый робот, у которого следующая ветка спрашивает «сегодня или завтра?», спросит «сегодня или завтра?». Клиент повторит. Робот спросит «до обеда или после?». Так выглядит автоответчик, спрятанный внутри «разговорного ИИ»: нейросеть человека поняла, а движок разговора не дал ей изменить траекторию.

Лечится это не более умной моделью, а состоянием разговора — карточкой, которая заполняется по ходу и является единственной правдой. И правилом: значение, названное клиентом, узел сценария перезаписать не может.

ПолеЗначениеОткуда
ИмяЕлена Петровнасказал клиент
Кто напоминает о записиадминистраторысказал клиент
Канал напоминанийСМС и звонкисказал клиент
Интересестьпо ходу разговора
Ценаспросилпо ходу разговора
Перезвончерез три днясказал клиент — сценарий не перезаписывает
Время звонкане определеноещё спросить

Карточка разговора после трёх минут. Состояние — это не история чата, а то, что верно прямо сейчас.

Память: не расшифровка, а факты

Раньше нейросети отдавали весь разговор: «вот тебе пять тысяч слов, разберись». Это дорого, медленно и ненадёжно — модель теряет то, что было в начале, и «вспоминает» то, чего не было. Современный подход — двухслойная память: сверху факты из карточки, снизу последние несколько реплик, чтобы понимать контекст фразы. Всё остальное модели не нужно.

Между звонками память живёт не в голове робота, а в базе: карточка компании, из которой берётся, кто снял трубку в прошлый раз, кто передал номер и о чём договорились. Так робот во втором звонке не обращается к администратору именем директора.

Намерение: что человек делает прямо сейчас

«А что ещё ваш робот умеет?» — для агента это не текст, а действие: спрашивает о возможностях. «Я уже это говорил» — уже сказал. «Через три дня» — назвал время перезвона. «Да вы меня достали» — раздражение. Нейросеть здесь очень хороша: она понимает смысл, а не ищет слова.

Но у неё есть недостаток — она всегда что-нибудь выберет. Поэтому понимание строится лестницей: быстрый словарь для типовых ответов, своя маленькая модель с мерой уверенности, которая умеет честно промолчать, и большая нейросеть на всё незнакомое.

Кто понимает реплику в нашем роботе · 5 101 ход за неделю
словарь типовых ответов — миллисекунды, бесплатно63 %
нейросеть — на незнакомое31 %
не понял и честно переспросил5 %
платная модель второго эшелона1 %
Мозг зовут на треть реплик — остальное решается быстро и бесплатно.

Нейросеть не должна управлять всем

Это самый важный принцип современной архитектуры. Нейросеть хорошо понимает язык, строит гипотезы, выбирает тактику, работает с возражениями. Но ей нельзя без ограничений списывать деньги, менять CRM, назначать что угодно, раскрывать данные, игнорировать стоп-лист и нарушать правила бизнеса. Поэтому у зрелого агента есть шкала свободы, и уровень выбирается осознанно.

Шкала свободы нейросети · так мы задаём её в настройках робота
  • A0 — только понимает реплику, говорит сценарий.
  • A1 — говорит своё там, где у сценария нет ответа, но вопрос задаёт сценарий.
  • A2 — исполняет приём, выбранный дирижёром: кейс, довод, гипотеза о потребности.
  • A3 — меняет состояние голоса: серьёзно, спокойно, весело.
  • A4 — зовёт инструменты: расчёт, календарь, CRM.
  • A5 — принимает решения о скидках и условиях. Этого уровня у робота быть не должно — это руководитель.

Уровень растёт по подтверждённому качеству и снимается при ухудшении. А закон, то есть правила, работает так: запрещённые фразы срезаются на выходе, а не в промпте; цифры и сроки звучат только из справки; обещание у робота одно, заранее согласованное; стоп-лист сильнее любого приёма; трубка кладётся только по подтверждённому прощанию.

Правило, которое мы выучили дорого: норма речи, записанная только в промпте, ничего не стоит. У каждой нормы должен быть сторож на выходе — код, который проверяет фразу перед тем, как она прозвучит.

Руки: инструменты

Здесь чат-бот превращается в сотрудника. Клиент: «Запишите меня на завтра в три». Нейросеть понимает намерение, но сама запись не происходит — она зовёт инструмент: проверить слот в календаре. Календарь отвечает «свободно», и только тогда робот говорит: «Да, завтра в три есть время, записываю».

Бот говорит, агент делает. Инструментами могут быть CRM, календарь, телефония, учётная система, база клиентов, расчёт стоимости, проверка задолженности.

Два уточнения из практики. Инструмент должен быть детерминированным: цену считает код по прайсу, а не нейросеть «примерно». И большинству бизнесов на первом этапе хватает трёх рук — записать итог в CRM, поставить перезвон в очередь и отправить письмо. Календарь и оплата — когда клиенты сами начинают просить назначить время.

Знания компании

Клиент спрашивает: «А у вас можно перенести запись?». Нейросеть не должна гадать — она берёт ответ из базы знаний компании: «перенос возможен не позднее чем за три часа». Поиск по базе нужен там, где знаний много, они часто меняются или должны иметь источник.

Без фанатизма. Если справка робота умещается на двух страницах, поиск по ней не нужен — её целиком кладут в задание модели, а факты с цифрами помечают как единственно разрешённые. Поиск понадобится на прайсе клиники в двести позиций.

Персонаж и профессиональный мозг

Промпт

«ты менеджер по продажам»

Одна строка роли. Нейросеть сама додумывает характер, настойчивость, шутки и границы — каждый раз немного по-разному.

Бот, который читает скрипт

Паспорт сотрудника

персонаж плюс профессиональный мозг

Кто она, как думает, что считает хорошим результатом, как спорит, когда шутит и молчит, чего никогда не делает. Плюс продукт, отрасль, кейсы, экономика клиента и типовые возражения.

Цифровой менеджер с опытом

У такого сотрудника есть мнение: он может не согласиться, привести довод и рассказать случай «у нашего клиента». Но факты, кейсы и цифры он берёт только из своей базы, а не сочиняет.

Разговор, который подстраивается

Старый робот: вопрос, ответ, следующий вопрос. Современный после каждого ответа выбирает: уточнить, возразить, ответить на встречный вопрос, предложить гипотезу или продолжить квалификацию.

Старый

идёт по ветке

Робот: «Кто у вас напоминает пациентам о записи?»
Клиент: «Администраторы. А ваш робот может обзванивать тех, кто перестал ходить?»
Робот: «А сколько звонков делают администраторы?»

Вопрос клиента проигнорирован

Современный

отвечает и возвращается к цели

Робот: «Кто у вас напоминает пациентам о записи?»
Клиент: «Администраторы. А ваш робот может обзванивать тех, кто перестал ходить?»
Робот: «Да, может. И это как раз интересный сценарий — поднять тех, кто давно не был. А сколько таких у вас накапливается за месяц?»

Ответил и продолжил квалификацию

Внутри это три механики: ответить на встречный вопрос из справки, вернуться к вопросу ветки другой формулировкой, а не слово в слово, и присоединиться — коротко пересказать сказанное клиентом, чтобы он слышал, что понят. Плюс сторож топтания: если один и тот же вопрос прозвучал дважды, третий раз робот идёт дальше, а не по кругу.

Эмоции меняют стратегию, а не только голос

Раньше эмоцию использовали для голоса: раздражён — говорим спокойнее. Современный подход — эмоция меняет стратегию разговора.

Состояние клиентаЧто делает агент
Нейтраленобычный ход
Запуталсяупрощает: короче, одна мысль на фразу
Скептикобъясняет: довод, кейс, цифра из базы
Раздражёнкороче и признаёт: «да, повторилась — виновата», без бодрого тона и без уточняющих вопросов
Торопитсясразу к сути, приёмы выключены
Заинтересованраскрывает: гипотеза, следующий шаг, время звонка

Это важнее, чем красивый «эмоциональный синтез».

Голос: уместно, а не просто похоже

Современный синтезатор управляет темпом, паузами, ударениями, интонацией и окраской. Задача перестала быть «сделать голос как у человека» и стала «сделать речь уместной для ситуации». Слово «понятно» с одинаковым текстом звучит заинтересованно, нейтрально, сочувственно или устало — и это разная коммуникация.

Из практики: живость дают не только модели. Вдох перед фразой, «мм» на раздумье, короткий смешок, «секундочку», записанные тем же голосом и вставленные в нужные места, делают для уха больше, чем «эмоциональный» синтез.

Главное — один голос. Вставки чужим голосом ухо ловит мгновенно, и вся живость превращается в монтаж.

Другой путь: модель работает со звуком

Всё описанное — классическая цепочка: звук, текст, нейросеть, текст, звук. Есть другой путь: модель, которая работает прямо со звуком и отвечает звуком, без текста посередине. Она лучше сохраняет живость речи и убирает промежуточные преобразования.

Классическая цепочка

звук → текст → мозг → текст → звук

Каждое звено видно и заменяемо. Можно проверить фразу до того, как она прозвучит, позвать инструмент, записать трассировку разговора.

Контроль и предсказуемость

Модель со звуком

звук → звук

Живее интонации, быстрее ответ, естественный дуплекс. Но сторожа на выходе поставить сложнее, а поменять один компонент, не трогая остальные, — нельзя.

Живость и скорость

Для бизнеса это не автоматическая победа. Мы следим за этим направлением, но в бой не берём.

Экзамен: агент тестируется как система

Раньше тест выглядел так: «правильно ли робот ответил на эту фразу?». Тысяча фраз, галочка. Современный тест — симулятор: персона клиента с характером, сценарий, многоходовый разговор бот-с-ботом, автоматический судья и метрики.

100персонклиентов×20сценариев×15типовповедения××3прогонакаждогоСудьяоцениваетразговор5 осейметрики
Разговор бот-с-ботом, многоходовый и динамический, а не проверка одной фразы. Сто персон на двадцать сценариев — это две тысячи разговоров до первого звонка.
ОсьЧто проверяет судья
Смыслпонял вопрос, сохранил контекст, не потерял информацию
Поведениене повторил вопрос, не проигнорировал, не зациклился, правильно завершил
Бизнесдостиг цели, корректно квалифицировал, не создал ложный лид, правильно записал в CRM
Голосне перебил, верно определил конец реплики, остановился при перебивании, не завис на паузе
Техниказадержка, ошибки распознавания, отказы инструментов и синтеза, обрыв связи

Так работают специализированные тесты голосовых агентов, и их результаты показательны: в реалистичных звуковых условиях агенты заметно теряют качество относительно текстовых. Тест текстом — не тест.

Из этого следуют два правила. Провалы из живых звонков должны сами становиться тестами — иначе они вернутся. И одну задачу гоняют несколько раз: агент, который прошёл один раз из одного, часто проходит один из четырёх.

Десять понятий вместо тридцати моделей

Не надо изучать тридцать моделей распознавания, двадцать синтезаторов и пятнадцать нейросетей. Полезнее понять десять технологий и уметь задать по ним вопрос.

ТехнологияПростыми словамиЗачем бизнесу
Распознавание речиуслышать человекапонять, что сказано
Нейросетьподуматьпонять смысл и выбрать ответ
Синтеззаговоритьголос
Потокделать всё одновременноскорость ответа
Конец репликипонять, что человек договорилне перебивать и не тормозить
Перебиваниедать себя перебитьестественный разговор
Дирижёруправлять всем разговоромцель звонка, а не ветки
Состояние и памятьпомнить фактыне спрашивать дважды
Инструментыруки сотрудникаCRM, календарь, письмо
Экзаменпроверка перед выходомпонять, можно ли выпускать

Второй уровень, когда первые десять освоены: знания компании, персонаж, эмоция как стратегия, планирование разговора, дуплекс и модель со звуком.

Где на этой карте стоим мы

Мы делаем голосового робота, который звонит клиникам и договаривается о звонке руководителя. Вот честная карта по тем же двадцати пунктам, снятая с кода и с боевого сервера 13 сентября. Провалы наравне с победами — иначе статья была бы рекламой.

Есть целиком
10
Частично
6
Нет
2
Отложено осознанно
2
СтатусЧто именно
Естьпонимание лестницей, дирижёр, состояние, память в два слоя, персонаж, адаптивный разговор, эмоция как стратегия, нейросеть под правилами, перебивание с пятью защитами
Частичнопоток: распознавание стартует заранее в паузе, но не потоком, синтез кусками, но файлом · конец реплики: по тишине и длине, не по смыслу · выразительный голос: живые вставки есть, выделить слово во фразе нельзя · экзамен: сотни симулированных разговоров, но текстом
Нетдуплекс в трубке, инструменты у мозга
Отложенопоиск по знаниям — справка маленькая; модель со звуком

И наши секунды в трубке — медиана за неделю:

До первого звука
2,5 с
Мозг
1,2 с
Синтез первого куска
0,85 с
Распознавание
≈ 0

Норма до первого звука — 1,5 секунды, у нас 2,5. Распознавание почти ничего не стоит, потому что спрятано под паузу. Поток закрыл бы ещё около секунды — это наш следующий шаг.

Два вывода, которые мы вынесли из этой карты. Первый: главный разрыв у нас не в модели, а в слое реального времени и в экзамене. Наш экзамен — почти две тысячи симулированных разговоров за неделю против пятнадцати телефонных: 99' + NB + '% по тексту и ни одной проверки звуком. Второй: та самая ошибка «через три дня → сегодня или завтра?» у нас воспроизводима не потому, что нейросеть не поняла, а потому, что узел сценария мог перезаписать поле, названное клиентом. Это чинится схемой состояния, а не сменой архитектуры.

Переход, который стоит делать в 2026 году, — не «дать нейросети руль», а сделать состояние разговора единственной правдой. Скриптовый робот → сотрудник с состоянием. Это важнее выбора «самой умной модели» или «самого человечного голоса».

Семь вопросов вендору в 2026 году

В прошлой статье было шесть вопросов «под капот». Эти — уровнем выше: про то, робот перед вами или агент.

Задайте на демо
  • Распознавание идёт потоком или ждёт конца фразы? Попросите показать задержку до первого звука на длинной реплике.
  • Как робот понимает, что я договорил? Скажите «да… я хотел спросить…» с паузой. Вклинился — таймер, дождался — есть смысл.
  • Покажите карточку разговора. Скажите «перезвоните через три дня» и посмотрите, что записано. «Сегодня» — значит, внутри автоответчик.
  • Что нейросети запрещено? Ответ «всё в промпте» — плохой. Хороший — «фразы проверяются на выходе, цифры только из справки, обещание одно».
  • Какие инструменты робот вызывает сам? CRM, календарь, письмо — и кто считает цену: код или модель.
  • Как тестируете голосом? Симулятор персон, судья, прогон одного сценария несколько раз — или «прослушиваем выборочно».
  • Что происходит, если нейросеть не ответила за три секунды? Правильно: робот говорит по сценарию и заполняет паузу. Неправильно: тишина.

Что забрать из статьи

Шесть мыслей
  • Голосовой агент 2026 года — система реального времени, а не цепочка из трёх сервисов. Главная технология в ней — дирижёр с состоянием, а не модель.
  • Поток, конец реплики по смыслу и перебивание — это про то, дослушают ли робота. Тишина дороже ошибки.
  • Нейросеть — мозг под правилами. Ей нужна шкала свободы и сторожа на выходе, а не «умный промпт».
  • Состояние разговора — единственная правда. Сказанное клиентом сценарий не перезаписывает.
  • Экзамен текстом — не экзамен. Голосовые агенты теряют качество именно на звуке, шуме и перебиваниях.
  • Провалы из живых звонков должны сами становиться тестами.

Продолжение серии: как устроен один звонок изнутри — из чего сделан голосовой робот; четыре типа роботов и цены — какие бывают голосовые роботы; что нужно вокруг робота, чтобы он приносил деньги, — почему робот сам по себе не работает; и как ИИ-агенты меняют работу менеджеров.

Частые вопросы

Чем голосовой агент отличается от голосового робота?

Робот ведёт по сценарию и зовёт нейросеть на нестандартном. Агент держит состояние разговора, работает потоком, даёт себя перебить, вызывает инструменты — CRM, календарь, письмо — и сдаёт экзамен на симуляторе перед выходом на линию. Внешне разница видна в одном: агент не переспрашивает то, что вы уже сказали, и меняет ход разговора под вас.

Что такое оркестратор, дирижёр разговора?

Часть системы, которая знает, кто сейчас говорит, на каком этапе разговор, что уже известно, какова цель, можно ли позвать CRM и пора ли заканчивать. Нейросеть — мозг, дирижёр — нервная система: он решает, когда мозг спрашивают и что из его ответа можно произнести.

Нужна ли нейросеть на каждую реплику?

Нет. Типовые ответы решаются словарём и маленькой моделью с мерой уверенности за миллисекунды и бесплатно; большая нейросеть нужна на незнакомое. В нашем роботе она отвечает примерно за треть реплик: из 5 101 хода за неделю словарь решил 63 %, нейросеть — 31 %.

Что такое barge-in и full-duplex?

Barge-in — способность робота замолчать, когда его перебили, и ответить на сказанное, при этом не замолкая от кашля и шума. Full-duplex — следующий уровень: слушать и говорить одновременно, вставлять «угу» в паузы, не перехватывая слово.

Как проверять голосового агента перед запуском?

Симулятором: персоны клиентов с характером, динамические многоходовые разговоры, автоматический судья и метрики по смыслу, поведению, бизнесу, голосу и технике. Обязательно со звуком, шумом и перебиваниями: на тексте агент всегда выглядит лучше, чем в трубке. И каждый провал живого звонка — в тесты.

Источники

  • Voice agent architecture: STT → LLM → TTS, explained — The Voice AI Wiki (Soniox).
  • Voice Agent Architecture: Build STT-LLM-TTS Pipeline — AssemblyAI.
  • The Voice Agent Architecture Guide: STT, LLM, and TTS Pipeline Design in 2026 — Deepgram.
  • τ-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains — arXiv 2603.13686.
  • EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents — arXiv 2605.13841.
  • Замеры по нашему роботу — журнал боевого сервера за неделю 7–13 сентября 2026.
Бесплатно · за 24 часа

Покажу, что происходит в вашей базе

Оставьте контакты — на коротком созвоне подключимся к вашей CRM (только чтение), и за 24 часа пришлю разбор: сумма потерь и ТОП-10 — кто под риском, кто не платит, кого не ведут.