короткий ответ: качество ии-агента проверяется без всякой магии и без ml-образования — выборочной ручной проверкой 20–30 диалогов в неделю по заранее написанным критериям, четырьмя цифрами на панели (доля корректных ответов, доля эскалаций, время реакции, решённость с первого раза) и привычкой читать логи. этого достаточно, чтобы за час в неделю знать о своём агенте больше, чем средний заказчик узнаёт за год. вся методика — ниже, по шагам. и отдельный честный блок о том, чего измерить нельзя, — чтобы вам не продали «99% точности» на красивом слайде.
почему «вроде нормально» — ловушка
у обычного софта качество бинарное: кнопка либо работает, либо нет. у агента качество — распределение: на 90 диалогов из 100 он отвечает хорошо, на 7 — приемлемо, на 3 — плохо. и снаружи это выглядит как «вроде нормально», пока один из трёх плохих не уйдёт вашему ключевому клиенту.
из этого следует главное правило: агента нельзя проверить, поговорив с ним три раза на демо. три ваших вопроса попадут в те самые 90% — демо всегда проходит отлично, у любого подрядчика. проверять надо поток реальных диалогов, регулярно и по критериям. дальше — как именно.
шаг 1. напишите, что такое «хорошо» — до запуска
звучит банально, пропускается всеми. критерии хорошего ответа для вашего агента — это 5–7 пунктов, написанных человеческим языком. например, для агента на входящих заявках:
- назвал верную цену по актуальному прайсу;
- не пообещал того, чего компания не делает;
- задал уточняющий вопрос, если заявка неполная;
- передал живому менеджеру всё, что обещал передать;
- тон — наш: без «уважаемый клиент» и восклицательных знаков.
эти пять строк — ваш стандарт качества. без них проверка превращается в спор вкусов: заказчику «что-то не нравится», подрядчик показывает «все метрики зелёные», оба искренни, оба бесполезны.
шаг 2. выборочные проверки: 20 диалогов в неделю
механика скучная и рабочая, как чек-лист пилота перед взлётом:
- раз в неделю владелец агента ? тот самый человек внутри команды, без которого агент деградирует. если такого нет — начинать надо не с метрик, а с его назначения. берёт 20–30 случайных диалогов. важно: случайных, а не «посмотрю последние» — в последних всегда перекос в сторону сегодняшней темы.
- каждый диалог оценивается по критериям из шага 1: прошёл / не прошёл, одним тегом причины («цена не та», «тон», «не эскалировал»).
- результат — две цифры в табличку: доля прошедших и топ причин провала.
час времени в неделю. через месяц у вас есть то, чего нет у большинства компаний с ии: динамика качества по неделям и список конкретных слабых мест вместо ощущений. если доля прошедших растёт от 85% к 95% — агент взрослеет. если падает — что-то изменилось в реальности (прайс, ассортимент, сезон), а в агенте не изменилось, и вы узнали об этом за неделю, а не за квартал.
шаг 3. четыре цифры на панели
помимо ручных проверок, агент должен сам отдавать метрики — подрядчик обязан настроить панель, это часть внедрения, а не доп-услуга. цифр четыре, больше на старте не нужно:
| метрика | что показывает | тревожный сигнал |
|---|---|---|
| доля корректных ответов | результат ваших выборочных проверок | ниже 85–90% или падает две недели подряд |
| доля эскалаций на человека | как часто агент сам отдаёт диалог живым | около нуля — тоже плохо: агент «уверен» там, где не должен |
| время первого ответа | скорость реакции на клиента | растёт — что-то с интеграциями |
| решённость с первого раза | сколько вопросов закрыто без возврата клиента | падает при «нормальных» ответах — агент отвечает красиво, но мимо |
отдельно про эскалации, потому что это самая недооценённая метрика. интуиция говорит «чем меньше эскалаций, тем лучше агент». практика говорит наоборот: здоровый агент отдаёт человеку 10–20% диалогов — редкие, спорные, эмоциональные. агент с нулём эскалаций не «идеален» — он самоуверен, и его ошибки уходят клиентам молча. если подрядчик хвастается «агент закрывает 100% сам» — это флаг, а не достижение.
шаг 4. логи — главный инструмент, о котором забывают
у нормального агента каждое действие записано: что пришло на вход, что агент понял, куда сходил (crm, прайс, календарь), что ответил, почему. это и есть логи, и требовать к ним доступ нужно на старте.
зачем они владельцу процесса, а не только разработчику:
- разбор инцидентов. клиент получил странный ответ — в логе видно, где сломалось: агент не нашёл товар в прайсе, потому что тот назван по-другому. чинится за минуты, без «мистики нейросетей».
- поиск систематических дыр. раз в месяц полезно смотреть не диалоги, а частоты: какие вопросы агент чаще всего не понимает. это готовый список улучшений — и заодно бесплатная аналитика о том, что вообще спрашивают ваши клиенты.
- доказуемость. спор «агент такого не обещал» решается не памятью, а записью.
если подрядчик говорит, что логов нет или «они технические, вам не надо», — перед вами чёрный ящик, а чёрный ящик в проде — это не агент, это лотерея с вашим брендом в качестве ставки.
человек в контуре: не костыль, а конструкция
фраза «человек в контуре» звучит как признание слабости ии. на деле это признак взрослой архитектуры: агент делает массовую часть работы, человек — контролирует границы.
правило простое: чем выше цена ошибки, тем ближе человек. ответ на типовой вопрос — агент шлёт сам. черновик коммерческого предложения на крупную сумму — агент готовит, человек жмёт «отправить». изменение цены, возврат денег, юридические обещания — только человек, агент лишь подкладывает фактуру. это не временная мера «пока ии не поумнеет» — это постоянная конструкция, как двойной контроль платежей в бухгалтерии, который никто не называет недоверием к бухгалтеру.
что измерить нельзя — честный блок
чтобы картина была полной, три вещи, которые ни одна панель не покажет:
- упущенное. метрики видят, как агент ответил. они не видят клиента, который посмотрел на кривой первый ответ и молча ушёл. частично ловится решённостью с первого раза, полностью — никогда.
- завтрашнее качество. агент, идеальный сегодня, завтра встречает новый ассортимент, сезон, тип клиентов. «точность 97%» — это факт о прошлой неделе, а не свойство агента. поэтому проверки регулярные, а не приёмочные.
- все ошибки заранее. тесты покрывают то, что вы предусмотрели; реальность богаче. вопрос к системе не «может ли агент ошибиться» (может), а «как быстро вы об этом узнаёте и чините». неделя — норма. квартал — катастрофа.
поэтому когда в кп написано «гарантируем 99% точности» без описания того, как считали и на чём, — это не метрика, это маркетинг с двумя девятками.
коротко
- «вроде нормально» — не оценка. оценка — это критерии на бумаге, 20–30 случайных диалогов в неделю и динамика по неделям.
- четыре цифры на панели: корректность, эскалации, скорость, решённость. ноль эскалаций — тревога, а не победа.
- логи обязательны, доступ — ваш. чёрный ящик в проде недопустим.
- человек в контуре — постоянная конструкция для дорогих ошибок, а не временный костыль.
- час в неделю на проверки — вся цена вопроса. дешевле одного скандала с клиентом.