короткий ответ: качество ии-агента проверяется без всякой магии и без ml-образования — выборочной ручной проверкой 20–30 диалогов в неделю по заранее написанным критериям, четырьмя цифрами на панели (доля корректных ответов, доля эскалаций, время реакции, решённость с первого раза) и привычкой читать логи. этого достаточно, чтобы за час в неделю знать о своём агенте больше, чем средний заказчик узнаёт за год. вся методика — ниже, по шагам. и отдельный честный блок о том, чего измерить нельзя, — чтобы вам не продали «99% точности» на красивом слайде.

почему «вроде нормально» — ловушка

у обычного софта качество бинарное: кнопка либо работает, либо нет. у агента качество — распределение: на 90 диалогов из 100 он отвечает хорошо, на 7 — приемлемо, на 3 — плохо. и снаружи это выглядит как «вроде нормально», пока один из трёх плохих не уйдёт вашему ключевому клиенту.

из этого следует главное правило: агента нельзя проверить, поговорив с ним три раза на демо. три ваших вопроса попадут в те самые 90% — демо всегда проходит отлично, у любого подрядчика. проверять надо поток реальных диалогов, регулярно и по критериям. дальше — как именно.

шаг 1. напишите, что такое «хорошо» — до запуска

звучит банально, пропускается всеми. критерии хорошего ответа для вашего агента — это 5–7 пунктов, написанных человеческим языком. например, для агента на входящих заявках:

  • назвал верную цену по актуальному прайсу;
  • не пообещал того, чего компания не делает;
  • задал уточняющий вопрос, если заявка неполная;
  • передал живому менеджеру всё, что обещал передать;
  • тон — наш: без «уважаемый клиент» и восклицательных знаков.

эти пять строк — ваш стандарт качества. без них проверка превращается в спор вкусов: заказчику «что-то не нравится», подрядчик показывает «все метрики зелёные», оба искренни, оба бесполезны.

шаг 2. выборочные проверки: 20 диалогов в неделю

механика скучная и рабочая, как чек-лист пилота перед взлётом:

  1. раз в неделю владелец агента ? тот самый человек внутри команды, без которого агент деградирует. если такого нет — начинать надо не с метрик, а с его назначения. берёт 20–30 случайных диалогов. важно: случайных, а не «посмотрю последние» — в последних всегда перекос в сторону сегодняшней темы.
  2. каждый диалог оценивается по критериям из шага 1: прошёл / не прошёл, одним тегом причины («цена не та», «тон», «не эскалировал»).
  3. результат — две цифры в табличку: доля прошедших и топ причин провала.

час времени в неделю. через месяц у вас есть то, чего нет у большинства компаний с ии: динамика качества по неделям и список конкретных слабых мест вместо ощущений. если доля прошедших растёт от 85% к 95% — агент взрослеет. если падает — что-то изменилось в реальности (прайс, ассортимент, сезон), а в агенте не изменилось, и вы узнали об этом за неделю, а не за квартал.

шаг 3. четыре цифры на панели

помимо ручных проверок, агент должен сам отдавать метрики — подрядчик обязан настроить панель, это часть внедрения, а не доп-услуга. цифр четыре, больше на старте не нужно:

метрикачто показываеттревожный сигнал
доля корректных ответоврезультат ваших выборочных проверокниже 85–90% или падает две недели подряд
доля эскалаций на человекакак часто агент сам отдаёт диалог живымоколо нуля — тоже плохо: агент «уверен» там, где не должен
время первого ответаскорость реакции на клиентарастёт — что-то с интеграциями
решённость с первого разасколько вопросов закрыто без возврата клиентападает при «нормальных» ответах — агент отвечает красиво, но мимо

отдельно про эскалации, потому что это самая недооценённая метрика. интуиция говорит «чем меньше эскалаций, тем лучше агент». практика говорит наоборот: здоровый агент отдаёт человеку 10–20% диалогов — редкие, спорные, эмоциональные. агент с нулём эскалаций не «идеален» — он самоуверен, и его ошибки уходят клиентам молча. если подрядчик хвастается «агент закрывает 100% сам» — это флаг, а не достижение.

шаг 4. логи — главный инструмент, о котором забывают

у нормального агента каждое действие записано: что пришло на вход, что агент понял, куда сходил (crm, прайс, календарь), что ответил, почему. это и есть логи, и требовать к ним доступ нужно на старте.

зачем они владельцу процесса, а не только разработчику:

  • разбор инцидентов. клиент получил странный ответ — в логе видно, где сломалось: агент не нашёл товар в прайсе, потому что тот назван по-другому. чинится за минуты, без «мистики нейросетей».
  • поиск систематических дыр. раз в месяц полезно смотреть не диалоги, а частоты: какие вопросы агент чаще всего не понимает. это готовый список улучшений — и заодно бесплатная аналитика о том, что вообще спрашивают ваши клиенты.
  • доказуемость. спор «агент такого не обещал» решается не памятью, а записью.

если подрядчик говорит, что логов нет или «они технические, вам не надо», — перед вами чёрный ящик, а чёрный ящик в проде — это не агент, это лотерея с вашим брендом в качестве ставки.

человек в контуре: не костыль, а конструкция

фраза «человек в контуре» звучит как признание слабости ии. на деле это признак взрослой архитектуры: агент делает массовую часть работы, человек — контролирует границы.

правило простое: чем выше цена ошибки, тем ближе человек. ответ на типовой вопрос — агент шлёт сам. черновик коммерческого предложения на крупную сумму — агент готовит, человек жмёт «отправить». изменение цены, возврат денег, юридические обещания — только человек, агент лишь подкладывает фактуру. это не временная мера «пока ии не поумнеет» — это постоянная конструкция, как двойной контроль платежей в бухгалтерии, который никто не называет недоверием к бухгалтеру.

что измерить нельзя — честный блок

чтобы картина была полной, три вещи, которые ни одна панель не покажет:

  • упущенное. метрики видят, как агент ответил. они не видят клиента, который посмотрел на кривой первый ответ и молча ушёл. частично ловится решённостью с первого раза, полностью — никогда.
  • завтрашнее качество. агент, идеальный сегодня, завтра встречает новый ассортимент, сезон, тип клиентов. «точность 97%» — это факт о прошлой неделе, а не свойство агента. поэтому проверки регулярные, а не приёмочные.
  • все ошибки заранее. тесты покрывают то, что вы предусмотрели; реальность богаче. вопрос к системе не «может ли агент ошибиться» (может), а «как быстро вы об этом узнаёте и чините». неделя — норма. квартал — катастрофа.

поэтому когда в кп написано «гарантируем 99% точности» без описания того, как считали и на чём, — это не метрика, это маркетинг с двумя девятками.

коротко

  • «вроде нормально» — не оценка. оценка — это критерии на бумаге, 20–30 случайных диалогов в неделю и динамика по неделям.
  • четыре цифры на панели: корректность, эскалации, скорость, решённость. ноль эскалаций — тревога, а не победа.
  • логи обязательны, доступ — ваш. чёрный ящик в проде недопустим.
  • человек в контуре — постоянная конструкция для дорогих ошибок, а не временный костыль.
  • час в неделю на проверки — вся цена вопроса. дешевле одного скандала с клиентом.