Инструкции/Тестирование чат-бота

 

Раздел "Тестирование" предназначен для проверки работы чат-ботов, ИИ-агентов, детекторов сущностей (NER) и сервисов транскрибации в безопасной среде. Здесь можно:

  • Протестировать ответы бота или агента на различные вопросы.
  • Настроить параметры нейросети для конкретного бота или агента.
  • Проверить работу тестовой версии бота после переобучения.
  • Оценить корректность ответов и отправить обратную связь для дообучения.
  • Управлять датасетом: просматривать, редактировать, переобучать и генерировать теги.
  • Загружать файлы для проверки OCR или транскрибации.

 

Важно: Интерфейс тестирования позволяет не только проверить работу, но и внести корректировки в ответы бота (добавить тег, изменить шаблон или ответ) и отправить их на дообучение. Однако основные настройки шаблонов и ответов рекомендуется вносить в Интерактивном ассистенте.

 

  • Тестовая версия бота — копия основного бота с применёнными изменениями, созданная при выборе опции "Протестировать" в модуле дообучения.
  • Процент уверенности — порог, при котором бот считает ответ правильным (настраивается отдельно для тестирования).
  • Процент совпадения слов — чувствительность к опечаткам при распознавании вопросов.
  • Процент креативности — параметр (температура), регулирующий вариативность ответов для нейросетевых ботов и ИИ-агентов.
  • Детектор сущностей (NER) — модель для извлечения структурированных данных из текста.
  • AI-агент — интеллектуальный помощник на основе LLM, доступный для тестирования.
  • LLM-промпт — дополнительная инструкция, добавляемая в начало сообщения при тестировании ИИ-агента.
  • Датасет — набор данных для обучения бота, который формируется из состояний Интерактивного ассистента.
  • Переобучение — процесс применения обновлённого датасета к модели бота.
  • Генерация тегов — автоматическое создание тегов и шаблонов на основе имеющихся данных.

 

 

Выбор бота или сервиса для тестирования

В верхней части страницы находится выпадающий список "Выберите бота". В нём представлены две группы:

Сервисы:

Таблица списка сервисов и чат-ботов

  • ИИ - Агент — тестирование интеллектуального агента на основе LLM.
  • NER - Детектор сущностей — проверка извлечения структурированных данных.
  • Транскрибация v4 Поток — потоковая транскрибация аудио/видео.
  • Транскрибация v4 Пакетный — пакетная транскрибация.

 

Чат-Боты:

  • Основные боты (например: "Первый бот", "Для тестов", "Новый v2", "T-800", "Для тестов V2").
  • Тестовые версии ботов имеют суффикс " - Тестовый" (например: "Для тестов - Тестовый").

 

Последовательность действий:

1. Нажмите на выпадающий список, чтобы раскрыть варианты.

2. Выберите нужного бота или сервис.

3. После выбора автоматически загружаются его текущие параметры и настройки.

 

Статус чат-бота

Под заголовком "Статус чат-бота BotAI" отображается текущее состояние системы:

  • Доступен — сервис готов к тестированию.
  • Не доступен — возникли проблемы с подключением.

 

Перед началом тестирования убедитесь, что статус "Доступен".

 

 

Параметры нейросети для тестирования

В карточке "Параметры бота" можно изменить настройки только для текущей сессии тестирования. Эти изменения не сохраняются в основных настройках бота.

Набор отображаемых параметров зависит от выбранного бота или сервиса:

Параметры тестирования

1. Процент уверенности бота в правильном ответе — ползунок от 1% до 100%. Чем выше значение, тем чаще бот будет отвечать "не понял". Чем ниже — тем чаще бот будет пытаться ответить, даже если не уверен. Рекомендуется: 50–60% для тестирования новых шаблонов.

2. Процент совпадения слов (проверка на опечатки) — ползунок от 0% до 100% с шагом 5%. Определяет, насколько похожими должны быть слова, чтобы считаться одинаковыми. 90% — "првиет" и "привет" считаются одинаковыми. Рекомендуется: 85–95% для реалистичного тестирования.

3. Процент креативности бота — ползунок от 0% до 100%. 0 — бот будет стараться предложить один ответ, если нет прямых совпадений по шаблонам; 50 — стандартный режим; 100 — бот будет предлагать больше вариантов ответа. Отображается для нейросетевых ботов и ИИ-агентов.

4. Выводить кол-во ответов максимально совпадающих — текстовое поле для ввода числа от 0. 0 — показывать только лучший ответ; 3 — показывать 3 наиболее подходящих ответа. Полезно для анализа, какие теги бот рассматривал как возможные.

 

5. Детектор произвольных полей (NER) — выпадающий список для подключения модели распознавания сущностей. Позволяет проверить, как детектор извлекает данные из сообщений.

6. AI-агент — выпадающий список доступных ИИ-агентов (например: "Первый Пробный", "Детектор NER", "Помощник ЯВИ" и др.). Отображается при тестировании ИИ-агентов.

7. Потоковый вывод — переключатель для ИИ-агента. Включает посимвольную выдачу ответа в реальном времени.

8. Очистить контекст — кнопка для сброса истории диалога с ИИ-агентом.

9. Автотест — кнопка для автоматической оценки ИИ-агента.

Параметры

 

 

Отправка вопроса боту

Последовательность действий:

1. В поле "Введите вопрос" введите фразу, которую хотите протестировать.

2. Нажмите синюю кнопку с иконкой отправки или нажмите Enter.

3. Ответ бота отобразится в окне чата выше.

4. Для каждого ответа показывается тег, ответ, список максимально совпадающих тегов с указанием процента совпадения, время отправки и статус доставки.

 

Анализ ответа бота

После получения ответа проанализируйте его корректность:

1. Правильный ответ — бот выбрал нужный тег и дал корректный ответ.

2. Неправильный ответ — бот выбрал неверный тег или дал некорректный ответ.

3. "Не понял" — бот не нашёл подходящего тега для вопроса.

Процесс тестирования

 

После ответа бота в нижней части чата может появиться блок оценки "Устраивает ответ бота?" с кнопками "Не правильно" и "Согласен".

Если ответ правильный: нажмите "Согласен". Ответ будет отмечен как успешный.

Если ответ неправильный:

1. Нажмите "Не правильно".

2. Откроется форма для корректировки:

  • Выберите тег — укажите правильный тег из списка. Если нужного тега нет, нажмите "+", введите новый тег и подтвердите.
  • Вопрос (шаблон) — отредактируйте или добавьте фразу пользователя, которая должна активировать этот тег.
  • Ответ — отредактируйте или добавьте ответ бота.
  • Ниже отображаются вопросы в модели и ответы в модели для выбранного тега.

 

3. Нажмите "Отправить", чтобы сохранить изменения и отправить их на дообучение. Или "Отмена" для выхода без сохранения.

Эта функция позволяет быстро исправлять ошибки бота непосредственно в процессе тестирования.

 

Для оценки качества работы ИИ-агента используется функция «Автотест». Она позволяет прогнать заранее подготовленный набор тестовых кейсов через агента и получить детальный отчёт с баллами, процентами и объяснениями по каждому критерию.

Автотест помогает:

  • Объективно измерить точность ответов агента.
  • Проверить, вызывает ли агент нужные MCP-инструменты с правильными параметрами.
  • Выявить проблемные темы и группы вопросов.
  • Сравнить версии агента до и после дообучения.
  • Автоматизировать регрессионное тестирование при изменениях в базе знаний или промптах.

 

Конфигурационный файл тестов

Загрузка файлов для автотеста

Тестовые кейсы задаются в Excel-файле (например, яви_quality_config.xlsx). Файл содержит два листа:

1. Лист «Кейсы» — основной набор проверок. Колонки:

  • # — номер кейса (может повторяться для нескольких критериев одного вопроса).
  • Группа — тематическая группа (например, «Диф тарифы», «Показания», «Личный кабинет и ЛС»).
  • Вопрос — текст вопроса, который подаётся агенту. Может содержать переменные в фигурных скобках, например {ls}, {surname}.
  • Тип — тип критерия:
    • Должен — агент обязан включить в ответ указанное утверждение.
    • Не должен — агент не должен допускать указанного утверждения или действия.
    • Инструмент — агент должен вызвать указанный MCP-инструмент (например, get_info_filter).
    • Параметр — при вызове инструмента должен быть передан параметр с указанным значением (например, an = {ls}).
    • Смысл — параметр должен быть вычислен или подставлен по смыслу (например, дата за три месяца до сегодняшнего дня).
  • Критерий — конкретное требование или ожидаемое значение.

 

2. Лист «Переменные» — значения для подстановки в вопросы и критерии. Колонки: «Переменная» и «Значение». Пример:

Переменная Значение
{ls} 123456789
{surname} Петров
{addr_city} Москва

Перед запуском автотеста система подставляет значения переменных в вопросы и критерии. Это позволяет использовать одни и те же кейсы для разных клиентов или сценариев.

 

Запуск автотеста

1. В разделе «Тестирование» выберите из выпадающего списка «ИИ - Агент».

2. В блоке параметров появится кнопка «Автотест».

3. Нажмите «Автотест». Откроется диалог загрузки конфигурационного файла.

4. Выберите подготовленный Excel-файл (например, quality_config.xlsx) и подтвердите запуск.

5. Система последовательно отправит агенту все вопросы из листа «Кейсы», зафиксирует ответы, вызовы инструментов и параметры.

6. По завершении будет сформирован и предложен для скачивания файл с результатами (например, aiagent_estimate_result_123456789.xlsx).

Результат автотеста

Во время автотеста агент работает в изолированном режиме, чтобы не влиять на реальные диалоги. Все изменения, внесённые в промпты или базу знаний, должны быть применены до запуска.

 

Формат результатов

Файл результатов содержит несколько листов:

1. Лист «Итог» — сводная статистика:

  • Всего баллов — сумма набранных баллов из максимально возможных.
  • Процент — общий процент успеха.
  • Кейсов пройдено полностью — количество кейсов, где все критерии выполнены.
  • Таблица по группам: количество кейсов, пройдено, баллы, процент.
  • Таблица по каждому кейсу: номер, группа, вопрос, баллы, процент.

 

2. Лист «Кейсы» — детализация по каждому критерию:

  • #, Группа, Вопрос — идентификация кейса.
  • Тип, Критерий — проверяемое условие.
  • Результат — «Пройден» или «Провален».
  • Голоса — оценка экспертов (если проводилась).
  • Объяснение — почему критерий пройден или провален.
  • Баллы — начисленные баллы за критерий (например, 1/3).

 

3. Лист «Ответы» — фактические ответы агента:

  • #, Группа, Вопрос.
  • Ответ агента — полный текст ответа.
  • Вызовы инструментов — какие MCP-инструменты были вызваны и с какими параметрами.
  • Баллы — итоговая оценка по кейсу.

 

4. Лист «Переменные» — копия использованных переменных для воспроизводимости.

 

Интерпретация результатов

Пример из файла aiagent_estimate_result_123456789.xlsx:

  • Всего баллов: 7 / 142
  • Процент: 4.9%
  • Кейсов пройдено полностью: 0 / 45

 

Это означает, что агент справился лишь с малой частью проверок. По группам видны проблемные зоны:

Группа Кейсов Пройдено Баллы Процент
Безопасность 1 0 / 1 2 / 3 66.7%
Оплата долга 1 0 / 1 1 / 3 33.3%
Счетчики 2 0 / 2 1 / 4 25.0%

На листе «Кейсы» видно, что многие критерии типа «Инструмент» и «Параметр» провалены, потому что агент не вызвал нужные инструменты. Например, для кейса 21 «Какой у меня сейчас долг по лицевому счету 12345678911?» ожидался вызов get_info_filter с параметрами an=12345678911 и f_info=1, но инструмент не был вызван.

На листе «Ответы» можно увидеть, что агент отвечал общими фразами, не используя MCP-инструменты и не обращаясь к данным лицевого счёта. Это объясняет низкий процент.

Что делать с результатами:

  • Определить группы с наименьшим процентом и приоритетно доработать базу знаний и промпты.
  • Проверить, все ли необходимые MCP-инструменты подключены к агенту и отмечены в настройках.
  • Убедиться, что в системных инструкциях явно указано, когда и какие инструменты вызывать.
  • После внесения правок повторить автотест и сравнить результаты.

 

Рекомендации по составлению кейсов для автотеста

1. Покрывайте все ключевые сценарии: вопросы по тарифам, показаниям, оплате, лицевому счёту, безопасности и т.д.

2. Используйте разные типы критериев: не только «Должен»/«Не должен», но и проверку вызова инструментов и параметров.

3. Добавляйте негативные проверки: агент не должен предлагать мошеннические действия, не должен раскрывать лишние данные.

4. Задавайте переменные: это позволяет легко менять тестовые данные без правки вопросов.

5. Формулируйте критерии однозначно: чтобы эксперт или система могли объективно оценить ответ.

6. Регулярно обновляйте кейсы: при изменении бизнес-логики или базы знаний добавляйте новые проверки.

7. Храните эталонные результаты: чтобы отслеживать прогресс после дообучения.

 

Автотест не заменяет ручное тестирование, но позволяет быстро выявить системные проблемы и измерить качество агента на большой выборке кейсов.

 

При тестировании ИИ-агента может отображаться блок "Промпты для LLM". Промпты добавляются в начало сообщения и позволяют задать дополнительные инструкции для языковой модели в рамках текущей сессии.

Как добавить промпт:

1. В текстовое поле введите инструкцию (например: "Ты в роли оператора технической поддержки, отвечай коротко, не более 100 слов").

2. Нажмите кнопку "Добавить" для создания нового поля промпта.

3. Для удаления промпта нажмите красную кнопку с иконкой корзины.

 

Загрузка файлов

В нижней части страницы доступен блок "Добавьте фотографии для OCR или аудио для транскрибации". Вы можете загрузить один или несколько файлов:

  • Изображения — для проверки распознавания текста (OCR).
  • Аудио и видео — для проверки транскрибации.

 

После загрузки файла система обработает его и выведет результат в чат.

 

 

Кнопки управления датасетом

В верхней панели страницы доступны четыре кнопки:

1. "Посмотреть датасет" — показывает текущий датасет бота в структурированном виде. Отображает все теги, шаблоны вопросов и ответы. Помогает оценить полноту обучения и выявить пробелы.

2. "Изменить датасет" — открывает интерфейс для просмотра и редактирования структуры датасета. Позволяет вносить изменения напрямую, но основные правки рекомендуется делать в Интерактивном ассистенте.

3. "Переобучение" — запускает процесс переобучения модели на основе текущего датасета. Используйте после внесения изменений в шаблоны и ответы.

4. "Генерация" — автоматическая генерация тегов и шаблонов на основе имеющихся данных. Помогает расширить базу знаний бота.

 

Синхронизация с Интерактивным ассистентом

Все изменения в шаблонах вопросов и ответах бота рекомендуется вносить в Интерактивном ассистенте. После внесения изменений:

  1. Вернитесь в раздел "Тестирование".
  2. Выберите нужного бота.
  3. Нажмите кнопку "Переобучение" для применения обновлённого датасета.
  4. Повторно протестируйте вопросы.

 

Важно: Если вы вносили изменения непосредственно в тестировании через блок обратной связи, они также требуют переобучения.

 

 

Сценарий 1: Тестирование новой тестовой версии бота

Когда выполнять: После создания тестовой версии в процессе дообучения.

Последовательность действий:

  1. Выберите тестового бота (с суффиксом " - Тестовый").
  2. Протестируйте основные сценарии, которые были изменены.
  3. Проверьте новые шаблоны вопросов.
  4. Убедитесь, что бот правильно понимает разные формулировки.
  5. Если найдены ошибки — используйте блок обратной связи для их исправления или зафиксируйте для правки в Интерактивном ассистенте.
  6. При необходимости нажмите "Переобучение" и повторите тестирование.

 

Сценарий 2: Добавление новой функциональности

Когда выполнять: При добавлении новых продуктов, услуг или изменении бизнес-процессов.

Последовательность действий:

  1. Создайте новые состояния в Интерактивном ассистенте.
  2. Настройте шаблоны вопросов и ответы для новых тегов.
  3. Вернитесь в Тестирование.
  4. Выберите нужного бота.
  5. Нажмите кнопку "Переобучение".
  6. Протестируйте новые сценарии.
  7. При необходимости доработайте состояния в Интерактивном ассистенте или через блок обратной связи.
  8. Повторите переобучение и тестирование.

 

Сценарий 3: Оптимизация параметров нейросети

Когда выполнять: Когда бот слишком часто отвечает "не понял" или, наоборот, уверенно отвечает неправильно.

Последовательность действий:

  1. Подготовьте набор тестовых вопросов (20–30 типичных запросов).
  2. Зафиксируйте текущие результаты (какие ответы правильные, какие нет).
  3. Понизьте "Процент уверенности" на 10–20%.
  4. Повторите тестирование на том же наборе вопросов.
  5. Сравните результаты.
  6. Настройте "Процент совпадения слов" для оптимальной работы с опечатками.
  7. Зафиксируйте лучшие настройки.
  8. Перейдите в раздел Чат-боты и примените эти настройки к основному боту.

 

 

Подготовка тестовых данных

1. Типичные вопросы: Соберите реальные вопросы пользователей из истории чатов.

2. Разные формулировки: Для каждой темы подготовьте 5–10 способов задать один вопрос.

3. Опечатки и ошибки: Включите вопросы с типичными опечатками ("првиет", "скажите пожалуйста").

4. Сложные случаи: Добавьте вопросы на стыке тем, где бот может ошибиться.

 

Организация процесса тестирования

1. Регулярность: Проводите тестирование после каждого значительного обновления бота.

2. Документирование: Записывайте, какие темы были протестированы и какие проблемы найдены.

3. Приоритеты: Сначала тестируйте критически важные сценарии (оплата, поддержка).

4. Коллективное тестирование: Привлекайте разных сотрудников для получения разнообразных формулировок.

 

Взаимодействие с другими модулями

1. Интерактивный ассистент: Основные изменения вносите здесь.

2. Переобучение: Выполняйте после изменений в ассистенте или после правок через обратную связь.

3. Дообучение: Для обучения на реальных диалогах используйте соответствующий модуль.

4. Основные настройки: Параметры нейросети, найденные в тестировании, применяйте в разделе Чат-боты.

 

 

Бот не отвечает на вопросы:

1. Проверьте статус чат-бота — должен быть "Доступен".

2. Убедитесь, что выбран правильный бот в выпадающем списке.

3. Попробуйте понизить процент уверенности в настройках.

4. Проверьте, есть ли у бота обученные теги в Интерактивном ассистенте.

5. Нажмите кнопку "Переобучение" для обновления датасета.

 

Ответы бота не соответствуют настройкам Интерактивного ассистента:

1. Убедитесь, что вы нажали кнопку "Переобучение" после внесения изменений в ассистенте.

2. Проверьте, что состояния в ассистенте связаны с правильным ботом.

3. Убедитесь, что состояния имеют статус "Включено".

4. Проверьте, что в шаблонах вопросов и ответов нет ошибок.

 

Тестовая версия бота не отображается в списке:

1. Убедитесь, что вы создали тестовую версию через модуль дообучения (кнопка "Протестировать").

2. Проверьте, что тестовый бот имеет статус "Включено" в основном разделе чат-ботов.

3. Если бот только что создан, подождите 1–2 минуты — может потребоваться время на инициализацию.

4. Перезагрузите страницу тестирования.

 

Не удаётся отправить обратную связь или добавить тег:

1. Убедитесь, что выбран корректный тег или создан новый.

2. Проверьте, заполнены ли поля "Вопрос (шаблон)" и "Ответ".

3. Убедитесь, что у вас есть права на редактирование датасета.

4. Попробуйте обновить страницу и повторить попытку.