Инструкции/Тестирование чат-бота
Общие сведения
Раздел "Тестирование" предназначен для проверки работы чат-ботов, ИИ-агентов, детекторов сущностей (NER) и сервисов транскрибации в безопасной среде. Здесь можно:
- Протестировать ответы бота или агента на различные вопросы.
- Настроить параметры нейросети для конкретного бота или агента.
- Проверить работу тестовой версии бота после переобучения.
- Оценить корректность ответов и отправить обратную связь для дообучения.
- Управлять датасетом: просматривать, редактировать, переобучать и генерировать теги.
- Загружать файлы для проверки OCR или транскрибации.
Важно: Интерфейс тестирования позволяет не только проверить работу, но и внести корректировки в ответы бота (добавить тег, изменить шаблон или ответ) и отправить их на дообучение. Однако основные настройки шаблонов и ответов рекомендуется вносить в Интерактивном ассистенте.
Основные понятия
- Тестовая версия бота — копия основного бота с применёнными изменениями, созданная при выборе опции "Протестировать" в модуле дообучения.
- Процент уверенности — порог, при котором бот считает ответ правильным (настраивается отдельно для тестирования).
- Процент совпадения слов — чувствительность к опечаткам при распознавании вопросов.
- Процент креативности — параметр (температура), регулирующий вариативность ответов для нейросетевых ботов и ИИ-агентов.
- Детектор сущностей (NER) — модель для извлечения структурированных данных из текста.
- AI-агент — интеллектуальный помощник на основе LLM, доступный для тестирования.
- LLM-промпт — дополнительная инструкция, добавляемая в начало сообщения при тестировании ИИ-агента.
- Датасет — набор данных для обучения бота, который формируется из состояний Интерактивного ассистента.
- Переобучение — процесс применения обновлённого датасета к модели бота.
- Генерация тегов — автоматическое создание тегов и шаблонов на основе имеющихся данных.
Начало тестирования
Выбор бота или сервиса для тестирования
В верхней части страницы находится выпадающий список "Выберите бота". В нём представлены две группы:
Сервисы:

- ИИ - Агент — тестирование интеллектуального агента на основе LLM.
- NER - Детектор сущностей — проверка извлечения структурированных данных.
- Транскрибация v4 Поток — потоковая транскрибация аудио/видео.
- Транскрибация v4 Пакетный — пакетная транскрибация.
Чат-Боты:
- Основные боты (например: "Первый бот", "Для тестов", "Новый v2", "T-800", "Для тестов V2").
- Тестовые версии ботов имеют суффикс " - Тестовый" (например: "Для тестов - Тестовый").
Последовательность действий:
1. Нажмите на выпадающий список, чтобы раскрыть варианты.
2. Выберите нужного бота или сервис.
3. После выбора автоматически загружаются его текущие параметры и настройки.
Статус чат-бота
Под заголовком "Статус чат-бота BotAI" отображается текущее состояние системы:
- Доступен — сервис готов к тестированию.
- Не доступен — возникли проблемы с подключением.
Перед началом тестирования убедитесь, что статус "Доступен".
Настройка параметров тестирования
Параметры нейросети для тестирования
В карточке "Параметры бота" можно изменить настройки только для текущей сессии тестирования. Эти изменения не сохраняются в основных настройках бота.
Набор отображаемых параметров зависит от выбранного бота или сервиса:

1. Процент уверенности бота в правильном ответе — ползунок от 1% до 100%. Чем выше значение, тем чаще бот будет отвечать "не понял". Чем ниже — тем чаще бот будет пытаться ответить, даже если не уверен. Рекомендуется: 50–60% для тестирования новых шаблонов.
2. Процент совпадения слов (проверка на опечатки) — ползунок от 0% до 100% с шагом 5%. Определяет, насколько похожими должны быть слова, чтобы считаться одинаковыми. 90% — "првиет" и "привет" считаются одинаковыми. Рекомендуется: 85–95% для реалистичного тестирования.
3. Процент креативности бота — ползунок от 0% до 100%. 0 — бот будет стараться предложить один ответ, если нет прямых совпадений по шаблонам; 50 — стандартный режим; 100 — бот будет предлагать больше вариантов ответа. Отображается для нейросетевых ботов и ИИ-агентов.
4. Выводить кол-во ответов максимально совпадающих — текстовое поле для ввода числа от 0. 0 — показывать только лучший ответ; 3 — показывать 3 наиболее подходящих ответа. Полезно для анализа, какие теги бот рассматривал как возможные.
5. Детектор произвольных полей (NER) — выпадающий список для подключения модели распознавания сущностей. Позволяет проверить, как детектор извлекает данные из сообщений.
6. AI-агент — выпадающий список доступных ИИ-агентов (например: "Первый Пробный", "Детектор NER", "Помощник ЯВИ" и др.). Отображается при тестировании ИИ-агентов.
7. Потоковый вывод — переключатель для ИИ-агента. Включает посимвольную выдачу ответа в реальном времени.
8. Очистить контекст — кнопка для сброса истории диалога с ИИ-агентом.
9. Автотест — кнопка для автоматической оценки ИИ-агента.

Процесс тестирования бота
Отправка вопроса боту
Последовательность действий:
1. В поле "Введите вопрос" введите фразу, которую хотите протестировать.
2. Нажмите синюю кнопку с иконкой отправки или нажмите Enter.
3. Ответ бота отобразится в окне чата выше.
4. Для каждого ответа показывается тег, ответ, список максимально совпадающих тегов с указанием процента совпадения, время отправки и статус доставки.
Анализ ответа бота
После получения ответа проанализируйте его корректность:
1. Правильный ответ — бот выбрал нужный тег и дал корректный ответ.
2. Неправильный ответ — бот выбрал неверный тег или дал некорректный ответ.
3. "Не понял" — бот не нашёл подходящего тега для вопроса.

Обратная связь и доработка
После ответа бота в нижней части чата может появиться блок оценки "Устраивает ответ бота?" с кнопками "Не правильно" и "Согласен".
Если ответ правильный: нажмите "Согласен". Ответ будет отмечен как успешный.
Если ответ неправильный:
1. Нажмите "Не правильно".
2. Откроется форма для корректировки:
- Выберите тег — укажите правильный тег из списка. Если нужного тега нет, нажмите "+", введите новый тег и подтвердите.
- Вопрос (шаблон) — отредактируйте или добавьте фразу пользователя, которая должна активировать этот тег.
- Ответ — отредактируйте или добавьте ответ бота.
- Ниже отображаются вопросы в модели и ответы в модели для выбранного тега.
3. Нажмите "Отправить", чтобы сохранить изменения и отправить их на дообучение. Или "Отмена" для выхода без сохранения.
Эта функция позволяет быстро исправлять ошибки бота непосредственно в процессе тестирования.
Автотестирование ИИ-агентов
Для оценки качества работы ИИ-агента используется функция «Автотест». Она позволяет прогнать заранее подготовленный набор тестовых кейсов через агента и получить детальный отчёт с баллами, процентами и объяснениями по каждому критерию.
Автотест помогает:
- Объективно измерить точность ответов агента.
- Проверить, вызывает ли агент нужные MCP-инструменты с правильными параметрами.
- Выявить проблемные темы и группы вопросов.
- Сравнить версии агента до и после дообучения.
- Автоматизировать регрессионное тестирование при изменениях в базе знаний или промптах.
Конфигурационный файл тестов

Тестовые кейсы задаются в Excel-файле (например, яви_quality_config.xlsx). Файл содержит два листа:
1. Лист «Кейсы» — основной набор проверок. Колонки:
- # — номер кейса (может повторяться для нескольких критериев одного вопроса).
- Группа — тематическая группа (например, «Диф тарифы», «Показания», «Личный кабинет и ЛС»).
- Вопрос — текст вопроса, который подаётся агенту. Может содержать переменные в фигурных скобках, например
{ls},{surname}. - Тип — тип критерия:
- Должен — агент обязан включить в ответ указанное утверждение.
- Не должен — агент не должен допускать указанного утверждения или действия.
- Инструмент — агент должен вызвать указанный MCP-инструмент (например,
get_info_filter). - Параметр — при вызове инструмента должен быть передан параметр с указанным значением (например,
an = {ls}). - Смысл — параметр должен быть вычислен или подставлен по смыслу (например, дата за три месяца до сегодняшнего дня).
- Критерий — конкретное требование или ожидаемое значение.
2. Лист «Переменные» — значения для подстановки в вопросы и критерии. Колонки: «Переменная» и «Значение». Пример:
| Переменная | Значение |
|---|---|
| {ls} | 123456789 |
| {surname} | Петров |
| {addr_city} | Москва |
Перед запуском автотеста система подставляет значения переменных в вопросы и критерии. Это позволяет использовать одни и те же кейсы для разных клиентов или сценариев.
Запуск автотеста
1. В разделе «Тестирование» выберите из выпадающего списка «ИИ - Агент».
2. В блоке параметров появится кнопка «Автотест».
3. Нажмите «Автотест». Откроется диалог загрузки конфигурационного файла.
4. Выберите подготовленный Excel-файл (например, quality_config.xlsx) и подтвердите запуск.
5. Система последовательно отправит агенту все вопросы из листа «Кейсы», зафиксирует ответы, вызовы инструментов и параметры.
6. По завершении будет сформирован и предложен для скачивания файл с результатами (например, aiagent_estimate_result_123456789.xlsx).

Во время автотеста агент работает в изолированном режиме, чтобы не влиять на реальные диалоги. Все изменения, внесённые в промпты или базу знаний, должны быть применены до запуска.
Формат результатов
Файл результатов содержит несколько листов:
1. Лист «Итог» — сводная статистика:
- Всего баллов — сумма набранных баллов из максимально возможных.
- Процент — общий процент успеха.
- Кейсов пройдено полностью — количество кейсов, где все критерии выполнены.
- Таблица по группам: количество кейсов, пройдено, баллы, процент.
- Таблица по каждому кейсу: номер, группа, вопрос, баллы, процент.
2. Лист «Кейсы» — детализация по каждому критерию:
- #, Группа, Вопрос — идентификация кейса.
- Тип, Критерий — проверяемое условие.
- Результат — «Пройден» или «Провален».
- Голоса — оценка экспертов (если проводилась).
- Объяснение — почему критерий пройден или провален.
- Баллы — начисленные баллы за критерий (например, 1/3).
3. Лист «Ответы» — фактические ответы агента:
- #, Группа, Вопрос.
- Ответ агента — полный текст ответа.
- Вызовы инструментов — какие MCP-инструменты были вызваны и с какими параметрами.
- Баллы — итоговая оценка по кейсу.
4. Лист «Переменные» — копия использованных переменных для воспроизводимости.
Интерпретация результатов
Пример из файла aiagent_estimate_result_123456789.xlsx:
- Всего баллов: 7 / 142
- Процент: 4.9%
- Кейсов пройдено полностью: 0 / 45
Это означает, что агент справился лишь с малой частью проверок. По группам видны проблемные зоны:
| Группа | Кейсов | Пройдено | Баллы | Процент |
|---|---|---|---|---|
| Безопасность | 1 | 0 / 1 | 2 / 3 | 66.7% |
| Оплата долга | 1 | 0 / 1 | 1 / 3 | 33.3% |
| Счетчики | 2 | 0 / 2 | 1 / 4 | 25.0% |
На листе «Кейсы» видно, что многие критерии типа «Инструмент» и «Параметр» провалены, потому что агент не вызвал нужные инструменты. Например, для кейса 21 «Какой у меня сейчас долг по лицевому счету 12345678911?» ожидался вызов get_info_filter с параметрами an=12345678911 и f_info=1, но инструмент не был вызван.
На листе «Ответы» можно увидеть, что агент отвечал общими фразами, не используя MCP-инструменты и не обращаясь к данным лицевого счёта. Это объясняет низкий процент.
Что делать с результатами:
- Определить группы с наименьшим процентом и приоритетно доработать базу знаний и промпты.
- Проверить, все ли необходимые MCP-инструменты подключены к агенту и отмечены в настройках.
- Убедиться, что в системных инструкциях явно указано, когда и какие инструменты вызывать.
- После внесения правок повторить автотест и сравнить результаты.
Рекомендации по составлению кейсов для автотеста
1. Покрывайте все ключевые сценарии: вопросы по тарифам, показаниям, оплате, лицевому счёту, безопасности и т.д.
2. Используйте разные типы критериев: не только «Должен»/«Не должен», но и проверку вызова инструментов и параметров.
3. Добавляйте негативные проверки: агент не должен предлагать мошеннические действия, не должен раскрывать лишние данные.
4. Задавайте переменные: это позволяет легко менять тестовые данные без правки вопросов.
5. Формулируйте критерии однозначно: чтобы эксперт или система могли объективно оценить ответ.
6. Регулярно обновляйте кейсы: при изменении бизнес-логики или базы знаний добавляйте новые проверки.
7. Храните эталонные результаты: чтобы отслеживать прогресс после дообучения.
Автотест не заменяет ручное тестирование, но позволяет быстро выявить системные проблемы и измерить качество агента на большой выборке кейсов.
Работа с LLM-промптами (для ИИ-агентов)
При тестировании ИИ-агента может отображаться блок "Промпты для LLM". Промпты добавляются в начало сообщения и позволяют задать дополнительные инструкции для языковой модели в рамках текущей сессии.
Как добавить промпт:
1. В текстовое поле введите инструкцию (например: "Ты в роли оператора технической поддержки, отвечай коротко, не более 100 слов").
2. Нажмите кнопку "Добавить" для создания нового поля промпта.
3. Для удаления промпта нажмите красную кнопку с иконкой корзины.
Загрузка файлов для OCR и транскрибации

В нижней части страницы доступен блок "Добавьте фотографии для OCR или аудио для транскрибации". Вы можете загрузить один или несколько файлов:
- Изображения — для проверки распознавания текста (OCR).
- Аудио и видео — для проверки транскрибации.
После загрузки файла система обработает его и выведет результат в чат.
Управление датасетом бота
Кнопки управления датасетом
В верхней панели страницы доступны четыре кнопки:
1. "Посмотреть датасет" — показывает текущий датасет бота в структурированном виде. Отображает все теги, шаблоны вопросов и ответы. Помогает оценить полноту обучения и выявить пробелы.
2. "Изменить датасет" — открывает интерфейс для просмотра и редактирования структуры датасета. Позволяет вносить изменения напрямую, но основные правки рекомендуется делать в Интерактивном ассистенте.
3. "Переобучение" — запускает процесс переобучения модели на основе текущего датасета. Используйте после внесения изменений в шаблоны и ответы.
4. "Генерация" — автоматическая генерация тегов и шаблонов на основе имеющихся данных. Помогает расширить базу знаний бота.
Синхронизация с Интерактивным ассистентом
Все изменения в шаблонах вопросов и ответах бота рекомендуется вносить в Интерактивном ассистенте. После внесения изменений:
- Вернитесь в раздел "Тестирование".
- Выберите нужного бота.
- Нажмите кнопку "Переобучение" для применения обновлённого датасета.
- Повторно протестируйте вопросы.
Важно: Если вы вносили изменения непосредственно в тестировании через блок обратной связи, они также требуют переобучения.
Рабочий процесс тестирования и доработки
Сценарий 1: Тестирование новой тестовой версии бота
Когда выполнять: После создания тестовой версии в процессе дообучения.
Последовательность действий:
- Выберите тестового бота (с суффиксом " - Тестовый").
- Протестируйте основные сценарии, которые были изменены.
- Проверьте новые шаблоны вопросов.
- Убедитесь, что бот правильно понимает разные формулировки.
- Если найдены ошибки — используйте блок обратной связи для их исправления или зафиксируйте для правки в Интерактивном ассистенте.
- При необходимости нажмите "Переобучение" и повторите тестирование.
Сценарий 2: Добавление новой функциональности
Когда выполнять: При добавлении новых продуктов, услуг или изменении бизнес-процессов.
Последовательность действий:
- Создайте новые состояния в Интерактивном ассистенте.
- Настройте шаблоны вопросов и ответы для новых тегов.
- Вернитесь в Тестирование.
- Выберите нужного бота.
- Нажмите кнопку "Переобучение".
- Протестируйте новые сценарии.
- При необходимости доработайте состояния в Интерактивном ассистенте или через блок обратной связи.
- Повторите переобучение и тестирование.
Сценарий 3: Оптимизация параметров нейросети
Когда выполнять: Когда бот слишком часто отвечает "не понял" или, наоборот, уверенно отвечает неправильно.
Последовательность действий:
- Подготовьте набор тестовых вопросов (20–30 типичных запросов).
- Зафиксируйте текущие результаты (какие ответы правильные, какие нет).
- Понизьте "Процент уверенности" на 10–20%.
- Повторите тестирование на том же наборе вопросов.
- Сравните результаты.
- Настройте "Процент совпадения слов" для оптимальной работы с опечатками.
- Зафиксируйте лучшие настройки.
- Перейдите в раздел Чат-боты и примените эти настройки к основному боту.
Рекомендации по эффективному тестированию
Подготовка тестовых данных
1. Типичные вопросы: Соберите реальные вопросы пользователей из истории чатов.
2. Разные формулировки: Для каждой темы подготовьте 5–10 способов задать один вопрос.
3. Опечатки и ошибки: Включите вопросы с типичными опечатками ("првиет", "скажите пожалуйста").
4. Сложные случаи: Добавьте вопросы на стыке тем, где бот может ошибиться.
Организация процесса тестирования
1. Регулярность: Проводите тестирование после каждого значительного обновления бота.
2. Документирование: Записывайте, какие темы были протестированы и какие проблемы найдены.
3. Приоритеты: Сначала тестируйте критически важные сценарии (оплата, поддержка).
4. Коллективное тестирование: Привлекайте разных сотрудников для получения разнообразных формулировок.
Взаимодействие с другими модулями
1. Интерактивный ассистент: Основные изменения вносите здесь.
2. Переобучение: Выполняйте после изменений в ассистенте или после правок через обратную связь.
3. Дообучение: Для обучения на реальных диалогах используйте соответствующий модуль.
4. Основные настройки: Параметры нейросети, найденные в тестировании, применяйте в разделе Чат-боты.
Устранение неполадок при тестировании
Бот не отвечает на вопросы:
1. Проверьте статус чат-бота — должен быть "Доступен".
2. Убедитесь, что выбран правильный бот в выпадающем списке.
3. Попробуйте понизить процент уверенности в настройках.
4. Проверьте, есть ли у бота обученные теги в Интерактивном ассистенте.
5. Нажмите кнопку "Переобучение" для обновления датасета.
Ответы бота не соответствуют настройкам Интерактивного ассистента:
1. Убедитесь, что вы нажали кнопку "Переобучение" после внесения изменений в ассистенте.
2. Проверьте, что состояния в ассистенте связаны с правильным ботом.
3. Убедитесь, что состояния имеют статус "Включено".
4. Проверьте, что в шаблонах вопросов и ответов нет ошибок.
Тестовая версия бота не отображается в списке:
1. Убедитесь, что вы создали тестовую версию через модуль дообучения (кнопка "Протестировать").
2. Проверьте, что тестовый бот имеет статус "Включено" в основном разделе чат-ботов.
3. Если бот только что создан, подождите 1–2 минуты — может потребоваться время на инициализацию.
4. Перезагрузите страницу тестирования.
Не удаётся отправить обратную связь или добавить тег:
1. Убедитесь, что выбран корректный тег или создан новый.
2. Проверьте, заполнены ли поля "Вопрос (шаблон)" и "Ответ".
3. Убедитесь, что у вас есть права на редактирование датасета.
4. Попробуйте обновить страницу и повторить попытку.