Контрольные карты для бизнес-процессов: как отличить поломку от шума
В понедельник среднее время обработки было 3,1 дня, во вторник — 4,2. Руководитель увидел рост на 35%, собрал летучку, команда полдня искала причину. Причины не было: в среду метрика сама вернулась к 3,3. Это был обычный шум процесса — такой же, как был всегда. А через месяц процесс начал медленно деградировать — по чуть-чуть каждую неделю, — и этого не заметил никто, потому что каждый отдельный день выглядел нормально.
Обе ошибки — ложная тревога и пропущенная деградация — лечатся одним инструментом, которому скоро сто лет. Контрольные карты придумал Уолтер Шухарт в Bell Labs — хендбук NIST датирует его первый меморандум 16 мая 1924 года. С тех пор на них стоит промышленное качество, а глава о мониторинге процессов — одна из самых практичных в хендбуке. Это шестая статья нашей серии по статистике для процессов.
Идея карты: сравнивай сегодня с собственным вчера
Контрольная карта — это хронология метрики с тремя линиями: центр (как процесс ведёт себя обычно) и две контрольные границы, посчитанные из его собственного исторического разброса (классика — три стандартных отклонения от центра). Пока точки пляшут внутри границ без системы — это шум, и дёргать команду не надо. Точка за границей или системный узор (восемь точек подряд выше центра, устойчивый тренд) — сигнал: в процессе появилась особая причина, идите искать.
В нашем примере карта бы сразу показала: вторничные 4,2 дня — внутри границ, летучка не нужна. А медленная деградация дала бы серию точек по одну сторону центра — сигнал задолго до того, как проблема стала видна невооружённым глазом. Для медленных дрейфов у статистиков есть специальные карты с памятью (EWMA, CUSUM): они накапливают историю и ловят сдвиги, которые классическая карта заметит только через месяцы.
Границы процесса — не SLA. Это главная путаница
Хендбук настойчиво разделяет две пары границ, которые постоянно путают.
Контрольные границы — голос процесса: что он фактически умеет, исходя из своего устройства. SLA — голос клиента: что от процесса требуется. Между ними нет никакой математической связи, и возможны все четыре комбинации. Самая коварная — процесс стабилен и при этом стабильно нарушает SLA: он честно и предсказуемо делает то, на что способна его конструкция, — просто конструкция не тянет требование. В этой ситуации бесполезно усиливать контроль и мотивировать людей — нужно менять конструкцию: штат, маршруты, автоматизацию. Для этого в инженерии качества есть индексы способности Cp/Cpk — отношение требуемого коридора к фактическому разбросу процесса. Если Cpk меньше единицы, процесс физически не способен держать SLA — сколько ни дави.
Цена чувствительности: ложные тревоги
Почему границы ставят именно на три сигмы, а не на две? Это осознанный компромисс. Хендбук приводит точные цифры: у классической трёхсигмовой карты ложная тревога случается в среднем раз в 371 точку. Добавьте популярные дополнительные правила чувствительности (правила Western Electric) — и интервал падает до раза в 92 точки. Вчетверо больше пойманных сдвигов — и вчетверо больше напрасных летучек. Бесплатной чувствительности не бывает. Это тот же выбор, что у алертов мониторинга ИТ-систем: слишком чуткие алерты команда начинает игнорировать, и тогда пропускается настоящий.
Второе правило гигиены: не пересчитывайте границы без причины. Границы — это память о нормальном поведении процесса; если пересчитывать их каждый месяц, медленная деградация просто впитается в новые границы и станет «новой нормой». Пересчёт законен после осознанного изменения процесса — и это документируется.
Контрольные карты в симуляторе: увидеть стабильность будущего процесса
Обычно контрольные карты строят по факту — когда процесс уже работает и уже болит. Но тот же анализ можно сделать до внедрения. В отчёте симулятора Stormbpmn контрольные карты строятся прямо по результатам прогона — с границами, зонами и проверкой правил Western Electric, а рядом считаются индексы Cp/Cpk относительно вашего SLA. То есть ещё на этапе проектирования изменения видно: будет ли новая версия процесса стабильна и способна ли она в принципе держать заявленный SLA — или вы собираетесь подписаться под обещанием, которое конструкция не тянет. Как мы считали такой расчёт для реального клиента — в разборе готовых симуляций.
Чек-лист
- Для главной метрики процесса постройте контрольную карту: центр и границы из истории за стабильный период.
- Договоритесь с командой: реагируем на сигналы карты, а не на любое колебание метрики.
- Разведите в отчётности голос процесса (контрольные границы) и голос клиента (SLA). Это разные линии на разных графиках.
- Если процесс стабилен, но не держит SLA — прекратите давить на людей и меняйте конструкцию. Сценарии конструкции считайте в симуляторе.
- Пересчитывайте границы только после документированного изменения процесса.
Серия основана на NIST/SEMATECH e-Handbook of Statistical Methods. Следующая статья — как честно сравнить «до и после» и не принять шум за улучшение.
Похожие публикации
Было 6 дней, стало 5: как понять, что вы действительно ускорили процесс
Новые статьи в вашем электрическом ящике
Обзоры конференций, лучшие практики процессного подхода и учебные статьи в вашей почте. Не чаще 1 раза в неделю.
Без спама, только то, что вы запросили.
