Год без сбоев — это не надёжность, а отсутствие данных
На вопрос «что будет с процессом, если уволится главный согласант» команда отвечает: «у нас такого не было». На вопрос «а если заявок станет вдвое больше» — «не сталкивались». Звучит успокаивающе: раз не было — значит, всё надёжно. Инженеры надёжности называют такое рассуждение перевёрнутым: если отказов не было, вы не знаете о своём процессе почти ничего — вы просто ещё не платили за это знание.
Финальная глава хендбука NIST посвящена оценке надёжности. Она написана про микросхемы и механизмы, но три её идеи переносятся на бизнес-процессы почти без перевода. Это восьмая, финальная статья серии по статистике для процессов.
Парадокс надёжности: информация живёт в отказах
Центральная мысль главы контринтуитивна: точность знаний о надёжности определяется числом отказов, а не размером наблюдений. Тысяча устройств на стенде и два отказа дают меньше информации, чем десять устройств, из которых отказала половина. Отсюда парадокс: чем надёжнее система, тем труднее доказать её надёжность — она просто не даёт данных.
Для процессов это означает: год без срыва SLA по редким эскалациям, без потери ключевого человека, без пика нагрузки ×2 — это не подтверждение устойчивости. Это отсутствие испытаний. Инженеры решают эту проблему ускоренными испытаниями: греют микросхему, повышают напряжение — заставляют отказы случиться быстро, чтобы учиться на них дёшево. У процессного аналитика есть точный аналог — стресс-тест в симуляторе. В симуляторе Stormbpmn можно за вечер прожить то, чего в истории не было: поток ×1,5 и ×2, минус один исполнитель в ключевой группе, сезонный пик поверх отпусков. И увидеть не только «станет хуже», а где именно процесс ломается первым и при каком именно уровне нагрузки очередь уходит в разнос.
Ванна-кривая: у регламентов тоже есть младенческая смертность
Вторая идея главы — знаменитая кривая отказов в форме ванны. Сначала частота отказов высокая и быстро падает (младенческая смертность — заводские дефекты), потом долгий ровный участок (случайные отказы), потом рост (износ). У процессов та же биография. Первые недели нового регламента — младенческая смертность: недописанные случаи, путаница в ролях, обходные пути. Потом долгий стабильный участок. А потом — старение: реальность ушла вперёд, в регламенте накопились исключения, люди работают «как принято», а не «как написано».
Практических вывода два. Первый: не оценивайте эффект изменения по первым неделям — вы измеряете младенческую смертность, а не рабочий режим (в симуляторе для этого есть прямой аналог — период разогрева, который отчёт Stormbpmn отделяет от устойчивого режима автоматически). Второй: стабильность сегодня не гарантия стабильности завтра — процессы стареют, и периодический пересмотр регламента — это не бюрократия, а техобслуживание.
Цепь и резерв: арифметика хрупкости
Третья идея — как надёжность системы складывается из надёжности частей. Для последовательной цепи надёжности перемножаются: пять последовательных шагов, каждый безотказен на 99%, дают цепочке только 95%. Чем длиннее цепь согласований, тем быстрее тает общая надёжность — это ещё один аргумент укорачивать маршруты, помимо скорости. И наоборот: резервирование (второй человек, умеющий делать критический шаг) многократно гасит риск даже при частичной загрузке резерва. «У нас есть единственный человек, без которого процесс встаёт» — это последовательная цепь без резерва, и вопрос не «сломается ли», а «когда». Сколько будет стоить этот день — можно посчитать заранее: прогон сценария «минус ключевой ресурс» показывает рост очередей и срывы SLA в цифрах, а не в ощущениях — и превращает разговор о резервном сотруднике из «страшилки» в бизнес-кейс.
Итоги серии
Восемь статей назад мы начали с того, что среднее врёт. Если собрать серию в один абзац: требуйте распределения вместо средних, проверяйте сами замеры, раскладывайте разброс на источники, валидируйте модели по остаткам, планируйте эксперименты факторно, отличайте сигнал от шума контрольными картами, сравнивайте через интервалы и стресс-тестируйте то, чего ещё не было. Почти всё это доступно в Excel и здравом смысле. А там, где нужно заглянуть в будущее — что будет при другом штате, нагрузке, маршруте, — работает имитационное моделирование: те же честные статистические принципы, только эксперимент бесплатный.
Чек-лист
- Список единственных точек отказа процесса: люди, системы, шаги без резерва. Если списка нет — это первый пункт.
- Для каждой точки — стресс-сценарий в симуляторе: минус ресурс, нагрузка ×1,5–×2. Запишите, где ломается и при каком пороге.
- Не делайте выводов о новом регламенте по первым неделям — это период младенческой смертности.
- Запланируйте пересмотр регламентов как техобслуживание — по календарю, а не после аварии.
- Помните про арифметику цепи: каждый дополнительный обязательный шаг согласования умножает хрупкость.
Серия основана на NIST/SEMATECH e-Handbook of Statistical Methods — открытом справочнике Национального института стандартов США. Первая статья серии: почему среднее время процесса врёт.
Похожие публикации
Новые статьи в вашем электрическом ящике
Обзоры конференций, лучшие практики процессного подхода и учебные статьи в вашей почте. Не чаще 1 раза в неделю.
Без спама, только то, что вы запросили.
