Перейти к содержимому

Поиск по журналу

Введите слово или часть названия. Esc — закрыть.

БЕ · Безопасность промышленного оборудования
КМ11629

Анализ причин неисправностей и аварий на производстве: методы, процесс и типичные ошибки

Опубликовано
Обновлено
Чтение
12 мин
Шифр
БЕ-11629

Каждая авария или серьёзная неисправность на производстве — это не просто поломка оборудования, а сбой в системе управления рисками. Цель анализа причин (Root Cause Analysis, RCA) — не найти виноватого, а выявить системные уязвимости, которые позволили ошибке привести к последствиям. Качественный анализ меняет реактивное тушение пожаров на проактивную предотвращающую работу. В статье разобраны основные методы, порядок проведения расследования, критерии выбора инструмента и ошибки, которые делают анализ формальным.

Содержание
  1. Зачем нужен системный анализ причин
  2. Основные методы анализа причин: сравнение и область применения
  3. Пошаговый процесс расследования: от факта к действию
  4. Критерии качества анализа: как отличить работу от имитации
  5. Типичные ошибки и как их избежать
  6. 1. Подмена корневой причины прямым фактором
  7. 2. Игнорирование организационных и управленческих причин
  8. 3. Выбор действий по принципу «что проще сделать»
  9. 4. Отсутствие верификации эффективности
  10. 5. Расследование как ритуал поиска виноватого
  11. Сценарии выбора подхода: алгоритм решения
  12. Инструментария и оформление: что должно быть под рукой
  13. Интеграция с системами управления: от реакции к профилактике
  14. Практические рекомендации: с чего начать завтра
  15. Часто задаваемые вопросы
  16. Сколько времени должен занимать анализ причин?
  17. Нужен ли внешний эксперт для расследования?
  18. Как связать анализ причин с KPI подразделений?
  19. Что делать, если корневая причина — в проектировании оборудования, которое изменить нельзя?
  20. Как избежать формализма при повторяющихся инцидентах?
  21. Главный принцип: анализ — это инвестиция, а не затрата

Зачем нужен системный анализ причин

Без структурированного подхода расследование часто останавливается на уровне «человеческий фактор» или «износ оборудования». Такие выводы не дают основ для эффективных корректирующих действий: человек не станет бессознательно ошибаться реже по приказу, а износ устраняется капитальным ремонтом, который не всегда оправдан экономически.

Системный анализ решает три задачи:

  • Выделяет истинные корневые причины — те, устранение которых предотвратит повторение события при данных условиях.
  • Формирует доказательную базу для корректирующих и предупреждающих действий, понятную аудиторам, инспекторам и собственнику бизнеса.
  • Накопляет организационную память: база расследований становится источником знаний для FMEA, обновления инструкций и обучения персонала.

Ключевой принцип: корневая причина всегда лежит в процессе, организации работы или проектировании системы, а не в отдельном действии человека. Если вывод расследования — «нарушил инструкцию», анализ не завершён. Нужно понять, почему инструкцию было возможно нарушить, почему она не предотвратила ошибку, и почему защита не сработала.

Основные методы анализа причин: сравнение и область применения

Не существует универсального метода. Выбор зависит от сложности события, доступных данных, компетенций команды и целей расследования. Ниже — характеристики самых распространённых подходов.

Метод Суть подхода Для каких событий подходит Требования к команде Трудоёмкость
5 Why (5 почему) Последовательное задавание вопроса «Почему?» до достижения системной причины Простые и средние неисправности, линейные цепочки причин Базовые навыки фасилитации, знание процесса Низкая (15–60 мин)
Диаграмма Ишикава (рыбья кость) Визуализация причин по категориям: люди, методы, машины, материалы, среда, управление События с множеством сопутствующих факторов, командный мозговой штурм Кросс-функциональная команда, модератор Средняя (1–3 часа)
Дерево ошибок (Fault Tree Analysis, FTA) Дедуктивный топ-даун анализ: от нежелательного события к базовым событиям через логические вентили И/ИЛИ Критические аварии, системы безопасности, квантитативная оценка вероятности Инженерные навыки, знание логики отказов, ПО для сложных деревьев Высокая (дни/недели)
FMEA (анализ режимов и последствий отказов) Проактивный метод: систематический перебор режимов отказа, оценка тяжести, вероятности и обнаруживаемости (RPN) Проектирование новых процессов/оборудования, аудит существующих, планирование ТО Межфункциональная группа, опыт оценки рисков Высокая (недели на полный цикл)
Bowtie (метод «бабочка») Визуализация барьеров: слева — угрозы и превентивные барьеры, справа — последствия и митигативные барьеры Управление крупными рисками, процессная безопасность (PSM), коммуникация с заинтересованными сторонами Знание барьерной модели, доступ к данным о барьерах Средняя/высокая
TapRooT / Apollo RCA / KT Analytical Troubleshooting Структурированные проприетарные методики с таксономиями причин, чек-листами и ПО Корпоративные стандарты расследований, высокие требования к воспроизводимости Сертифицированные фасилитаторы, лицензии на ПО Средняя/высокая

На практике методы комбинируют: начинают с 5 Why для быстрой ориентации, углубляются через Ишикава для сбора гипотез, а критические случаи разбирают через FTA или Bowtie для доказательной базы и расчёта вероятностей.

Пошаговый процесс расследования: от факта к действию

Структура расследования должна быть зафиксирована в локальном нормативном документе (Положении о расследовании инцидентов). Типовой цикл включает следующие этапы.

  1. Фиксация и первичная оценка. Запись времени, места, задействованных, краткого описания. Классификация по тяжести (уязвимость / инцидент / авария) определяет состав комиссии и глубину анализа. Важно: сохранение места события до осмотра комиссией.
  2. Сбор доказательной базы. Интервью с участниками и свидетелями (отдельно, без давления), фото/видео места, изъятие журналов, логов контроллеров, записей SCADA, актов ТО, инструкций, рабочих черновиков. Доказательства делятся на физические, документальные, цифровые и свидетельские.
  3. Хронология событий (Timeline). Восстановление последовательности действий и состояний системы с точностью до минут/секунд. Это база для выявления пропущенных барьеров и точек разветвления сценария.
  4. Генерация гипотез причин. Командный сеанс (Ишикава или структурированный мозговой штурм) для выявления всех возможных причин по категориям. На этом этапе не критикуют идеи — собирают максимум вариантов.
  5. Проверка гипотоз и выделение корневых причин. Каждая гипотеза проверяется на фактах: подтверждается, опровергается или остаётся неопровержимой. Инструменты — 5 Why для линейных цепочек, FTA для сложных комбинаций. Корневая причина проходит тест: «Если устранить этот фактор, событие не повторится при тех же условиях?».
  6. Разработка корректирующих и предупреждающих действий (CAPA). Для каждой корневой причины — минимум одно действие. Действия делятся на: немедленные (сдерживание), корректирующие (устранение причины) и предупреждающие (системные изменения). Критерий SMART + ответственный + срок + критерий эффективности.
  7. Отчёт и коммуникация. Структурированный документ: описание события, хронология, методы анализа, выявленные причины (прямые, вкладывающие, корневые), план CAPA, уроки. Распространение по кругу заинтересованных сторон, включая смежные участки/заводы.
  8. Контроль реализации и проверка эффективности. Отслеживание сроков CAPA, верификация выполненных действий (аудит, проверка на месте), анализ повторных инцидентов за 6–12 месяцев. Закрытие расследования только после подтверждения эффективности.

Критерии качества анализа: как отличить работу от имитации

Результат расследования можно оценить по набору практических признаков. Если в отчёте есть хотя бы один из маркеров ниже — анализ требует доработки.

  • Корневая причина сформулирована как «человеческий фактор», «невнимательность», «нарушение инструкции», «отсутствие квалификации» без анализа системных условий.
  • Действия CAPA сводятся к «переобучить персонал», «напомнить о требованиях», «усилить контроль» без технических или организационных изменений.
  • Хронология содержит пробелы: неизвестно, что происходило в критические минуты до события.
  • Доказательная база опирается только на показания заинтересованных лиц, без физических или цифровых подтверждений.
  • Не рассмотрено, почему существующие барьеры (блокировки, сигнализация, двухконтроль, ППЭ) не сработали или были обойдены.
  • Отсутствует связь с предыдущими похожими событиями и актуальными FMEA/HAZOP.
  • Сроки CAPA нереалистичны («в течение месяца» без промежуточных контрольных точек).
  • Отчёт не дошёл до смежных участков, где существуют аналогичные риски.

Типичные ошибки и как их избежать

Ошибки системны и повторяются на разных предприятиях. Знание их механики позволяет встроить защиту в процесс расследования.

1. Подмена корневой причины прямым фактором

Суть: Команда останавливается на первом очевидном нарушении: «оператор не проверил давление».

Почему происходит: нехватка времени, отсутствие навыков фасилитации, давление руководства на быстрое закрытие.

Как избежать: формальное правило — минимум 3 уровня «Почему?» для каждого вкладывающего фактора. Обязательный вопрос: «Почему система позволила этому случиться?».

2. Игнорирование организационных и управленческих причин

Суть: Анализ ограничивается техническими и операционными факторами, не затрагивая планирование, закупки, обучение, KPI, подрядчиков, культуру безопасности.

Почему происходит: комиссия формируется только из производственников; методы (5 Why) не структурированы для выявления латентных управленческих дефектов.

Как избежать: в состав комиссии включать представителя ОТ/ТБ, технолога, представителя службы качества/безопасности. Использовать Ишикава с категорией «Управление/Организация».

3. Выбор действий по принципу «что проще сделать»

Суть: Вместо устранения причины внедряют дополнительную проверку, табличку, пункт в инструкции.

Почему происходит: иерархия контроля рисков не применяется; нет критериев оценки надежности действия.

Как избежать: обязательная оценка каждого действия по иерархии: исключение → подстановка → инженерная защита → административная мера → ППЭ. Действия ниже 3-го уровня требуют обоснования, почему вышестоящие невозможны.

4. Отсутствие верификации эффективности

Суть: Расследование закрывается по факту подписания отчёта, без проверки, работают ли меры через 3–6 месяцев.

Почему происходит: нет процесса follow-up, ответственный за CAPA не имеет ресурса на аудит.

Как избежать: в план CAPA встроить контрольные точки: «проверка на месте через 2 недели», «анализ отказов за квартал», «аудит соблюдения новой процедуры». Закрытие только после подтверждения.

5. Расследование как ритуал поиска виноватого

Суть: Участники боятся говорить открыто, дают социально желательные ответы, скрывают отклонения от инструкций.

Почему происходит: культура наказания за ошибки, отсутствие политики «справедливой культуры» (Just Culture).

Как избежать: чёткое разделение: расследование для обучения ≠ дисциплинарное расследование. Разные комиссии, разные регламенты, иммунитет за честные показания в рамках RCA (кроме грубой небрежности, умысла, состояния опьянения).

Сценарии выбора подхода: алгоритм решения

Ситуация на месте диктует набор инструментов. Ниже — практические правила выбора.

  • Одиночная неисправность оборудования без последствий для людей и среды, явная техническая причина (разрыв шланга, срабатывание предохранителя). Достаточно 5 Why + краткий отчёт. Срок: до смены.
  • Повторяющаяся неисправность (3+ раза за год) или простои с существенной экономической потерей. Ишикава + проверка FMEA на этом узле + анализ истории ТО. Кросс-функциональная команда. Срок: 3–5 дней.
  • Инцидент с травмой, выбросом, пожаром, аварийным сбросом — классифицируемый как авария по ПБ/ПТЭЭП/ТК РФ. Полный цикл: хронология + Ишикава для генерации гипотез + FTA/Bowtie для критических цепочек + формальный отчёт по форме регулятора. Независимая экспертиза при тяжёлых последствиях. Срок: по регламенту (обычно 10–30 дней).
  • Внедрение нового оборудования/технологии, изменение режимов работы. Проактивный FMEA на стадии проектирования/пусконаладки. Bowtie для критических сценариев. Обновление при каждом инциденте на новом оборудовании.
  • Системная проблема: рост травматизма по направлению, серия аварий на типовых участках. Мета-анализ базы инцидентов за 12–24 месяца: кластеризация по причинам, выявление системных пробелов. Стратегическая сессия с руководством. Результат — программа системных улучшений, а не набор локальных CAPA.

Инструментария и оформление: что должно быть под рукой

Эффективность расследования зависит от готовности шаблонов и доступа к данным. Минимальный набор:

  • Шаблон отчёта по расследованию (структурированный, с полями для хронологии, методов, причин, CAPA, верификации).
  • Чек-лист сбора доказательств: что фотографировать, какие логи выгружать, какие документы изымать, как проводить интервью.
  • Библиотека таксономий причин (например, TapRooT Root Cause Tree или собственная адаптация) — для единообразия классификации и трендинга.
  • Доступ к историческим данным: журнал инцидентов, база FMEA, отчёты по ТО, отчёты аудитов, данные CMMS/EAM.
  • ПО для визуализации: простой вариант — PowerPoint/Visio/Miro для Ишикава и таймлайна; профессиональный — специализированные RCA/FTA/Bowtie инструменты (PHA-Pro, BowTieXP, EasyRCA, TapRooT Software).
  • Реестр CAPA с автоматическими напоминаниями о сроках и этапах верификации.

Интеграция с системами управления: от реакции к профилактике

Анализ причин не должен существовать в вакууме. Его ценность умножается при интеграции с:

  • FMEA процесса/оборудования. Каждое расследование — триггер для пересмотра соответствующего FMEA: новые режимы отказа, уточненные оценки S/O/D, дополнительные действия.
  • Системе управления изменением (MOC). Если корневая причина — незаучтённое изменение (режим, материал, подрядчик, ПО), MOC-процесс должен быть усилен.
  • Планированию ТО и RCM. Статистика корневых причин отказов корректирует стратегии обслуживания: переход от планового к состояниевому, внедрение предиктивной диагностики, пересмотр частоты ТО.
  • Обучению и компетенциям. Выявленные пробелы в знаниях/навыках попадают в матрицу компетенций и план обучения, а не закрываются разовым инструктажем.
  • Управлению подрядчиками. Если причина в действиях подрядчика — анализ причин расширяется на процессы отбора, допуска, контроля и мотивации подрядной организации.

Практические рекомендации: с чего начать завтра

Если на предприятии нет системного подхода или он работает формально, начните с трёх конкретных шагов:

  1. Аудит последних 5–10 расследований. Оцените их по чек-листу качества (раздел выше). Выявите системные пробелы: до какого уровня «Почему?» заходят, какие действия CAPA преобладают, есть ли верификация.
  2. Внедрите обязательную хронологию и категоризацию причин. Даже для простых инцидентов требуйте таймлайн и заполнение Ишикава (можно упрощённо). Это формирует привычку думать системно.
  3. Назначьте и обучите 3–5 внутренних фасилитаторов RCA. Это не полная ставка, а роль: модерация сессий, контроль качества отчётов, обучение коллег. Дайте им методичку и мандат требовать доказательную базу.

Параллельно настройте ежемесячный разбор инцидентов на уровне руководства цеха/участка: не для отчётов, а для принятия решений по ресурсам на системные меры. Видимость поддержки руководства — главный фактор культуры анализа причин.

Часто задаваемые вопросы

Сколько времени должен занимать анализ причин?

Зависит от класса события. Для неисправностей категории «инцидент без последствий» — от 30 минут до 2 часов (5 Why/Ишикава). Для аварий с травмами/экологией — от 3 дней до нескольких недель (FTA, Bowtie, независимая экспертиза). Важно: сроки зафиксированы в локальном регламенте, а не «как успеем».

Нужен ли внешний эксперт для расследования?

Обязательно — для аварий с тяжёлыми последствиями, когда требуется независимость по требованию регулятора или собственника. Полезно — для сложных системных проблем, когда внутренняя команда «замылена» или не обладает нужной экспертизой (взрывозащита, коррозия, кибербезопасность ОТ). Для рутинных неисправностей внутренние фасилитаторы эффективнее: они знают контекст и отвечают за реализацию CAPA.

Как связать анализ причин с KPI подразделений?

Не включайте количество инцидентов в KPI — это провоцирует скрытие. Включайте: % расследований, закрытых в срок; % CAPA, реализованных в срок; % повторных инцидентов по тем же причинам; качество отчётов по аудиту. KPI должны стимулировать качество процесса, а не отсутствие событий.

Что делать, если корневая причина — в проектировании оборудования, которое изменить нельзя?

Это частая ситуация. Иерархия контроля: если исключение (перепроектирование) невозможно экономически/технически — переходите к инженерным барьерам (блокировки, датчики, автоматика), затем к административным (процедуры, обучение, контроль), затем к ППЭ. Документируйте остаточный риск и план мониторинга. В FMEA это отразится как высокий RPN с обоснованным принятием риска и компенсирующими мерами.

Как избежать формализма при повторяющихся инцидентах?

Ведите реестр повторов: если причина и мера совпадают с предыдущим случаем — это сигнал неэффективности меры. Триггер: автоматическое эскалирование на уровень выше, обязательное участие специалиста по безопасности/качеству, пересмотр метода анализа (например, переход с 5 Why на FTA).

Материал носит информационный характер и не заменяет требования действующего законодательства в области промышленной безопасности, охраны труда и технического регулирования. При расследовании аварий и инцидентов, подлежащих обязательной регистрации и расследованию по нормативным правовым актам (ФЗ-116, ПТЭЭП, ПБ, ТК РФ и др.), необходимо следовать утверждённым регламентам и вовлекать уполномоченные органы. Индивидуальные решения по безопасности критически важных объектов следует принимать с участием квалифицированных экспертов.

Главный принцип: анализ — это инвестиция, а не затрата

Качественный анализ причин стоит денег: время квалифицированных специалистов, остановка оборудования для сохранения места, возможная привлечение экспертов. Но стоимость повторной аварии — остановка производства, штрафы, репутация, травмы — на порядки выше. Экономика проста: каждый рубль, вложенный в системное устранение корневой причины, возвращается предотвращением потерь в будущем.

Начните с аудита текущих расследований, выделите 2–3 системные проблемы процесса (например, отсутствие хронологии, слабые CAPA, нет верификации) и исправьте их за квартал. Результат — не идеальные отчёты, а снижение повторов и рост доверия персонала к процессу безопасности. Это и есть индикатор работающей системы.

Материал прочитан. Продолжить в архиве →