Деталь за две цента, которая остановила завод на месяц
Я учился на инженера по промышленности, и моя первая работа после университета была в крупном производственном предприятии, в команде, которая собирала и анализировала данные с датчиков на промышленных машинах. Это была простая и полезная работа. Эти машины выполняли дорогое, крупносерийное производство, и каждый день простоя машины стоил клиенту серьёзных денег. Наша задача заключалась в том, чтобы заметить приближающийся отказ прежде, чем он произойдёт, чтобы можно было отправить техника на ремонт в плановое окно, а не терять дни из‑за поломки.
Система работала хорошо. Она следила за деталями, которые обычно изнашивались, изучала шаблоны, предшествующие типичным отказам, и научилась их предсказывать. Для тех отказов, на которые её проектировали, она делала именно то, что от неё требовалось.
А потом однажды машина остановилась из‑за того, что сломался маленький болт. Болт стоил примерно два цента. На нём не было датчика, не было потока данных, который бы за ним следил, в модели это не учитывали. Зачем бы это делать? Он ломался редко. Это не был один из режимов отказа, которые кто‑то решал инструментировать, потому что инструментировать отслеживание двухцентовой детали, которая выходит из строя раз в сто лет, не имеет смысла, когда ты сосредоточен на дорогих, предсказуемых вещах.
Поэтому система не могла предсказать этот отказ. Она просто не имела на это данных. Этот тип поломки полностью находился за пределами того, что система была создана отслеживать.
И вот где двухцентовая проблема превратилась в катастрофу. Этот болт был специализированной деталью, не лежавшей на полке. Его нужно было заказывать у конкретного поставщика, и пока все ждали его прибытия, машина стояла мёртвой. К тому моменту, когда деталь пришла и техник её установил, машина клиента простаивала почти месяц.
Двухцентовая деталь вывела производственную линию из строя на недели и стоила целое состояние в потерянном выпуске. Самый дешёвый и на редкость редкий отказ в системе оказался самым дорогим в том году.
После того периода я переключился из промышленного инжиниринга на данные и ИИ и видел повторение этой же схемы в системах за системами, в отраслях, не имеющих ничего общего с печатью или болтами. Это стоит назвать прямо, потому что это реально обходится производителям в деньги и почти незаметно, пока не ударит.
Любая предиктивная система строится вокруг тех отказов, которые вы ожидаете. Вы ставите датчики на части, которые, как вы знаете, изнашиваются, обучаете модель на шаблонах, которые видели раньше, и оптимизируете под типичный случай. Это рационально, и это работает — до тех пор, пока не произойдёт отказ, который никто не смоделировал.
Проблема структурная, а не в ошибке какого‑то человека. Система, настроенная ловить средний, ожидаемый отказ, по конструкции слепа к редкому, потому что редкого не было в данных, на которых она училась. Он не проявляется как предупреждение. Он проявляется как машина, внезапно мёртвая, без сработавшего сигнала.
Более глубокая ловушка в том, что мы склонны определять, за чем следить, исходя из частоты отказов. Этот инстинкт как раз противоположен тому, что нужно для самых болезненных отказов. Стоимость поломки почти никак не связана с тем, как часто она происходит. Двухцентовый болт, который ломается один раз, может стоить гораздо дороже, чем изнашивающаяся деталь, которую вы меняете по графику каждый квартал, потому что ущерб не в самой детали; он в том, сколько времени линия будет простаивать и насколько быстро вы сможете отреагировать.
Частота говорит вам, чего ожидать. Она ничего не говорит о том, что действительно вам навредит.
Поэтому вопрос, который стоит задать — прежде чем делать следующую инвестицию в предиктивное обслуживание или настраивать мониторинг — не «Ловим ли мы известные нам отказы?». Скорее всего, ловите. Лучше спросить: «Что могло бы вывести линию из строя, на что у нас нет датчика и на что у нас нет плана реагирования?»
Обойдите машину и посмотрите на детали, которые не оснащены датчиками, не потому что они неважны, а потому что казались слишком маленькими или слишком редкими, чтобы тратить на них внимание. Спросите, какая из этих деталей, если она выйдет из строя в самый неподходящий момент, не позволит вам быстро восстановить работу, потому что деталь специализирована или реакция не готова.
Именно на этом пересечении — отказ, которого вы не видите, и из‑за которого вы не сможете быстро восстановиться — сейчас скрывается ваш следующий месячный простой.
Ничего из сказанного не означает, что мониторить распространённые отказы — неверно. Это необходимо, и системы, которые делают это хорошо, оправдывают себя. Но система, оптимизированная только под средний, ожидаемый отказ, всегда оставит уязвимость перед тем, что вы не подумали отследить — и на заводском цеху эта уязвимость измеряется неделями простоя и строкой в отчёте о прибылях и убытках, которую никто не ожидал.
Такая машина, которая с большей вероятностью устроит вам сюрприз, — это не та, которая ломается понятными вам способами. Это та, которая вот‑вот сломается так, как ваша система никогда не была спроектирована увидеть.
Майкл Подгортсев — директор по стратегии данных и ИИ и бывший технический директор. У него степень в области промышленного инжиниринга, и он начал карьеру, создавая системы предиктивного обслуживания на основе данных с датчиков промышленных машин.
