Логотип Атримут
АТРИМУТ Технологии точного результата
Статьи

Регламентное обслуживание серверов: почему РТО дешевле аварии

Качественный ИТ-сервис начинается не с быстрого устранения аварий, а с регламентного технического обслуживания и актуальной документации. По моей практике, около половины инцидентов возникает именно там, где на них сэкономили.

Сервисный инженер очищает сервер в стойке от пыли антистатическим пылесосом

За годы работы в сервисном бизнесе через мои проекты прошли десятки миллионов инцидентов. И чем больше их было, тем твёрже я убеждался в простом постулате: качественный сервис начинается не с организации оперативного устранения инцидентов, а с регулярного технического обслуживания и поддержания технической документации в актуальном состоянии.

Это звучит скучно. Аварийная бригада, которая ночью подняла упавший сервис, выглядит героически. Инженер, который раз в полгода продувает сервер и обновляет схему коммутации, — не выглядит героем. Но именно второй делает так, чтобы первому не пришлось выезжать.

Откуда берутся инциденты

Статистика проектов, которые через меня прошли, устойчиво показывает две цифры:

  • около 40 % инцидентов возникает из-за несвоевременно проведённого или вообще не проведённого регламентного технического обслуживания (РТО);
  • ещё около 10 % — из-за неактуальной или отсутствующей технической документации.

То есть примерно каждый второй инцидент был предотвратим ещё до того, как случился.

Мировая статистика говорит о том же. По данным Uptime Institute, человеческий фактор так или иначе участвует в 2/3–4/5 всех инцидентов в дата-центрах. Среди сбоев по вине персонала 58 % вызваны несоблюдением процедур, а 45 % — некорректными процедурами и регламентами (ServerNews). Ещё 16 % связаны с отсутствием регулярного планово-предупредительного обслуживания (Telecombloger). Сами операторы ЦОД это понимают: 80 % считают, что последнего сбоя можно было избежать при лучшем управлении (ICT.Moscow).

Причины сбоев по вине персонала по данным Uptime Institute
Рис. 1. Причины сбоев, связанных с человеческим фактором (Uptime Institute, 2025). Один сбой может иметь несколько причин, поэтому сумма больше 100 %

Пыль — самый дешёвый инцидент, который можно предотвратить

Самый наглядный пример — обычная пыль. Она оседает на вентиляторах, радиаторах процессоров и блоках питания и работает как теплоизолятор. По данным, которые приводит Servermall, без регулярной очистки рабочая температура электроники может вырасти на 16,5 °C (Хабр). Перегрев считается главным врагом серверов: уже выше +30 °C растёт риск сбоев, а выше +35 °C вероятность отказов растёт лавинообразно (РБК Компании).

Сравните два сценария.

Первый: раз в полгода инженер выводит сервер в окно обслуживания, очищает его от пыли, проверяет вентиляторы и журналы. Это несколько часов работы по плану.

Второй: сервер годами стоит без обслуживания, перегревается и выходит из строя. Теперь нужно покупать новый сервер, срочно восстанавливать сервисы и данные, а бизнес всё это время простаивает. Средняя стоимость одного критичного простоя в российских компаниях приближается к 2 млн рублей (Киберпротект), и она продолжает расти: в 2025 году стоимость часа простоя выросла у 39 % компаний (CNews).

Разница между этими сценариями — порядки, а не проценты.

Документация: когда инженер работает как сапёр

С документацией история менее очевидна, но последствия бывают тяжелее. Два примера из практики.

Пример 1. SAN

У одного сервера пропала связность с сетью хранения данных (SAN). Инцидент небольшой: затронута вспомогательная инфраструктура. Инженер приезжает на объект без схемы коммутации или со схемой трёхлетней давности. Какой порт фабрики к чему подключён, неизвестно. И он, как сапёр, начинает наугад переключать линки на SAN-коммутаторах.

Итог: вместо одного сервера без доступа к хранилищу лежит весь продуктивный контур. Небольшой инцидент превратился в аварию.

Пример 2. Блейд-корзина

Нужно заменить одно лезвие (блейд-сервер) в корзине. Документации по конфигурации и совместимым моделям нет. Инженер «на глазок» подбирает вроде бы подходящее лезвие и вставляет его в слот.

Итог: минус два лезвия, повреждённый бэкплейн корзины и остановка всех сервисов, которые на ней работали. Ехали менять одну деталь, а получили ремонт всей корзины и простой.

Почему РТО и документацию считают «воздухом»

У профилактики есть неудобное свойство: когда она работает, результата не видно. Сервер не сгорел, авария не случилась, инженер не выезжал ночью. Заказчик видит в отчёте «проведено РТО, обновлена документация» и задаётся вопросом: а за что мы, собственно, платим?

Это парадокс предотвращения. Мы хорошо видим цену аварии, которая произошла, и почти не видим цену аварии, которая не произошла.

Но экономика здесь простая. Заказчик платит за РТО и документацию не как за бесполезный воздух, а как за страховку, которая:

  • сокращает количество инцидентов — по моей практике почти вдвое;
  • сокращает время восстановления, потому что инженер знает, что и где;
  • снижает риск того, что мелкий инцидент перерастёт в аварию;
  • продлевает срок службы оборудования и откладывает его замену.

Как посчитать пользу

Чтобы перевести разговор с заказчиком из эмоций в цифры, достаточно простого сравнения:

Что сравниваем Профилактика Авария
Когда происходит В плановое окно В любой момент, часто ночью и в пиковую нагрузку
Затраты на работы Плановые часы инженера Срочный выезд, аварийные работы
Оборудование Расходники: фильтры, термопаста, вентиляторы Замена сервера, лезвия, корзины
Простой бизнеса Нет или минимальный, согласованный Часы и дни, в среднем около 2 млн рублей за критичный простой
Репутация Не страдает Жалобы клиентов, штрафы по SLA

Если за год регламентное обслуживание предотвращает хотя бы один крупный инцидент, оно, как правило, окупается многократно.

Что должно входить в РТО и документацию

Минимальный набор, который я рекомендую закладывать в любой сервисный контракт:

  1. Плановая очистка оборудования от пыли и проверка охлаждения — не реже раза в полгода, в запылённых помещениях чаще.
  2. Проверка вентиляторов, блоков питания, дисков и RAID-массивов, анализ журналов оборудования.
  3. Проверка ИБП и аккумуляторов.
  4. Актуальные схемы коммутации: LAN, SAN, питание, с маркировкой кабелей и портов.
  5. Паспорта и конфигурации оборудования, перечни совместимых компонентов.
  6. Пошаговые инструкции для типовых работ: замена лезвия, диска, блока питания.
  7. Правило: после любых изменений документация обновляется сразу, а не «когда-нибудь».

Вывод

Быстрая аварийная бригада — это важно. Но это последняя линия обороны, а не первая. Качественный сервис строится на регулярном обслуживании и актуальной документации: они убирают значительную часть инцидентов ещё до того, как те случились, а оставшиеся делают короче и дешевле.

Пылесос и обновлённая схема коммутации стоят несравнимо меньше, чем сгоревший сервер и остановленный бизнес. Если вы хотите выстроить сервис именно так, специалисты ИТ-сервиса Атримут помогут составить регламент обслуживания и привести документацию в порядок.

Вопросы и ответы

Что такое РТО в ИТ-инфраструктуре?

РТО — регламентное техническое обслуживание: плановые работы по графику, которые предотвращают отказы. Сюда входит очистка оборудования от пыли, проверка охлаждения, питания, дисков, журналов и обновление документации.

Как часто нужно чистить сервер от пыли?

В обычной серверной — не реже раза в полгода. В запылённых или производственных помещениях — раз в 1–3 месяца. Точную периодичность лучше определять по условиям эксплуатации и данным мониторинга температур.

Какая часть ИТ-инцидентов связана с отсутствием обслуживания?

По практике автора, около 40 % инцидентов связано с непроведённым или несвоевременным РТО и ещё около 10 % — с неактуальной документацией. По данным Uptime Institute, большинство сбоев по вине персонала связано с несоблюдением или некорректностью процедур.

Зачем платить за документацию, если инженеры и так всё знают?

Инженеры меняются, а инфраструктура со временем усложняется. Без актуальных схем и инструкций даже опытный специалист работает наугад, и небольшой инцидент может перерасти в аварию всего контура.

  • ИТ-сервис
  • регламентное обслуживание
  • техническая документация
  • серверы
  • простои
Андрей Громов — Технический директор ООО «Атримут»
Автор

Технический директор ООО «Атримут»

16 лет в ИТ. Специализация — аддитивные технологии, сервисная инфраструктура, управление федеральными проектами, госсектор.

Чем Атримут может помочь

Нужна консультация инженера?

Расскажите о задаче — подскажем решение: 3D-печать, сканирование, реинжиниринг, ПО или ИТ-сервис.