Видеть состояние сети, а не ждать жалоб
Пропадает связь с устройством, перегружен канал, на порту растёт количество ошибок или UPS переходит на батарею — такие события важно замечать вовремя, пока они не привели к длительному простою.
Вместе определим ключевые устройства и соединения, от которых зависит ваша инфраструктура. Настрою проверки и пороги под их назначение, чтобы вы видели состояние сети и могли использовать историю показателей при поиске причин неисправности.
Что можно контролировать
- Доступность устройств. Потерю связи с маршрутизаторами, коммутаторами, точками доступа и другим сетевым оборудованием.
- Порты и интерфейсы. Состояние важных соединений, изменение скорости подключения, ошибки и отброшенные пакеты — если устройство предоставляет эти показатели.
- Загрузку каналов. Входящий и исходящий трафик, приближение к согласованным порогам и повторяющиеся периоды высокой нагрузки.
- Сбор метрик по SNMP. Подключу получение показателей напрямую с оборудования: загрузку процессора, память, температуру, состояние вентиляторов и блоков питания, а также другие доступные метрики. Использую готовые шаблоны Zabbix или согласуем разработку проверок под конкретную модель. Состав показателей зависит от возможностей устройства и настроек SNMP.
- Сетевые хранилища NAS. Свободное место, состояние дисков, массивов и служб в пределах возможностей оборудования.
- Источники бесперебойного питания. Работу от сети или батареи, заряд, нагрузку и доступные события неисправности.
- Камеры и видеорегистраторы (NVR). Доступность камер и регистраторов, состояние дисков, температуру и другие показатели, доступные через SNMP или API. Проверки видеопотока, записи и архива согласуем с учётом возможностей конкретной модели.
- Связь с филиалами и VPN. Доступность удалённых узлов и состояние соединений, если используемое оборудование позволяет получать необходимые данные.
Что вы получите
Панель состояния подключённых устройств, графики нагрузки и уведомления о согласованных событиях. Вы сможете видеть, где пропала связь, какие интерфейсы перегружены и какие показатели изменились перед сбоем.
Настрою зависимости проверок там, где это применимо: например, чтобы потеря связи с вышестоящим коммутатором не вызывала поток отдельных уведомлений по каждому подключённому устройству. Передам список проверок и объясню логику оповещений.
Что согласуем отдельно
Разработку шаблонов для нестандартного оборудования, подключение удалённых площадок и организацию доступа к закрытым сетям оценим при обсуждении задачи. Изменение сетевой конфигурации, ремонт и замена оборудования, устранение неисправностей и постоянное сопровождение согласуются отдельно.