Monitoring serwerów i sieci w firmie – krok po kroku

Większość awarii w małych firmach nie przychodzi nagle. Zapchany dysk, degradujący się RAID albo wygasający certyfikat SSL dają sygnały na wiele dni wcześniej, ale nikt ich nie widzi. W tym poradniku pokazujemy, jak krok po kroku wdrożyć monitoring serwerów i sieci, który ostrzeże Cię, zanim pracownicy zaczną dzwonić, że nic nie działa.

Dlaczego mała firma potrzebuje monitoringu

W wielu firmach o awarii pierwszy dowiaduje się pracownik, który nie może otworzyć pliku z serwera albo wysłać faktury. Wtedy jest już za późno na spokojną reakcję: trzeba gasić pożar, a przestój kosztuje. Monitoring odwraca tę kolejność. To system sam zauważa problem i powiadamia odpowiedzialną osobę, często zanim ktokolwiek odczuje skutki.

Typowe sytuacje, które dobry monitoring wychwytuje z wyprzedzeniem:

  • dysk serwera zapełniony w 90% przez rosnące logi lub kopie tymczasowe,
  • jeden z dysków w macierzy RAID zgłasza błędy SMART lub całkowicie wypadł z macierzy,
  • zadanie kopii zapasowej od trzech dni kończy się błędem,
  • certyfikat SSL strony lub serwera pocztowego wygasa za 14 dni,
  • UPS przeszedł na zasilanie bateryjne, a bateria jest już zużyta,
  • łącze internetowe traci pakiety lub zapasowe łącze nie działa od tygodni.

Monitoring nie zastępuje backupu ani aktualizacji, ale sprawia, że o ich problemach dowiadujesz się na czas. Jeśli nie masz jeszcze uporządkowanego procesu łatania systemów, zajrzyj do poradnika o tym, jak zarządzać aktualizacjami systemów w firmie.

Krok 1: Inwentaryzacja – co właściwie monitorować

Zanim zainstalujesz jakiekolwiek narzędzie, spisz elementy infrastruktury, od których zależy praca firmy. W typowym MŚP będzie to lista kilkunastu, a nie setek pozycji.

  1. Serwery i maszyny wirtualne – kontroler domeny, serwer plików, serwer aplikacji (np. system księgowy), hypervisor.
  2. Urządzenia sieciowe – router lub firewall, przełączniki, punkty dostępowe Wi-Fi.
  3. Pamięć masowa – NAS, macierze, dyski z kopiami zapasowymi.
  4. Zasilanie – UPS-y w serwerowni lub szafie rack.
  5. Usługi zewnętrzne – strona WWW, sklep internetowy, poczta, VPN, portale klientów.

Dla każdego elementu zapisz, kto jest za niego odpowiedzialny i jak krytyczny jest jego przestój. Ta prosta tabela przyda się później przy ustalaniu priorytetów alarmów i ścieżki eskalacji.

Krok 2: Wybór narzędzia i sposobu zbierania danych

Dla małej firmy nie trzeba od razu kupować drogiego systemu klasy enterprise. Na rynku są dojrzałe narzędzia open source i darmowe wersje komercyjnych produktów. Wybór zależy głównie od tego, czy chcesz sprawdzać tylko dostępność usług, czy także stan wewnętrzny serwerów.

  • Uptime Kuma – lekkie narzędzie do sprawdzania dostępności: ping, HTTP(S), porty TCP, DNS, ważność certyfikatów. Uruchamiasz je w kontenerze Docker w kilka minut. Idealne na start i do monitorowania usług zewnętrznych.
  • Zabbix – pełny system monitoringu z agentami na serwerach, obsługą SNMP dla urządzeń sieciowych, szablonami dla Windows, Linux, popularnych przełączników i UPS-ów. Wymaga więcej konfiguracji, ale daje wgląd w metryki i historię.
  • Checkmk – również oparty na agentach, z bardzo dobrym automatycznym wykrywaniem usług na hostach.
  • PRTG – komercyjny, bardzo przystępny w obsłudze, darmowy do 100 sensorów, co w małej firmie często wystarcza.

Dane zbiera się na trzy sposoby: agentem zainstalowanym na serwerze (najdokładniej: CPU, RAM, dyski, usługi, logi), przez SNMP z urządzeń sieciowych, drukarek i UPS-ów (w wersji SNMPv3 z uwierzytelnianiem i szyfrowaniem) oraz sprawdzeniami z zewnątrz (ping, HTTP, porty). Ważna zasada: serwer monitoringu sam w sobie jest krytyczny, więc warto dodatkowo sprawdzać go z zewnętrznej lokalizacji – choćby prostą instancją Uptime Kuma na tanim VPS-ie. Inaczej awaria całej serwerowni wyłączy również system, który miał Cię o niej powiadomić.

Krok 3: Kluczowe metryki i rozsądne progi alarmów

Najczęstszy błąd przy wdrożeniu to monitorowanie wszystkiego z domyślnymi progami. Efekt: dziesiątki powiadomień dziennie, które po tygodniu wszyscy ignorują. Zacznij od metryk, które rzeczywiście zapowiadają awarię:

  • Zajętość dysków – ostrzeżenie przy 80%, alarm krytyczny przy 90%. Dla dużych wolumenów lepiej ustawić próg w gigabajtach wolnego miejsca.
  • Stan dysków i RAID – atrybuty SMART (realokowane sektory), status macierzy, błędy kontrolera.
  • Status kopii zapasowych – czy ostatnie zadanie zakończyło się sukcesem i czy nie jest starsze niż 24–26 godzin. Brak nowej kopii to sygnał równie ważny jak błąd.
  • Usługi systemowe – np. usługa bazy danych, serwer plików, kontroler domeny, DNS.
  • Certyfikaty SSL – ostrzeżenie 21 dni przed wygaśnięciem, alarm 7 dni przed.
  • UPS – praca na baterii, szacowany czas podtrzymania, wynik autotestu baterii.
  • Łącze internetowe – utrata pakietów, opóźnienia, dostępność łącza zapasowego.

Obciążenie CPU czy RAM warto zbierać do wykresów i analizy trendów, ale alarmować dopiero przy długotrwałym przekroczeniu, np. powyżej 90% przez 15 minut. Chwilowe skoki są normalne i nie powinny budzić nikogo w nocy. Jeśli kopie zapasowe serwerów dopiero porządkujesz, pomocny będzie poradnik backup serwera Linux krok po kroku – monitoring statusu zadań to jego naturalne uzupełnienie.

Krok 4: Powiadomienia, eskalacja i walka ze zmęczeniem alarmami

Alarm, którego nikt nie przeczyta, jest bezwartościowy. Zaplanuj, kto, jak i kiedy dostaje powiadomienia:

  1. Podziel alarmy na poziomy. Ostrzeżenia trafiają na e-mail lub kanał w Teams i są przeglądane w godzinach pracy. Alarmy krytyczne idą dodatkowo na telefon (aplikacja, Telegram, SMS).
  2. Ustal ścieżkę eskalacji. Jeśli alarm krytyczny nie zostanie potwierdzony w ciągu 30 minut, powiadomienie trafia do kolejnej osoby.
  3. Używaj zależności. Gdy padnie router, system nie powinien wysyłać dwudziestu osobnych alarmów o niedostępnych serwerach za nim. Zabbix i Checkmk pozwalają zdefiniować takie powiązania.
  4. Planuj okna serwisowe. Na czas aktualizacji i restartów wycisz alarmy dla wybranych hostów, żeby nie uczyć zespołu ignorowania powiadomień.
  5. Przeglądaj alarmy raz w miesiącu. Każdy alarm, który regularnie się pojawia i nie wymaga działania, to kandydat do zmiany progu lub usunięcia.

Zadbaj też o bezpieczeństwo samego systemu: panel monitoringu nie powinien być wystawiony do internetu bez VPN i MFA, a konta SNMP i agentów powinny mieć minimalne uprawnienia. Serwer monitoringu zna całą Twoją infrastrukturę, więc dla atakującego to bardzo cenny cel.

Monitoring we własnym zakresie czy w ramach usługi

Samodzielne postawienie Uptime Kuma to kwestia jednego popołudnia. Pełne wdrożenie Zabbixa z szablonami, SNMP, zależnościami i sensownymi progami zajmuje zwykle kilka dni, a potem wymaga stałej opieki: aktualizacji, dostrajania alarmów i – co najważniejsze – kogoś, kto na te alarmy reaguje. W firmie bez własnego działu IT to właśnie reakcja jest najsłabszym ogniwem.

Dlatego wiele MŚP decyduje się na monitoring w ramach stałej opieki technicznej. W usłudze utrzymania serwerów NovaSys monitorujemy kluczowe elementy infrastruktury, reagujemy na alarmy i regularnie raportujemy stan systemów. Jeśli natomiast dopiero planujesz nowy serwer lub modernizację serwerowni, monitoring warto zaprojektować od razu w ramach wdrożenia serwera – taniej i prościej niż dokładanie go później.

Porównanie popularnych narzędzi do monitoringu dla MŚP
NarzędzieLicencjaNajlepsze doTrudność wdrożenia
Uptime KumaOpen source (MIT)Dostępność usług, WWW, certyfikaty SSLNiska
ZabbixOpen sourcePełny monitoring serwerów i sieci, SNMPŚrednia–wysoka
CheckmkOpen source + wersje płatneSerwery z automatycznym wykrywaniem usługŚrednia
PRTGKomercyjna, darmowa do 100 sensorówSzybki start w środowisku WindowsNiska–średnia

Chcesz wiedzieć o awarii, zanim zauważą ją pracownicy?

NovaSys wdraża i prowadzi monitoring serwerów oraz sieci dla firm z Wrocławia i okolic. Dobierzemy narzędzie, ustawimy sensowne progi alarmów i zareagujemy, gdy coś zacznie się psuć.

Zapytaj o monitoring Bezpłatna konsultacja