Monitoring serwerów i sieci w firmie – krok po kroku
Większość awarii w małych firmach nie przychodzi nagle. Zapchany dysk, degradujący się RAID albo wygasający certyfikat SSL dają sygnały na wiele dni wcześniej, ale nikt ich nie widzi. W tym poradniku pokazujemy, jak krok po kroku wdrożyć monitoring serwerów i sieci, który ostrzeże Cię, zanim pracownicy zaczną dzwonić, że nic nie działa.
Dlaczego mała firma potrzebuje monitoringu
W wielu firmach o awarii pierwszy dowiaduje się pracownik, który nie może otworzyć pliku z serwera albo wysłać faktury. Wtedy jest już za późno na spokojną reakcję: trzeba gasić pożar, a przestój kosztuje. Monitoring odwraca tę kolejność. To system sam zauważa problem i powiadamia odpowiedzialną osobę, często zanim ktokolwiek odczuje skutki.
Typowe sytuacje, które dobry monitoring wychwytuje z wyprzedzeniem:
- dysk serwera zapełniony w 90% przez rosnące logi lub kopie tymczasowe,
- jeden z dysków w macierzy RAID zgłasza błędy SMART lub całkowicie wypadł z macierzy,
- zadanie kopii zapasowej od trzech dni kończy się błędem,
- certyfikat SSL strony lub serwera pocztowego wygasa za 14 dni,
- UPS przeszedł na zasilanie bateryjne, a bateria jest już zużyta,
- łącze internetowe traci pakiety lub zapasowe łącze nie działa od tygodni.
Monitoring nie zastępuje backupu ani aktualizacji, ale sprawia, że o ich problemach dowiadujesz się na czas. Jeśli nie masz jeszcze uporządkowanego procesu łatania systemów, zajrzyj do poradnika o tym, jak zarządzać aktualizacjami systemów w firmie.
Krok 1: Inwentaryzacja – co właściwie monitorować
Zanim zainstalujesz jakiekolwiek narzędzie, spisz elementy infrastruktury, od których zależy praca firmy. W typowym MŚP będzie to lista kilkunastu, a nie setek pozycji.
- Serwery i maszyny wirtualne – kontroler domeny, serwer plików, serwer aplikacji (np. system księgowy), hypervisor.
- Urządzenia sieciowe – router lub firewall, przełączniki, punkty dostępowe Wi-Fi.
- Pamięć masowa – NAS, macierze, dyski z kopiami zapasowymi.
- Zasilanie – UPS-y w serwerowni lub szafie rack.
- Usługi zewnętrzne – strona WWW, sklep internetowy, poczta, VPN, portale klientów.
Dla każdego elementu zapisz, kto jest za niego odpowiedzialny i jak krytyczny jest jego przestój. Ta prosta tabela przyda się później przy ustalaniu priorytetów alarmów i ścieżki eskalacji.
Krok 2: Wybór narzędzia i sposobu zbierania danych
Dla małej firmy nie trzeba od razu kupować drogiego systemu klasy enterprise. Na rynku są dojrzałe narzędzia open source i darmowe wersje komercyjnych produktów. Wybór zależy głównie od tego, czy chcesz sprawdzać tylko dostępność usług, czy także stan wewnętrzny serwerów.
- Uptime Kuma – lekkie narzędzie do sprawdzania dostępności: ping, HTTP(S), porty TCP, DNS, ważność certyfikatów. Uruchamiasz je w kontenerze Docker w kilka minut. Idealne na start i do monitorowania usług zewnętrznych.
- Zabbix – pełny system monitoringu z agentami na serwerach, obsługą SNMP dla urządzeń sieciowych, szablonami dla Windows, Linux, popularnych przełączników i UPS-ów. Wymaga więcej konfiguracji, ale daje wgląd w metryki i historię.
- Checkmk – również oparty na agentach, z bardzo dobrym automatycznym wykrywaniem usług na hostach.
- PRTG – komercyjny, bardzo przystępny w obsłudze, darmowy do 100 sensorów, co w małej firmie często wystarcza.
Dane zbiera się na trzy sposoby: agentem zainstalowanym na serwerze (najdokładniej: CPU, RAM, dyski, usługi, logi), przez SNMP z urządzeń sieciowych, drukarek i UPS-ów (w wersji SNMPv3 z uwierzytelnianiem i szyfrowaniem) oraz sprawdzeniami z zewnątrz (ping, HTTP, porty). Ważna zasada: serwer monitoringu sam w sobie jest krytyczny, więc warto dodatkowo sprawdzać go z zewnętrznej lokalizacji – choćby prostą instancją Uptime Kuma na tanim VPS-ie. Inaczej awaria całej serwerowni wyłączy również system, który miał Cię o niej powiadomić.
Krok 3: Kluczowe metryki i rozsądne progi alarmów
Najczęstszy błąd przy wdrożeniu to monitorowanie wszystkiego z domyślnymi progami. Efekt: dziesiątki powiadomień dziennie, które po tygodniu wszyscy ignorują. Zacznij od metryk, które rzeczywiście zapowiadają awarię:
- Zajętość dysków – ostrzeżenie przy 80%, alarm krytyczny przy 90%. Dla dużych wolumenów lepiej ustawić próg w gigabajtach wolnego miejsca.
- Stan dysków i RAID – atrybuty SMART (realokowane sektory), status macierzy, błędy kontrolera.
- Status kopii zapasowych – czy ostatnie zadanie zakończyło się sukcesem i czy nie jest starsze niż 24–26 godzin. Brak nowej kopii to sygnał równie ważny jak błąd.
- Usługi systemowe – np. usługa bazy danych, serwer plików, kontroler domeny, DNS.
- Certyfikaty SSL – ostrzeżenie 21 dni przed wygaśnięciem, alarm 7 dni przed.
- UPS – praca na baterii, szacowany czas podtrzymania, wynik autotestu baterii.
- Łącze internetowe – utrata pakietów, opóźnienia, dostępność łącza zapasowego.
Obciążenie CPU czy RAM warto zbierać do wykresów i analizy trendów, ale alarmować dopiero przy długotrwałym przekroczeniu, np. powyżej 90% przez 15 minut. Chwilowe skoki są normalne i nie powinny budzić nikogo w nocy. Jeśli kopie zapasowe serwerów dopiero porządkujesz, pomocny będzie poradnik backup serwera Linux krok po kroku – monitoring statusu zadań to jego naturalne uzupełnienie.
Krok 4: Powiadomienia, eskalacja i walka ze zmęczeniem alarmami
Alarm, którego nikt nie przeczyta, jest bezwartościowy. Zaplanuj, kto, jak i kiedy dostaje powiadomienia:
- Podziel alarmy na poziomy. Ostrzeżenia trafiają na e-mail lub kanał w Teams i są przeglądane w godzinach pracy. Alarmy krytyczne idą dodatkowo na telefon (aplikacja, Telegram, SMS).
- Ustal ścieżkę eskalacji. Jeśli alarm krytyczny nie zostanie potwierdzony w ciągu 30 minut, powiadomienie trafia do kolejnej osoby.
- Używaj zależności. Gdy padnie router, system nie powinien wysyłać dwudziestu osobnych alarmów o niedostępnych serwerach za nim. Zabbix i Checkmk pozwalają zdefiniować takie powiązania.
- Planuj okna serwisowe. Na czas aktualizacji i restartów wycisz alarmy dla wybranych hostów, żeby nie uczyć zespołu ignorowania powiadomień.
- Przeglądaj alarmy raz w miesiącu. Każdy alarm, który regularnie się pojawia i nie wymaga działania, to kandydat do zmiany progu lub usunięcia.
Zadbaj też o bezpieczeństwo samego systemu: panel monitoringu nie powinien być wystawiony do internetu bez VPN i MFA, a konta SNMP i agentów powinny mieć minimalne uprawnienia. Serwer monitoringu zna całą Twoją infrastrukturę, więc dla atakującego to bardzo cenny cel.
Monitoring we własnym zakresie czy w ramach usługi
Samodzielne postawienie Uptime Kuma to kwestia jednego popołudnia. Pełne wdrożenie Zabbixa z szablonami, SNMP, zależnościami i sensownymi progami zajmuje zwykle kilka dni, a potem wymaga stałej opieki: aktualizacji, dostrajania alarmów i – co najważniejsze – kogoś, kto na te alarmy reaguje. W firmie bez własnego działu IT to właśnie reakcja jest najsłabszym ogniwem.
Dlatego wiele MŚP decyduje się na monitoring w ramach stałej opieki technicznej. W usłudze utrzymania serwerów NovaSys monitorujemy kluczowe elementy infrastruktury, reagujemy na alarmy i regularnie raportujemy stan systemów. Jeśli natomiast dopiero planujesz nowy serwer lub modernizację serwerowni, monitoring warto zaprojektować od razu w ramach wdrożenia serwera – taniej i prościej niż dokładanie go później.
| Narzędzie | Licencja | Najlepsze do | Trudność wdrożenia |
|---|---|---|---|
| Uptime Kuma | Open source (MIT) | Dostępność usług, WWW, certyfikaty SSL | Niska |
| Zabbix | Open source | Pełny monitoring serwerów i sieci, SNMP | Średnia–wysoka |
| Checkmk | Open source + wersje płatne | Serwery z automatycznym wykrywaniem usług | Średnia |
| PRTG | Komercyjna, darmowa do 100 sensorów | Szybki start w środowisku Windows | Niska–średnia |
Chcesz wiedzieć o awarii, zanim zauważą ją pracownicy?
NovaSys wdraża i prowadzi monitoring serwerów oraz sieci dla firm z Wrocławia i okolic. Dobierzemy narzędzie, ustawimy sensowne progi alarmów i zareagujemy, gdy coś zacznie się psuć.