Pereiti prie turinio

Serverių stebėjimas, kuris įspėja anksčiau nei įvyksta sutrikimas.

Dauguma serverių nesugenda — jiems tiesiog kažko pritrūksta. Viena bash eilutė įdiegia agentą, po 30 sekundžių jis jau siunčia ataskaitas, o diskas sutvarkomas ties 90 %, ne ties 100 %.

30 dienų nemokamas bandymas Be kreditinės kortelės Linux · įdiegiama greičiau nei per minutę
Ataskaitų intervalas
30s
Rodikliai serveryje
17
Neveikimas pastebimas per
90s
Rodiklių istorija
1year

Nuo prisipildančio disko iki įspėjimo — 30 sekundžių

Per naktį prisikaupia žurnalų, ir viename serveryje pritrūksta vietos diske. Kol kas viskas veikia — mažas agentas siunčia ataskaitas kas 30 sekundžių, todėl įspėjime nurodomas ir serveris, ir diskas, kol dar spėsite jį išvalyti.

02:14:03 /var viename serveryje viršija 90 %Po 30 sek. ataskaitoje – 92 % – disko įspėjimai siunčiami akimirksniu, be laukimo serveris: vis dar veikia
02:14:03 Įspėjime įvardijamas diskas„/var – 92 %“ jau pirmoje eilutėje — Slack, el. paštas; o ne miglotas įspėjimas apie „diską“ serveris: vis dar veikia
02:29 Seni žurnalai išvalyti — vietos atsiradoKitoje agento ataskaitoje, po 30 sekundžių, /var jau rodo 62 % serveris: vis dar veikia
02:29:31 Išsisprendžia savaime — jums apie tai pranešamaPranešimas apie atsistatymą keliauja į tuos pačius kanalus, kurie kėlė pavojų serveris: taip ir neužgeso
15 minviršyta → išvalyta
Griūtis, kuri taip ir neįvyko.02:29:31
Pilnas /var paguldo visą serverį — duomenų bazes, žurnalus, svetaines, viską. Šįkart aukščiausias taškas buvo 92 %, nes įspėjimas atėjo, kol dar buvo laiko sureaguoti.
tikslus prijungimo taškas + reikšmėiš karto, kiekvienam taškuipranešimas, kai atsistatoCPU · RAM · apkrova · diskas — kas 30 s
O be agento? Prisipildantis diskas neduoda jokių ženklų iki pat 100 % — tada iš karto griūva viskas, kas veikia serveryje. Kilimas, prasidėjęs 2 val. nakties, pastebimas tik 7 val. ryto, o tarp jų — penkios prarastos valandos. negyvas serveris

17 rodiklių, vienas bash agentas

Vienas bash agentas kas 30 sekundžių atsiunčia 17 rodiklių — jau sudėtų į grafikus, todėl serverio būklę matote prie jo neprisijungę.

CPU ir apkrovaNaudojimas ir 1·5·15 min. vidutinė apkrova
Atmintis ir swapUžimta, laisva — ir swap
Disko % — pagal taškąVisi prijungimo taškai, ne tik /
Inode naudojimasPrisipildė smulkių failų? Sužinosite
17 rodikliai · 30 s nuskaityta iš pačios sistemos · nereikia prisijungti
Procesai ir branduoliaiSkaičius stebimas, branduoliai žinomi
Tinklas: įeinantis / išeinantisPralaidumas abiem kryptimis
Sistema ir pulsasBranduolys, OS, veikimo laikas — ir gyvas pulsas
Įspėjimai siunčiami dėl užsitęsusių viršijimų, o ne dėl akimirkos šuolių: CPU, atmintis, apkrova, swap, diskas ir inode kiekvienam prijungimo taškui, procesų skaičius, tinklo pralaidumas — ir garsiausias iš visų: serveris nutilo. tyla = įspėjimas

Įspėjimai ir istorija

Be netikrų pavojaus signalų 3 val. nakties

Budėtojas kviečiamas dėl tikrų problemų, ne trumpų šuolių

Uptimia siunčia CPU, atminties, swap, apkrovos, procesų skaičiaus ar tinklo įspėjimą tik tada, kai kiekvienas matavimas jūsų pasirinktu laikotarpiu lieka virš slenksčio — dviejų sekundžių šuolis praeina tyliai, o užsitęsusi problema — ne.

  • Patys nusprendžiate, kiek problema turi trukti — nuo 1 minutės iki pusvalandžio, atskirai kiekvienam rodikliui
  • Pradžiai nieko nustatinėti nereikia — CPU, atmintis ir diskas stebimi nuo pirmos ataskaitos; kitus įjungsite tada, kai prireiks
  • Diskas ir inode yra išimtis — jie suveikia tą pačią akimirką, kai prijungimo taškas viršija ribą; pilnas diskas laukti negali
Kur atkeliauja jūsų įspėjimai
CPU02:05:0030 sekundžių matavimas94%
CPU02:07:3030 sekundžių matavimas96%
CPU02:10:0030 sekundžių matavimas93%
10/10matavimai
virš 90 %
CPU įspėjimas — užsitęsęs02:10:01
Visi matavimai 5 minutes iš eilės viršijo 90 % — tikra problema, o ne šuolis, kuris pats praėjo.
SlackEl. paštasSMS+ PagerDuty…
Dviejų sekundžių šuolis? Vienas pavienis matavimas neišsilaiko per visą laikotarpį — jis praeina tyliai. Iš karto suveikia tik diskas ir inode. be įspėjimo
Diskas pagal prijungimo taškus

Iš karto matote, kuris būtent diskas prisipildė

Uptimia disko vietos ir inode įspėjimus sieja su kiekvienu prijungimo tašku, todėl incidente nurodyta /var, o ne visa mašina, kurioje reikėtų ieškoti. Incidentas kiekvienam taškui sukuriamas ir užveriamas atskirai.

  • Vienas incidentas kiekvienam taškui — /, /var ir /data sekami ir sprendžiami atskirai
  • Įspėjime — ir taškas, ir reikšmė — „Disko naudojimas viršija 90 % prijungimo taške /var“, o iš tikrųjų 92 %
  • Atskiros ribos kiekvienam taškui — labiau apkrautam taškui, tokiam kaip /var, galite taikyti griežtesnį procentą nei kitiems
Jei niekas nepatvirtina įspėjimo
agentasweb-01.caldmont.comsiunčia kas 30 s
/rootatskira incidentų eiga61%
Disko įspėjimas — /var02:14:09
Disko naudojimas prijungimo taške /var viršija 90 % — iš tikrųjų 92 %. Iš karto, be laukimo; atskiras incidentas, o /data lieka žalias.
pagal taškusiš kartoir inode
/dataduomenų skirsnisatskira incidentų eiga38%
/var apkrautas labiau nei kiti? Atskiri slenksčiai leidžia vienam taškui taikyti griežtesnį slenkstį nei visai mašinai. /var → 85%
Nutilusio serverio aptikimas

Trys praleistos ataskaitos atidaro incidentą

Jei serveris visiškai nutyla — dėl branduolio klaidos, elektros ar tinklo gedimo — kas minutę vykdoma atskira patikra pastebi trūkstamas ataskaitas ir atidaro kritinį incidentą. Negyvas serveris nebepasislėps už tylos — tyla savaime dar nereiškia, kad viskas gerai.

  • Serveris pažymimas neveikiančiu po 3 neatsiųstų ataskaitų — 90 sekundžių tylos, kai ataskaitos siunčiamos kas 30 sekundžių
  • Išsisprendžia automatiškai, kai agentas vėl atsiliepia — incidentas užsidaromas tą pačią akimirką
  • Diegiant klaidingai „neveikia“ nerodoma — naujas serveris, laukiantis pirmos ataskaitos, niekada nepažymimas
Patikros iš išorės: ping ir TCP prievadas
1
Ataskaita neatėjo
02:40:30 · laukiama kas 30 s
laukiama
2
Vis dar tyli
02:41:00 · antra praleista
laukiama
3
Patvirtinta: neveikia
02:41:30 · ~90 s tylos
kritinis
Serveris neveikia02:41:30
web-03 visiškai užgeso — branduolio klaida, elektra ar tinklas. Incidentas išsisprendžia tą pačią akimirką, kai agentas vėl atsiunčia ataskaitą.
SlackEl. paštasSMS+ PagerDuty…
Ką tik įdiegėte agentą? Visiškai naujas serveris, laukiantis pirmos ataskaitos, niekada nebus pažymėtas kaip Neveikia. jokio netikro pavojaus
Istorija ir tendencijos

Metų istorija — su visais šuoliais

Gyvi skaičiai rodo, kas negerai dabar; tendencijos rodo, kad tai vyksta jau kelias savaites. Uptimia turi abu: 6 rodiklių korteles ir 5 grafikus, paremtus tais pačiais duomenimis kaip ir įspėjimai.

  • 6 rodiklių kortelės + 5 laiko eilučių grafikai — CPU, apkrova, atmintis, diskas, tinklas — atnaujinama kas 30 sekundžių
  • Neapdoroti 30 sekundžių duomenys 24 valandas — toliau valandiniai vidurkiai ir maksimumai, kad neprarastumėte šuolių, ištisus metus
  • Grafikai patys pasirenka šaltinį — priartinkite paskutinę valandą ar paskutinius metus, ir duomenys persijungia automatiškai
Gaukite šiuos skaičius el. paštu pagal tvarkaraštį
TENDENCIJANaudojama atmintis — web-01
paskutinės 30 dienų · valandiniai duomenys · atnaujinama kas 30 s
30 d ago15 dnow
Nuo 40 % iki 70 % per mėnesį — tokios problemos akimirkos vaizdas neparodys.
Neapdorota · kas 30 sekundžių
kiekvienas matavimas, saugomas 24 val.
02:10:00 → cpu 93% · mem 71%
Valandinis vidurkis · 1 metai
tendencijos linija — glotni,
galima lyginti mėnesį su mėnesiu
Valandinis maksimumas · 1 metai
šuoliai išlieka net apibendrinus duomenis —
2 minučių protrūkis matomas ir po metų
Priartinkite bet kurį laikotarpį — paskutinė valanda rodo neapdorotus 30 sekundžių duomenis, paskutiniai metai — valandinius; grafikai šaltinį persijungia patys. automatiškai

Ataskaitos — greičiau nei per minutę

Diegiama viena eilute – be paketų, be vykdymo aplinkos, o vienas skriptas pašalina visus pėdsakus.

1 žingsnis30 s

Paleiskite diegimo eilutę kaip root

Diegimo eilutė įrašo nedidelį bash skriptą į /opt/uptimia ir užregistruoja systemd laikmatį — arba cron, jei systemd nėra.

$ curl -s uptimia.com/server-agent/install.sh | bash -s -- KEY
# ✓ systemd timer uptimia-agent.timer created
2 žingsnis30 s

Agentas pradeda siųsti ataskaitas

Kas 30 sekundžių jis siunčia 17 rodiklių — CPU, atmintį, diską, apkrovą ir kitus — autentifikuotus unikaliu kiekvieno serverio raktu.

Agento būsena
Prisijungęs — siunčia kas 30 s
gauta pirmoji ataskaita · 17 rodiklių
Serveris
web-01 · Ubuntu 22.04 · 4 cores
3 žingsnisautomatiškai

Nustatykite slenksčius ir gaukite įspėjimus

CPU, atminties ir disko slenkstis iš pradžių — 90 %. Viršijus jį, sukuriamas incidentas ir įspėjama komanda jai įprastais kanalais.

#infra-alerts
Uptimia 02:14
⚠ Diskas — /var 92 % serveryje web-01
virš 90 %incidentas atskiram taškui02:14:03
Taip pat siunčiama į El. paštasPagerDuty

Paleiskite vieną bash eilutę.Sužinokite, kol diskas dar neprisipildė.

Visi serveriai, visi rodikliai, visi įspėjimų kanalai — nemokamai 30 dienų, be jokių papildomų mokesčių.

Išbandykite nemokamai 30 dienų
30 dienų nemokamai be kreditinės kortelės atšaukite bet kada

Taip pat įskaičiuota

Įspėjimai tais kanalais, kuriais jau naudojatės

Serverių įspėjimai naudoja tą patį kontaktų sąrašą kaip ir visi kiti stebėjimo objektai — el. paštas, SMS, Slack, Microsoft Teams, Discord, Mattermost, Telegram, WhatsApp, PagerDuty, Twilio, Statuspage ir pasirinktiniai webhook adresai.

El. paštasSlackTeamsPagerDutyTelegramWebhook+ daugiau

Techninės priežiūros režimas

Atnaujinkite ar perkraukite serverį be įspėjimų lavinos — visi įspėjimai nutildomi, o rodikliai toliau renkami.

perkrovimo laikotarpis · įspėjimai nutildyti

Atsistatymo pranešimai

Sužinosite ne tik kada prasidėjo, bet ir kada baigėsi — apie kiekvieną atsistatymą gausite pranešimą.

✓ atsistatė · atmintis vėl 58 %

Istorija išlieka ir sumažinus planą

Sumažinus planą serverio rodikliai neišnyksta — nutyla tik įspėjimai. Padidinus planą sustabdyti serveriai atsigauna patys.

duomenys renkami toliau · įspėjimai pristabdyti

Viskas viename valdymo skydelyje

Serveriai matomi šalia svetainių veikimo, SSL, veikimo signalų ir DNS stebėjimo objektų: tie patys kontaktai, grupės ir vaidmenys, viskas vienoje vietoje.

web-01.caldmont.comSERVERIS www.caldmont.comVEIKIMO LAIKAS db-backup · nightlyVEIKIMO SIGNALAS

Pašalinama viena eilute

Vienas skriptas visiškai pašalina systemd vienetą ir /opt/uptimia — jokių likučių.

$ curl -fsS uptimia.com/server-agent/uninstall.sh | bash

Kas yra serverių stebėjimas?

Serverių stebėjimas — tai nuolatinis serverio būklės sekimas: CPU, atmintis, diskas, apkrova, tinklas ir procesai, kad iš karto sužinotumėte, jei pritrūksta išteklių arba serveris nustoja veikti. „Uptimia“ Linux serverius stebi nedideliu agentu, kuris kas 30 sekundžių atsiunčia 17 rodiklių ir užregistruoja incidentą, kai rodiklis viršija nustatytą slenkstį.

Agentas

Kaip veikia agentas?

Jūsų Linux serveris
skaito /proc · df
~17 rodiklių · kas 30 s
Uptimia
grafikai + įspėjimai

Bash skriptas, paleidžiamas systemd laikmačiu, siunčia vieną nedidelę ataskaitą, patvirtintą unikaliu kiekvieno serverio raktu — reikia tik bash ir curl.

Įspėjimų logika

Užsitęsę ir momentiniai įspėjimai

CPU · apkrova · atmintis
viršyta visą laikotarpį
tada įspėjimas
Diskas · inode
įspėja iš karto

šuolis praeina tyliai — įspėjimas siunčiamas tik dėl užsitęsusio viršijimo; pilnas prijungimo taškas laukti negali, todėl diskas suveikia iš karto

Svarbiausi rodikliai

Kuriuos serverio rodiklius verta stebėti?

Ženklai, pagal kuriuos atpažįstami artėjantys incidentai, ir kaip juos seka „Uptimia“. CPU, atmintis ir diskas stebimi nuo pat pirmos ataskaitos; likusius įjungiate patys.

Visi stebėjimo tipai vienoje paskyroje
RodiklisNumatytasis slenkstisKaip Uptimia įspėja
CPU naudojimas90%nuolatinis · 5 min. intervalas
Atmintis90%nuolatinis · 5 min. intervalas
Diskas · pagal tašką90%iš karto, kiekvienam taškui
Vidutinė apkrovaiš pradžių išjungtaužsitęsęs · laikotarpis
Swapiš pradžių išjungtaužsitęsęs · laikotarpis
Procesų skaičiusiš pradžių išjungtaužsitęsęs · laikotarpis
Tinklo pralaidumasiš pradžių išjungtaužsitęsęs · laikotarpis
Serveris neveikia3 neatsiųstos ataskaitoskritinis · ~90 s

Dažni klausimai apie serverių stebėjimą

01Kas yra serverių stebėjimas?+
Nuolatinis serverio būklės — CPU, atminties, disko, apkrovos, tinklo ir procesų — sekimas, kad gautumėte įspėjimą, kai ima trūkti išteklių arba mašina nustoja veikti. Nedidelis Uptimia agentas kas 30 sekundžių atsiunčia 17 rodiklių ir atidaro incidentą, kai rodiklis viršija nustatytą slenkstį.
02Kaip veikia Uptimia serverių stebėjimas?+
Viena diegimo eilutė įdiegia serveryje nedidelį bash skriptą ir užregistruoja systemd laikmatį (arba cron). Kas 30 sekundžių jis nuskaito /proc ir df bei išsiunčia 17 rodiklių — CPU, atmintį, swap, disko užimtumą pagal prijungimo tašką, inode, apkrovą, tinklą, procesų skaičių ir OS duomenis — autentifikuotus unikaliu serverio raktu. Gaunate 6 rodiklių korteles, 5 laiko eilučių grafikus ir slenksčių įspėjimus — tokį stebėjimą ir įspėjimus užtikrina vienas mažas agentas.
03Kokias operacines sistemas palaiko agentas?+
Vienos eilutės diegimo komanda skirta Linux sistemoms — agentas skaito /proc ir df, todėl veikia įprastose Linux distribucijose (Ubuntu, Debian, RHEL, Alma ir panašiose). Taip pat yra macOS ir Windows PowerShell agentai, siunčiantys tuos pačius rodiklius, tačiau juos reikia įdiegti rankiniu būdu (macOS – per launchd, Windows – per Scheduled Task), o ne vienu diegimo scenarijumi. BSD agento nėra — tokiems serveriams naudokite Uptimia patikras iš išorės (ping, TCP prievadas, HTTP).
04Ar galiu pakeisti, kaip dažnai agentas atsiskaito?+
Ne — 30 sekundžių dažnis yra fiksuotas. Jūs valdote įspėjimus: kiekvieno rodiklio slenkstį ir tai, kiek problema turi trukti, kad kas nors būtų iškviestas.
05Ar trumpas CPU šuolis pažadins mane 3 val. nakties?+
Ne. CPU, atminties, swap, apkrovos, procesų skaičiaus ir tinklo įspėjimai suveikia tik tada, kai kiekvienas rodmuo per stebėjimo laikotarpį (numatytasis – 5 min.) išlieka virš slenksčio, o trumpas šuolis lieka nepastebėtas. Išimtis – diskas ir inode'ai: jie suveikia iškart, nes pilnas diskas laukti negali.
06Per kiek laiko sužinosiu, kad serveris nebeveikia?+
Jei serveris visiškai nustoja siųsti duomenis, kas minutę atliekama patikra po 3 praleistų ataskaitų (90 sekundžių tylos) pažymi jį kaip neveikiantį ir užregistruoja kritinį incidentą, kuris automatiškai išsisprendžia, kai agentas vėl prisijungia. Trys praleistos ataskaitos patvirtina, kad serveris tikrai nebeveikia, o naujas serveris, dar laukiantis pirmos ataskaitos, klaidingai nepažymimas.
07Ar agentas skaito mano žurnalus ar vykdo komandas?+
Ne. Tai tik serverio išteklių stebėjimas — perduodami CPU, atminties, disko, tinklo, apkrovos, veikimo laiko, procesų skaičiaus bei pagrindiniai OS, branduolio ir serverio vardo duomenys. Jokių žurnalų, jokio failų turinio, jokių nuotolinių komandų — tik vienkryptė skaičių ataskaita.
08Kiek laiko saugoma rodiklių istorija?+
Neapdoroti 30 sekundžių matavimai saugomi 24 valandas. Vėliau Uptimia saugo valandinius vidurkius ir maksimumus — šuoliai matomi maksimumuose — ištisus metus. Grafikai automatiškai perjungia duomenų šaltinį pagal pasirinktą laikotarpį.
09Ar galiu stebėti Docker ar Kubernetes konteinerius?+
Agentas renka viso serverio lygio rodiklius — visos mašinos /proc ir df, o ne atskirų konteinerių statistiką. Tinka serveriams, kuriuose veikia jūsų konteineriai; konteinerių lygio duomenų rinkimo kol kas nėra.
10Ar serverių stebėjimas yra mokamas priedas?+
Ne. Serverių stebėjimas įeina į kiekvieną mokamą planą kartu su svetainių veikimo, SSL, operacijų, DNS ir veikimo signalų stebėjimu — niekada kaip mokamas priedas. Planai skiriasi tik serverių skaičiumi. Nemokamame plane serverių stebėjimo nėra; 30 dienų bandomajame periode jis yra (iki 50 serverių), kreditinės kortelės nereikia.

Pradėkite stebėti savo serverius jau šiandien.

Paleiskite vieną bash eilutę – ir apie pildomą diską, įkaitusį CPU ar užgesusią mašiną sužinosite dar turėdami laiko sureaguoti.

30 dienų nemokamas bandymas Be kreditinės kortelės Bash + curl · pašalinimas viena eilute
Serverių stebėjimas įtrauktas į 30 dienų bandomąjį laikotarpį ir visus mokamus planus – kaip ir visi kiti stebėjimo tipai.