1. 程式人生 > >shell指令碼監控系統負載、CPU和記憶體使用情況

shell指令碼監控系統負載、CPU和記憶體使用情況

在沒有nagios監控軟體的情況下,只要伺服器能上網際網路,就可通過發郵件的方式來提醒管理員系統負載與CPU佔用的使用情況。

一、安裝linux下面的一個郵件客戶端msmtp軟體(類似於一個foxmail的工具)

 1、下載安裝:
 http://downloads.sourceforge.net/msmtp/msmtp-1.4.16.tar.bz2?modtime=1217206451&big_mirror=0 

複製程式碼程式碼如下:
# tar jxvf msmtp-1.4.16.tar.bz2
# cd msmtp-1.4.16
# ./configure --prefix=/usr/local/msmtp
# make && make install

 2、建立msmtp配置檔案和日誌檔案(host為郵件域名,郵件使用者名稱fuquanjun,密碼fuquanjun)

複製程式碼程式碼如下:
# vim /root/.msmtprc

account default  
host xxxxx.com  
from [email protected]  
auth login  
user fuquanjun 
password fuquanjun 
logfile ~/.msmtp.log
 # chmod 600  /root/.msmtprc
 # touch ~/.msmtp.log

3、mutt安裝配置:(一般linux下有預設安裝mutt)

如果沒有安裝,則使用yum安裝

複製程式碼程式碼如下:
yum -y install mutt
# vim /root/.muttrc
set sendmail="/usr/local/msmtp/bin/msmtp" 
set use_from=yes 
set realname="moniter"   
set
[email protected]
  
set envelope_from=yes 
set rfc2047_parameters=yes 
set charset="utf-8

4、郵件傳送測試(-s郵件標題,-a表加附件)

複製程式碼程式碼如下:
 # echo "郵件內容123456" | mutt -s "郵件標題測試郵件" -a /scripts/test.txt  [email protected]

出現下面報錯資訊:
複製程式碼程式碼如下:
msmtp: account default not found: no configuration file available

傳送信件出錯,子程序已退出 78 ()。
無法傳送此信件。
解決方法:

單獨使用msmtp傳送測試:/usr/local/msmtp/bin/msmtp -S  發現是配置檔案沒找到

複製程式碼程式碼如下:
msmtp: account default not found: no configuration file available

檢視當前的配置檔案路徑:/usr/local/msmtp/bin/msmtp -P
複製程式碼程式碼如下:
ignoring system configuration file/work/target/etc/msmtprc: No such file or directory
ignoring user configuration file /root/.msmtprc: No such file ordirectory
falling back to default account
msmtp: account default not found: no configuration file available

故將/usr/local/etc/msmtprc  複製為/root/.msmtprc
檢視一下mutt檔案安裝目錄情況
複製程式碼程式碼如下:
rpm -ql mutt

故將/etc/Muttrc  複製為/root/.muttrc即可傳送郵件。

二、監控伺服器系統負載情況:

1、用uptime命令檢視當前負載情況(1分鐘,5分鐘,15分鐘平均負載情況)在蘋果公司的Mac電腦上也適用

複製程式碼程式碼如下:
# uptime
   15:43:59 up 186 days, 20:04,  1 user,  load average:  0.01,    0.02,   0.00

"load average"意思分別是1分鐘、5分鐘、15分鐘內系統的平均負荷。
(1) 主要觀察"15分鐘系統負荷",將它作為電腦正常執行的指標。
(2) 如果15分鐘內,(系統負荷除以CPU核心數目之後的)平均負荷大於1.0,表明問題持續存在,不是暫時現象。
(3) 當系統負荷持續大於0.7,你必須開始調查了,問題出在哪裡,防止情況惡化。
(4) 當系統負荷持續大於1.0,你必須動手尋找解決辦法,把這個值降下來。
(5) 當系統負荷達到5.0,就表明你的系統有很嚴重的問題,長時間沒有響應,或者接近宕機了。
假設你的電腦只有1個CPU。如果你的電腦裝了2個CPU,意味著電腦的處理能力翻了一倍,能夠同時處理的程序數量也翻了一倍。
2個CPU表明系統負荷可以達到2.0,此時每個CPU都達到100%的工作量。推廣開來,n個CPU的電腦,可接受的系統負荷最大為n.0。

2、檢視伺服器cpu的總核數

複製程式碼程式碼如下:
 # grep -c 'model name' /proc/cpuinfo  或者       cat /proc/cpuinfo

3、擷取伺服器1分鐘、5分鐘、15分鐘的負載情況
複製程式碼程式碼如下:
# uptime | awk '{print $8,$9,$10,$11,$12}'
   load average:  0.01,    0.02,   0.00

4、檢視擷取15分鐘的平均負載

複製程式碼程式碼如下:
# uptime | awk '{print $12}' (用 '{print $12}' 這個獲取的不夠準確,如果都用awk取第12個欄位的話,結果有可能為空了。而用$NF表輸出最後一段的內容)
# uptime | awk '{print $NF}'

5、編寫系統負載監控的指令碼檔案:
複製程式碼程式碼如下:
# vim /scripts/load-check.sh
[code]
#!/bin/bash  
#使用uptime命令監控linux系統負載變化  
  
#取系統當前時間(以追加的方式寫入檔案>>)  
date >> /scripts/datetime-load.txt     
  
#提取伺服器1分鐘、5分鐘、15分鐘的負載情況  
uptime | awk '{print $8,$9,$10,$11,$12}' >> /scripts/load.txt  
  
#逐行連線上面的時間和負載相關行資料(每次重新寫入檔案>)  
paste  /scripts/datetime-load.txt /scripts/load.txt   > /scripts/load_day.txt
# chmod a+x /scripts/load-check.sh

6、編寫系統負載結果檔案郵件傳送指令碼:

複製程式碼程式碼如下:
# vim /scripts/sendmail-load.sh

#!/bin/bash  
#把系統負載監控生成的load_day.txt檔案通過郵件傳送給使用者  
  
#提取本伺服器的IP地址資訊  
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`  
  
#提取當前日期  
today=`date -d "0 day" +%Y年%m月%d日`  
  
#傳送系統負載監控結果郵件  
echo "這是$IP伺服器$today的系統負載監控報告,請下載附件。" | mutt -s "$IP伺服器$today的系統負載監控報告" -a /scripts/load_day.txt  [email protected]
# chmod a+x /scripts/sendmail-load.sh

7、編寫系統負載監控的指令碼檔案:

複製程式碼程式碼如下:
# vim /scripts/load-warning.sh

#!/bin/bash  
#使用uptime命令監控linux系統負載變化  
  
#提取本伺服器的IP地址資訊  
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`  
  
#抓取cpu的總核數  
cpu_num=`grep -c 'model name' /proc/cpuinfo`  
  
#抓取當前系統15分鐘的平均負載值  
load_15=`uptime | awk '{print $NF}'`  
  
#計算當前系統單個核心15分鐘的平均負載值,結果小於1.0時前面個位數補0。  
average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc`  
 
#取上面平均負載值的個位整數  
average_int=`echo $average_load | cut -f 1 -d "."`  
  
#設定系統單個核心15分鐘的平均負載的告警值為0.70(即使用超過70%的時候告警)。  
load_warn=0.70  
  
#當單個核心15分鐘的平均負載值大於等於1.0(即個位整數大於0) ,直接發郵件告警;如果小於1.0則進行二次比較  
if (($average_int > 0)); then  
      echo "$IP伺服器15分鐘的系統平均負載為$average_load,超過警戒值1.0,請立即處理!!!" | mutt -s "$IP 伺服器系統負載嚴重告警!!!"  [email protected]  
else  
#當前系統15分鐘平均負載值與告警值進行比較(當大於告警值0.70時會返回1,小於時會返回0 )  
load_now=`expr $average_load \> $load_warn`  
  
#如果系統單個核心15分鐘的平均負載值大於告警值0.70(返回值為1),則發郵件給管理員  
 if (($load_now == 1)); then  
    echo "$IP伺服器15分鐘的系統平均負載達到 $average_load,超過警戒值0.70,請及時處理。" | mutt -s "$IP 伺服器系統負載告警"  [email protected]  
 fi  
fi
 # chmod a+x /scripts/load-warning.sh

三、監控伺服器系統cpu佔用情況:

1、使用top命令檢視linux系統cpu使用情況:

複製程式碼程式碼如下:
#  top -b -n 1 | grep Cpu   (-b -n 1 表只需要1次的輸出結果)
     Cpu(s):  0.0%us,  0.0%sy,  0.0%ni, 99.9%id,  0.0%wa,  0.0%hi,  0.0%si,  0.0%st

2、檢視擷取空閒cpu的百分比數值命令(只取整數部分):
複製程式碼程式碼如下:
# top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."

3、編寫cpu監控的指令碼檔案:
複製程式碼程式碼如下:
# vim /scripts/cpu-check.sh

#!/bin/bash  
#使用top命令監控linux系統cpu變化  
  
#取系統當前時間(以追加的方式寫入檔案>>)  
date >> /scripts/datetime-cpu.txt     
  
#抓取當前cpu的值(以追加的方式寫入檔案>>)  
top -b -n 1 | grep Cpu  >> /scripts/cpu-now.txt   
  
#逐行連線上面的時間和cpu相關行資料(每次重新寫入檔案>)  
paste  /scripts/datetime-cpu.txt   /scripts/cpu-now.txt  > /scripts/cpu.txt
# chmod a+x /scripts/cpu-check.sh

4、檢視CPU監控的結果檔案:

複製程式碼程式碼如下:
# cat /scripts/cpu.txt

5、編寫cpu結果檔案郵件傳送指令碼:
複製程式碼程式碼如下:
# vim /scripts/sendmail-cpu.sh
#!/bin/bash  
#把生成的cpu.txt檔案通過郵件傳送給使用者  
  
#提取本伺服器的IP地址資訊  
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`  
  
#提取當前日期 
today=`date -d "0 day" +%Y年%m月%d日`  
  
#傳送cpu監控結果郵件  
echo "這是$IP伺服器$today的cpu監控報告,請下載附件。" | mutt -s "$IP伺服器$today的CPU監控報告" -a /scripts/cpu.txt  [email protected]
 # chmod a+x /scripts/sendmail-cpu.sh
 

四、監控系統cpu的情況,當使用超過80%的時候發告警郵件:

複製程式碼程式碼如下:
# vim /scripts/cpu-warning.sh
#!/bin/bash  
#監控系統cpu的情況指令碼程式  
  
#提取本伺服器的IP地址資訊  
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`  
  
#取當前空閒cpu百份比值(只取整數部分)  
cpu_idle=`top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."`  
  
#設定空閒cpu的告警值為20%,如果當前cpu使用超過80%(即剩餘小於20%),立即發郵件告警  
if (($cpu_idle < 20)); then  
      echo "$IP伺服器cpu剩餘$cpu_idle%,使用率已經超過80%,請及時處理。" | mutt -s "$IP 伺服器CPU告警"  [email protected]  
fi
# chmod a+x /scripts/cpu-warning.sh

五、使用free命令監控系統記憶體:

1、使用free命令檢視linux系統記憶體使用情況:(以M為單位)

複製程式碼程式碼如下:
# free -m  
             total       used       free     shared    buffers     cached
Mem:          3952       3414        538          0        168        484
-/+ buffers/cache:       2760       1191
Swap:         8191         86       8105

2、檢視擷取剩餘記憶體free的數值命令:

(1) 實體記憶體free值: # free -m | grep Mem | awk '{print $4}'
(2) 緩衝區的free值: # free -m | grep - | awk '{print $4}'
(3) Swap分割槽free值: # free -m | grep Swap | awk '{print $4}'

3、編寫記憶體監控的指令碼檔案:

複製程式碼程式碼如下:
# vim /scripts/free-mem.sh
#!/bin/bash  
#使用free命令監控linux系統記憶體變化  
  
#取系統當前時間(以追加的方式寫入檔案>>)  
date >> /scripts/date-time.txt     
  
#抓取實體記憶體free值(以追加的方式寫入檔案>>)  
echo Mem-free: `free -m | grep Mem | awk '{print $4}'`M >> /scripts/mem-free.txt   
  
#抓取緩衝區的free值(以追加的方式寫入檔案>>)  
echo buffers/cache-free: `free -m | grep - | awk '{print $4}'`M  >> /scripts/buffers-free.txt  
  
#抓取Swap分割槽free值(以追加的方式寫入檔案>>)  
echo Swap-free: `free -m | grep Swap | awk '{print $4}'`M  >> /scripts/swap-free.txt  
  
#逐行連線上面的時間和記憶體相關行資料(每次重新寫入檔案>)  
paste  /scripts/date-time.txt /scripts/mem-free.txt  /scripts/buffers-free.txt   /scripts/swap-free.txt   > /scripts/freemem.txt
# chmod a+x /scripts/free-mem.sh

4、檢視記憶體監控的結果檔案:
複製程式碼程式碼如下:
# cat /scripts/freemem.txt

5、編寫free結果檔案郵件傳送指令碼:
複製程式碼程式碼如下:
# vim /scripts/sendmail-mem.sh
#!/bin/bash  
#把生成的freemem.txt檔案通過郵件傳送給使用者  
  
#提取本伺服器的IP地址資訊  
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`  
  
#提取當前日期時間  
today=`date -d "0 day" +%Y年%m月%d日`  
  
#傳送記憶體監控結果郵件  
echo "這是$IP伺服器$today的記憶體監控報告,請下載附件。" | mutt -s "$IP伺服器$today記憶體監控報告" -a /scripts/freemem.txt [email protected]
# chmod a+x /scripts/sendmail-mem.sh

六、監控系統交換分割槽swap的情況,當使用超過80%的時候發告警郵件:

複製程式碼程式碼如下:
# vim /scripts/swap-warning.sh
#!/bin/bash  
  
#提取本伺服器的IP地址資訊  
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`  
  
#系統分配的交換分割槽總量  
swap_total=`free -m | grep Swap | awk '{print  $2}'`  
  
#當前剩餘的交換分割槽free大小  
swap_free=`free -m | grep Swap | awk '{print  $4}'`  
  
#當前已使用的交換分割槽used大小  
swap_used=`free -m | grep Swap | awk '{print  $3}'`  
  
  
if (($swap_used != 0)); then  
  
#如果交換分割槽已被使用,則計算當前剩餘交換分割槽free所佔總量的百分比,用小數來表示,要在小數點前面補一個整數位0  
   swap_per=0`echo "scale=2;$swap_free/$swap_total" | bc`  
  
#設定交換分割槽的告警值為20%(即使用超過80%的時候告警)。  
   swap_warn=0.20  
  
#當前剩餘交換分割槽百分比與告警值進行比較(當大於告警值(即剩餘20%以上)時會返回1,小於(即剩餘不足20%)時會返回0 )  
   swap_now=`expr $swap_per \> $swap_warn`  
  
#如果當前交換分割槽使用超過80%(即剩餘小於20%,上面的返回值等於0),立即發郵件告警  
  if (($swap_now == 0)); then  
    echo "$IP伺服器swap交換分割槽只剩下 $swap_free M 未使用,剩餘不足20%,使用率已經超過80%,請及時處理。" | mutt -s "$IP 伺服器記憶體告警"  [email protected]  
  fi  
fi
# chmod a+x /scripts/swap-warning.sh

七、加入任務計劃:系統負載與CPU佔用率每十分鐘檢測一次,有告警則立即發郵件(十分鐘發一次),負載與CPU檢測結果郵件每天早上8點發一次。

複製程式碼程式碼如下: # crontab -e
*/10 * * * *  /scripts/load-check.sh > /dev/null 2>&1
*/10 * * * *  /scripts/load-warning.sh  
0 8 * * *  /scripts/sendmail-load.sh  
  
*/10 * * * *  /scripts/cpu-check.sh  
*/10 * * * *  /scripts/cpu-warning.sh  
0 8 * * *  /scripts/sendmail-cpu.sh
 
*/10 * * * *  /scripts/free-mem.sh  
*/10 * * * *  /scripts/swap-warning.sh  
0 8 * * *  /scripts/sendmail-mem.sh
# service crond restart

相關推薦

shell指令碼監控系統負載CPU記憶體使用情況

在沒有nagios監控軟體的情況下,只要伺服器能上網際網路,就可通過發郵件的方式來提醒管理員系統負載與CPU佔用的使用情況。 一、安裝linux下面的一個郵件客戶端msmtp軟體(類似於一個foxmail的工具)  1、下載安裝:  http://download

shell 指令碼監控系統記憶體佔用率主備機等

執行結果 shell 指令碼實現 #!/bin/sh ########################################################## #作者:LINU_BW #時間:2016-10-28 #功能:監控伺服器系統IP cpu 記憶體 磁碟 主備&nb

Shell指令碼監控系統情況併發送郵件

在沒有監控軟體的情況下,只要伺服器能上網際網路,就可通過發郵件的方式來提醒管理員系統負載與CPU佔用的使用情況。 一、安裝linux下面的一個郵件客戶端msmtp軟體(類似於一個foxmail的工具)  1、下載安裝:  http://downloads.sourceforg

Shell指令碼監控CPU記憶體硬碟利用率

轉:http://blog.51cto.com/lizhenliang/1610415 1、監控CPU利用率(通過vmstat工具)      #!/bin/bash #==================================================== # Author: lizh

利用shell指令碼監控linux中CPU記憶體磁碟利用率。(centos7)

  這篇部落格中所寫的,在實際工作中並沒有什麼卵用,工作中並不會用到這種指令碼去監控。不過自己寫一遍,可以讓初學者對CPU、記憶體、磁碟等一些基礎知識和基礎命令更加了解。 1、利用vmstat工具監控CPU詳細資訊,然後基於/proc/stat計算CPU利用率進行監控,超過80報警並提取出佔用cpu最高的前十

shell指令碼採集系統cpu記憶體磁碟網路資訊

有不少朋友不知道如何用shell指令碼採集linux系統相關資訊,包括cpu、記憶體、磁碟、網路等資訊,這裡指令碼小編做下講解,大家一起來看看吧。 一、cpu資訊採集 1),採集cpu使用率 採集演算法:通過/proc/stat檔案採集並計算CPU總使用率或者單個核使

Shell指令碼監控拉起NimbusSupervisor程序

Nimbus和Supervisor都是快速失敗,無狀態的程序,Nimbus的單點問題一直沒有很好的解決辦法,所以我們可以對相關程序進行監控,在其掛掉時嘗試重啟。 在之前的專案裡,比較常用的方式是通過monit對相關程序進行監控,通過monit監控需要對每臺機器進行配置,可以

使用shell指令碼監控cpu,磁碟,記憶體

#!/bin/bash now=`date -u -d"+8 hour" +'%Y-%m-%d %H:%M:%S'` #cpu使用閾值 cpu_warn='75' #mem空閒閾值 mem_warn=

系統服務監控指標--loadCPU利用率磁碟剩餘空間磁碟I/O記憶體使用情況

## 介紹 大型網際網路企業的背後,依靠的是成千上萬臺伺服器日夜不停的運轉,以支撐其業務的運轉。宕機對於網際網路企業來說,代價是沉重的,輕則影響使用者體驗,重則直接影響交易,導致交易下跌,並且給企業聲譽造成不可挽回的損失。對於這些機器對應的開發和運維人員來說,即便是每臺機器登陸一次,登陸那麼多臺機器也夠嗆,

使用w查看系統負載vmstattopsarnload命令

打印 塊設備 取數據 text 服務 mar 等等 color 拷貝數據 1、w/uptime 查看系統負載 第一行從左面開始顯示的信息依次為:時間,系統運行時間,登錄用戶數,平均負載。第二行開始以及下面所有的行信息是,當前登錄的都有哪些用戶,以及他們是從哪裏登錄的等等。第

linux 系統ttyptypts 的概念及區別

發送 種類型 rtl mina com 文件 閱讀 遠程 好玩 linux 系統tty、pty和pts 的概念及區別 tty(終端設備的統稱):tty一詞源於Teletypes,或者teletypewriters,原來指的是電傳打字機,是通過串行線用打印機鍵盤通過閱讀和發

Linux日常運維管理技巧: w命令-查看系統負載vmstat命令top命令sar命令

Linux日常運維管理技巧 w命令:查看系統負載 w load average 單位時間內使用cpu活動的活動進程有多少個 查看系統cpu(邏輯cpu)數量 cat /proc/cpuinfo(當我們的進程在單位時間內活動數量不超過我們的系

二十九w查看系統負載vmstat命令top命令sar命令nload命令

w命令 vmstat命令 top命令 sar命令 nload命令 二十九、w查看系統負載、vmstat命令、top命令、sar命令、nload命令一、使用w查看系統負載 # w 06:10:09 up 6:20, 1 user, load average: 0.00, 0.01, 0

使用w查看系統負載vmstat命令top命令sar命令nload命令

Linux使用w查看系統負載 w或uptime查看系統負載w uptime 第一行分別是當前時間、啟動多長時間、目前登錄了幾個用戶、系統負載(load average後面有三段數字,分別表示1、5、15分鐘時間段內系統的負載值是多少)。 登錄的用戶可以從第三行開始看到,從第一列開始分別是用戶名、登錄

centos系統查看系統版本內核版本系統位數cpu個數核心數線程數

article 包括 smp details info 名稱 edt .com dom centos查看系統版本 cat /etc/redhat-release CentOS Linux release 7.2.1511 (Core) 1)查看centos內核的

Linux 磁碟分割槽,檔案系統建立掛載解除安裝

建立分割槽 (fdisk): 第一步先在Linux的虛擬機器上新增一塊硬碟,新增完成後需要重啟虛擬機器才能夠檢測識別到新硬碟。 重啟系統後可以使用 fdisk -l 命令檢視當前所有磁碟分割槽情況,sdb為我們剛剛建立的新磁碟,可以與上面的sda磁碟對比,發現新磁碟sdb還沒有分割槽。接下來就是為

阿里P9架構師談:高併發網站的監控系統選型比較核心監控指標

在高併發分散式環境下,對於訪問量大的業務、介面等,需要及時的監控網站的健康程度,防止網站出現訪問緩慢,甚至在特殊情況出現應用伺服器雪崩等場景,在高併發場景下網站無法正常訪問的情況,這些就會涉及到分散式監控系統,對於核心指標提前監控,防患於未然。 常見的開源監控系統 1.Zabbix Zabbix是一個基

阿裏P9架構師談:高並發網站的監控系統選型比較核心監控指標

type png 應用服務器 高並發 action 使用 管理 由器 ebe 在高並發分布式環境下,對於訪問量大的業務、接口等,需要及時的監控網站的健康程度,防止網站出現訪問緩慢,甚至在特殊情況出現應用服務器雪崩等場景,在高並發場景下網站無法正常訪問的情況,這些就會涉及到分

MYSQL "ORDER BY rand()"的坑--容易導致機器負載CPU佔用過高

在一次微信砍價活動營銷中,使用了4核16G10M頻寬的伺服器支撐業務,本來這個配置跑個PHP+MYSQL+nginx肯定輕輕鬆的事情,可是隨著活動的高潮,併發數一高,機器負載核CPU一下子就達到100% 始終找不到原因,只知道是mysql分配的記憶體不夠,一直給它加,但是重啟m

linux shell指令碼監控程序是否存在

用shell指令碼監控程序是否存在 不存在則啟動的例項,先上程式碼乾貨:    #!/bin/shps -fe|grep processString |grep -v grepif [ $? -ne 0 ]thenecho "start process....."elseecho