shell指令碼監控系統負載、CPU和記憶體使用情況

阿新 • • 發佈：2019-01-28

在沒有nagios監控軟體的情況下，只要伺服器能上網際網路，就可通過發郵件的方式來提醒管理員系統負載與CPU佔用的使用情況。

一、安裝linux下面的一個郵件客戶端msmtp軟體(類似於一個foxmail的工具)

1、下載安裝：
http://downloads.sourceforge.net/msmtp/msmtp-1.4.16.tar.bz2?modtime=1217206451&big_mirror=0

複製程式碼程式碼如下:
# tar jxvf msmtp-1.4.16.tar.bz2
# cd msmtp-1.4.16
# ./configure --prefix=/usr/local/msmtp
# make && make install

2、建立msmtp配置檔案和日誌檔案（host為郵件域名，郵件使用者名稱fuquanjun，密碼fuquanjun）

複製程式碼程式碼如下:
# vim /root/.msmtprc

account default
host xxxxx.com
from [email protected]
auth login
user fuquanjun
password fuquanjun
logfile ~/.msmtp.log
# chmod 600 /root/.msmtprc
# touch ~/.msmtp.log

3、mutt安裝配置：（一般linux下有預設安裝mutt）

如果沒有安裝，則使用yum安裝

複製程式碼程式碼如下:
yum -y install mutt
# vim /root/.muttrc
set sendmail="/usr/local/msmtp/bin/msmtp"
set use_from=yes
set realname="moniter"
set

[email protected]
set envelope_from=yes
set rfc2047_parameters=yes
set charset="utf-8

4、郵件傳送測試（-s郵件標題，-a表加附件）

複製程式碼程式碼如下:
# echo "郵件內容123456" | mutt -s "郵件標題測試郵件" -a /scripts/test.txt [email protected]

出現下面報錯資訊：
複製程式碼程式碼如下:
msmtp: account default not found: no configuration file available

傳送信件出錯，子程序已退出 78 ()。
無法傳送此信件。
解決方法：

單獨使用msmtp傳送測試：/usr/local/msmtp/bin/msmtp -S 發現是配置檔案沒找到

複製程式碼程式碼如下:
msmtp: account default not found: no configuration file available

檢視當前的配置檔案路徑：/usr/local/msmtp/bin/msmtp -P
複製程式碼程式碼如下:
ignoring system configuration file/work/target/etc/msmtprc: No such file or directory
ignoring user configuration file /root/.msmtprc: No such file ordirectory
falling back to default account
msmtp: account default not found: no configuration file available

故將/usr/local/etc/msmtprc 複製為/root/.msmtprc
檢視一下mutt檔案安裝目錄情況
複製程式碼程式碼如下:
rpm -ql mutt

故將/etc/Muttrc 複製為/root/.muttrc即可傳送郵件。

二、監控伺服器系統負載情況：

1、用uptime命令檢視當前負載情況（1分鐘，5分鐘，15分鐘平均負載情況）在蘋果公司的Mac電腦上也適用

複製程式碼程式碼如下:
# uptime
15:43:59 up 186 days, 20:04, 1 user, load average: 0.01, 0.02, 0.00

"load average"意思分別是1分鐘、5分鐘、15分鐘內系統的平均負荷。
(1) 主要觀察"15分鐘系統負荷"，將它作為電腦正常執行的指標。
(2) 如果15分鐘內，（系統負荷除以CPU核心數目之後的）平均負荷大於1.0，表明問題持續存在，不是暫時現象。
(3) 當系統負荷持續大於0.7，你必須開始調查了，問題出在哪裡，防止情況惡化。
(4) 當系統負荷持續大於1.0，你必須動手尋找解決辦法，把這個值降下來。
(5) 當系統負荷達到5.0，就表明你的系統有很嚴重的問題，長時間沒有響應，或者接近宕機了。
假設你的電腦只有1個CPU。如果你的電腦裝了2個CPU,意味著電腦的處理能力翻了一倍，能夠同時處理的程序數量也翻了一倍。
2個CPU表明系統負荷可以達到2.0，此時每個CPU都達到100%的工作量。推廣開來，n個CPU的電腦，可接受的系統負荷最大為n.0。

2、檢視伺服器cpu的總核數

複製程式碼程式碼如下:
# grep -c 'model name' /proc/cpuinfo 或者 cat /proc/cpuinfo

3、擷取伺服器1分鐘、5分鐘、15分鐘的負載情況
複製程式碼程式碼如下:
# uptime | awk '{print $8,$9,$10,$11,$12}'
load average: 0.01, 0.02, 0.00

4、檢視擷取15分鐘的平均負載

複製程式碼程式碼如下:
# uptime | awk '{print $12}' （用 '{print $12}' 這個獲取的不夠準確，如果都用awk取第12個欄位的話，結果有可能為空了。而用$NF表輸出最後一段的內容）
# uptime | awk '{print $NF}'

5、編寫系統負載監控的指令碼檔案：
複製程式碼程式碼如下:
# vim /scripts/load-check.sh
[code]
#!/bin/bash
#使用uptime命令監控linux系統負載變化

#取系統當前時間（以追加的方式寫入檔案>>）
date >> /scripts/datetime-load.txt

#提取伺服器1分鐘、5分鐘、15分鐘的負載情況
uptime | awk '{print $8,$9,$10,$11,$12}' >> /scripts/load.txt

#逐行連線上面的時間和負載相關行資料（每次重新寫入檔案>）
paste /scripts/datetime-load.txt /scripts/load.txt   > /scripts/load_day.txt
# chmod a+x /scripts/load-check.sh

6、編寫系統負載結果檔案郵件傳送指令碼：

複製程式碼程式碼如下:
# vim /scripts/sendmail-load.sh

#!/bin/bash
#把系統負載監控生成的load_day.txt檔案通過郵件傳送給使用者

#提取本伺服器的IP地址資訊
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`

#提取當前日期
today=`date -d "0 day" +%Y年%m月%d日`

#傳送系統負載監控結果郵件
echo "這是$IP伺服器$today的系統負載監控報告，請下載附件。" | mutt -s "$IP伺服器$today的系統負載監控報告" -a /scripts/load_day.txt [email protected]
# chmod a+x /scripts/sendmail-load.sh

7、編寫系統負載監控的指令碼檔案：

複製程式碼程式碼如下:
# vim /scripts/load-warning.sh

#!/bin/bash
#使用uptime命令監控linux系統負載變化

#提取本伺服器的IP地址資訊
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`

#抓取cpu的總核數
cpu_num=`grep -c 'model name' /proc/cpuinfo`

#抓取當前系統15分鐘的平均負載值
load_15=`uptime | awk '{print $NF}'`

#計算當前系統單個核心15分鐘的平均負載值，結果小於1.0時前面個位數補0。
average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc`

#取上面平均負載值的個位整數
average_int=`echo $average_load | cut -f 1 -d "."`

#設定系統單個核心15分鐘的平均負載的告警值為0.70(即使用超過70%的時候告警)。
load_warn=0.70

#當單個核心15分鐘的平均負載值大於等於1.0（即個位整數大於0），直接發郵件告警；如果小於1.0則進行二次比較
if (($average_int > 0)); then
      echo "$IP伺服器15分鐘的系統平均負載為$average_load，超過警戒值1.0，請立即處理！！！" | mutt -s "$IP 伺服器系統負載嚴重告警！！！" [email protected]
else
#當前系統15分鐘平均負載值與告警值進行比較（當大於告警值0.70時會返回1，小於時會返回0 ）
load_now=`expr $average_load \> $load_warn`

#如果系統單個核心15分鐘的平均負載值大於告警值0.70（返回值為1），則發郵件給管理員
if (($load_now == 1)); then
    echo "$IP伺服器15分鐘的系統平均負載達到 $average_load，超過警戒值0.70，請及時處理。" | mutt -s "$IP 伺服器系統負載告警" [email protected]
fi
fi
# chmod a+x /scripts/load-warning.sh

三、監控伺服器系統cpu佔用情況：

1、使用top命令檢視linux系統cpu使用情況：

複製程式碼程式碼如下:
# top -b -n 1 | grep Cpu （-b -n 1 表只需要1次的輸出結果）
Cpu(s): 0.0%us, 0.0%sy, 0.0%ni, 99.9%id, 0.0%wa, 0.0%hi, 0.0%si, 0.0%st

2、檢視擷取空閒cpu的百分比數值命令（只取整數部分）：
複製程式碼程式碼如下:
# top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."

3、編寫cpu監控的指令碼檔案：
複製程式碼程式碼如下:
# vim /scripts/cpu-check.sh

#!/bin/bash
#使用top命令監控linux系統cpu變化

#取系統當前時間（以追加的方式寫入檔案>>）
date >> /scripts/datetime-cpu.txt

#抓取當前cpu的值（以追加的方式寫入檔案>>）
top -b -n 1 | grep Cpu >> /scripts/cpu-now.txt

#逐行連線上面的時間和cpu相關行資料（每次重新寫入檔案>）
paste /scripts/datetime-cpu.txt   /scripts/cpu-now.txt > /scripts/cpu.txt
# chmod a+x /scripts/cpu-check.sh

4、檢視CPU監控的結果檔案：

複製程式碼程式碼如下:
# cat /scripts/cpu.txt

5、編寫cpu結果檔案郵件傳送指令碼：
複製程式碼程式碼如下:
# vim /scripts/sendmail-cpu.sh
#!/bin/bash
#把生成的cpu.txt檔案通過郵件傳送給使用者

#提取本伺服器的IP地址資訊
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`

#提取當前日期
today=`date -d "0 day" +%Y年%m月%d日`

#傳送cpu監控結果郵件
echo "這是$IP伺服器$today的cpu監控報告，請下載附件。" | mutt -s "$IP伺服器$today的CPU監控報告" -a /scripts/cpu.txt [email protected]
# chmod a+x /scripts/sendmail-cpu.sh

四、監控系統cpu的情況，當使用超過80%的時候發告警郵件：

複製程式碼程式碼如下:
# vim /scripts/cpu-warning.sh
#!/bin/bash
#監控系統cpu的情況指令碼程式

#提取本伺服器的IP地址資訊
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`

#取當前空閒cpu百份比值（只取整數部分）
cpu_idle=`top -b -n 1 | grep Cpu | awk '{print $5}' | cut -f 1 -d "."`

#設定空閒cpu的告警值為20%，如果當前cpu使用超過80%（即剩餘小於20%），立即發郵件告警
if (($cpu_idle < 20)); then
      echo "$IP伺服器cpu剩餘$cpu_idle%，使用率已經超過80%，請及時處理。" | mutt -s "$IP 伺服器CPU告警" [email protected]
fi
# chmod a+x /scripts/cpu-warning.sh

五、使用free命令監控系統記憶體：

1、使用free命令檢視linux系統記憶體使用情況：（以M為單位）

複製程式碼程式碼如下:
# free -m
             total       used       free     shared    buffers     cached
Mem:          3952       3414        538          0        168        484
-/+ buffers/cache:       2760       1191
Swap:         8191         86       8105

2、檢視擷取剩餘記憶體free的數值命令：

(1) 實體記憶體free值： # free -m | grep Mem | awk '{print $4}'
(2) 緩衝區的free值： # free -m | grep - | awk '{print $4}'
(3) Swap分割槽free值： # free -m | grep Swap | awk '{print $4}'

3、編寫記憶體監控的指令碼檔案：

複製程式碼程式碼如下:
# vim /scripts/free-mem.sh
#!/bin/bash
#使用free命令監控linux系統記憶體變化

#取系統當前時間（以追加的方式寫入檔案>>）
date >> /scripts/date-time.txt

#抓取實體記憶體free值（以追加的方式寫入檔案>>）
echo Mem-free: `free -m | grep Mem | awk '{print $4}'`M >> /scripts/mem-free.txt

#抓取緩衝區的free值（以追加的方式寫入檔案>>）
echo buffers/cache-free: `free -m | grep - | awk '{print $4}'`M >> /scripts/buffers-free.txt

#抓取Swap分割槽free值（以追加的方式寫入檔案>>）
echo Swap-free: `free -m | grep Swap | awk '{print $4}'`M >> /scripts/swap-free.txt

#逐行連線上面的時間和記憶體相關行資料（每次重新寫入檔案>）
paste /scripts/date-time.txt /scripts/mem-free.txt /scripts/buffers-free.txt   /scripts/swap-free.txt   > /scripts/freemem.txt
# chmod a+x /scripts/free-mem.sh

4、檢視記憶體監控的結果檔案：
複製程式碼程式碼如下:
# cat /scripts/freemem.txt

5、編寫free結果檔案郵件傳送指令碼：
複製程式碼程式碼如下:
# vim /scripts/sendmail-mem.sh
#!/bin/bash
#把生成的freemem.txt檔案通過郵件傳送給使用者

#提取本伺服器的IP地址資訊
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`

#提取當前日期時間
today=`date -d "0 day" +%Y年%m月%d日`

#傳送記憶體監控結果郵件
echo "這是$IP伺服器$today的記憶體監控報告，請下載附件。" | mutt -s "$IP伺服器$today記憶體監控報告" -a /scripts/freemem.txt [email protected]
# chmod a+x /scripts/sendmail-mem.sh

六、監控系統交換分割槽swap的情況，當使用超過80%的時候發告警郵件：

複製程式碼程式碼如下:
# vim /scripts/swap-warning.sh
#!/bin/bash

#提取本伺服器的IP地址資訊
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`

#系統分配的交換分割槽總量
swap_total=`free -m | grep Swap | awk '{print $2}'`

#當前剩餘的交換分割槽free大小
swap_free=`free -m | grep Swap | awk '{print $4}'`

#當前已使用的交換分割槽used大小
swap_used=`free -m | grep Swap | awk '{print $3}'`


if (($swap_used != 0)); then

#如果交換分割槽已被使用，則計算當前剩餘交換分割槽free所佔總量的百分比，用小數來表示，要在小數點前面補一個整數位0
   swap_per=0`echo "scale=2;$swap_free/$swap_total" | bc`

#設定交換分割槽的告警值為20%(即使用超過80%的時候告警)。
   swap_warn=0.20

#當前剩餘交換分割槽百分比與告警值進行比較（當大於告警值(即剩餘20%以上)時會返回1，小於(即剩餘不足20%)時會返回0 ）
   swap_now=`expr $swap_per \> $swap_warn`

#如果當前交換分割槽使用超過80%（即剩餘小於20%，上面的返回值等於0），立即發郵件告警
if (($swap_now == 0)); then
    echo "$IP伺服器swap交換分割槽只剩下 $swap_free M 未使用，剩餘不足20%，使用率已經超過80%，請及時處理。" | mutt -s "$IP 伺服器記憶體告警" [email protected]
fi
fi
# chmod a+x /scripts/swap-warning.sh

七、加入任務計劃：系統負載與CPU佔用率每十分鐘檢測一次，有告警則立即發郵件(十分鐘發一次)，負載與CPU檢測結果郵件每天早上8點發一次。

複製程式碼程式碼如下: # crontab -e
*/10 * * * * /scripts/load-check.sh > /dev/null 2>&1
*/10 * * * * /scripts/load-warning.sh
0 8 * * * /scripts/sendmail-load.sh

*/10 * * * * /scripts/cpu-check.sh
*/10 * * * * /scripts/cpu-warning.sh
0 8 * * * /scripts/sendmail-cpu.sh

*/10 * * * * /scripts/free-mem.sh
*/10 * * * * /scripts/swap-warning.sh
0 8 * * * /scripts/sendmail-mem.sh
# service crond restart

shell指令碼監控系統負載、CPU和記憶體使用情況

shell指令碼監控系統負載、CPU和記憶體使用情況

shell 指令碼監控系統記憶體佔用率、主備機等

Shell指令碼監控系統情況併發送郵件

Shell指令碼監控CPU、記憶體和硬碟利用率

利用shell指令碼監控linux中CPU、記憶體和磁碟利用率。（centos7）

shell指令碼採集系統cpu、記憶體、磁碟、網路資訊

Shell指令碼監控、拉起Nimbus和Supervisor程序

使用shell指令碼監控cpu，磁碟，記憶體

系統服務監控指標--load、CPU利用率、磁碟剩餘空間、磁碟I/O、記憶體使用情況等

使用w查看系統負載、vmstat、top、sar、nload命令

linux 系統tty、pty和pts 的概念及區別

Linux日常運維管理技巧： w命令-查看系統負載、vmstat命令、top命令、sar命令

二十九、w查看系統負載、vmstat命令、top命令、sar命令、nload命令

使用w查看系統負載、vmstat命令、top命令、sar命令、nload命令

centos系統查看系統版本、內核版本、系統位數、cpu個數、核心數、線程數

Linux 磁碟分割槽，檔案系統建立、掛載和解除安裝

阿里P9架構師談：高併發網站的監控系統選型、比較、核心監控指標

阿裏P9架構師談：高並發網站的監控系統選型、比較、核心監控指標

MYSQL "ORDER BY rand()"的坑--容易導致機器負載、CPU佔用過高

linux shell指令碼監控程序是否存在

shell指令碼監控系統負載、CPU和記憶體使用情況

相關推薦