1. 程式人生 > >linux服務器系統負載監控-shell腳本

linux服務器系統負載監控-shell腳本

inf 二次 計算 chm -c lai %d target 當前時間

一、監控服務器系統負載情況:

1、用uptime命令查看當前負載情況(1分鐘,5分鐘,15分鐘平均負載情況)
# uptime
15:43:59 up 186 days, 20:04, 1 user, load average: 0.01, 0.02, 0.00

系統負荷的經驗法則:(詳情參考:http://blog.csdn.net/skyline_loafer/article/details/26940539)
(1) 主要觀察"15分鐘系統負荷",將它作為電腦正常運行的指標。
(2) 如果15分鐘內,(系統負荷除以CPU核心數目之後的)平均負荷大於1.0,表明問題持續存在,不是暫時現象。
(3) 當系統負荷持續大於0.7,你必須開始調查了,問題出在哪裏,防止情況惡化。
(4) 當系統負荷持續大於1.0,你必須動手尋找解決辦法,把這個值降下來。
(5) 當系統負荷達到5.0,就表明你的系統有很嚴重的問題,長時間沒有響應,或者接近死機了。

2、查看服務器cpu的總核數
# grep -c ‘model name‘ /proc/cpuinfo

3、截取服務器1分鐘、5分鐘、15分鐘的負載情況
# uptime | awk ‘{print $8,$9,$10,$11,$12}‘(註意:這裏是1左邊的符號!!!)
load average: 0.01, 0.02, 0.00

4、查看截取15分鐘的平均負載
# uptime | awk ‘{print $12}‘

(用 ‘{print $12}‘ 這個獲取的不夠準確,如果都用awk取第12個字段的話,結果有可能為空了。而用$NF表輸出最後一段的內容)
# uptime | awk ‘{print $NF}‘

5、編寫系統負載監控的腳本文件:
# vim /scripts/load-check.sh

  1. #!/bin/bash
  2. #使用uptime命令監控linux系統負載變化
  3. #取系統當前時間(以追加的方式寫入文件>>)
  4. date >> /scripts/datetime-load.txt
  5. #提取服務器1分鐘、5分鐘、15分鐘的負載情況
  6. uptime | awk ‘{print $8,$9,$10,$11,$12}‘ >> /scripts/load.txt
  7. #逐行連接上面的時間和負載相關行數據(每次重新寫入文件>)
  8. paste /scripts/datetime-load.txt /scripts/load.txt > /scripts/load_day.txt

# chmod a+x /scripts/load-check.sh

6、編寫系統負載結果文件郵件發送腳本:
# vim /scripts/sendmail-load.sh

  1. #!/bin/bash
  2. #把系統負載監控生成的load_day.txt文件通過郵件發送給用戶
  3. #提取本服務器的IP地址信息
  4. IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`
  5. #提取當前日期
  6. today=`date -d "0 day" +%Y年%m月%d日`
  7. #發送系統負載監控結果郵件
  8. echo "這是$IP服務器$today的系統負載監控報告,請下載附件。" | mutt -s "$IP服務器$today的系統負載監控報告" -a /scripts/load_day.txt [email protected]

# chmod a+x /scripts/sendmail-load.sh

7、編寫系統負載監控的腳本文件:
# vim /scripts/load-warning.sh

  1. #!/bin/bash
  2. #使用uptime命令監控linux系統負載變化
  3. #提取本服務器的IP地址信息
  4. IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`
  5. #抓取cpu的總核數
  6. cpu_num=`grep -c ‘model name‘ /proc/cpuinfo`
  7. #抓取當前系統15分鐘的平均負載值
  8. load_15=`uptime | awk ‘{print $NF}‘`
  9. #計算當前系統單個核心15分鐘的平均負載值,結果小於1.0時前面個位數補0。
  10. average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc`

  11. #取上面平均負載值的個位整數
  12. average_int=`echo $average_load | cut -f 1 -d "."`
  13. #設置系統單個核心15分鐘的平均負載的告警值為0.70(即使用超過70%的時候告警)。
  14. load_warn=0.70
  15. #當單個核心15分鐘的平均負載值大於等於1.0(即個位整數大於0) ,直接發郵件告警;如果小於1.0則進行二次比較
  16. if (($average_int > 0)); then
  17. echo "$IP服務器15分鐘的系統平均負載為$average_load,超過警戒值1.0,請立即處理!!!" | mutt -s "$IP 服務器系統負載嚴重告警!!!" [email protected]
  18. else
  19. #當前系統15分鐘平均負載值與告警值進行比較(當大於告警值0.70時會返回1,小於時會返回0 )
  20. load_now=`expr $average_load \> $load_warn`
  21. #如果系統單個核心15分鐘的平均負載值大於告警值0.70(返回值為1),則發郵件給管理員
  22. if (($load_now == 1)); then
  23. echo "$IP服務器15分鐘的系統平均負載達到 $average_load,超過警戒值0.70,請及時處理。" | mutt -s "$IP 服務器系統負載告警" [email protected]
  24. fi
  25. fi

# chmod a+x /scripts/load-warning.sh

8、加入任務計劃:系統負載每十分鐘檢測一次,有告警則立即發郵件(十分鐘檢測一次),每天早上8點發送一次系統負載檢查報告

# crontab -e

  1. */10 * * * * /scripts/load-check.sh
  2. */10 * * * * /scripts/load-warning.sh
  3. 0 8 * * * /scripts/sendmail-load.sh


(原文摘自:http://huangrs.blog.51cto.com/2677571/788379/)

linux服務器系統負載監控-shell腳本