1.监控系统负载系统负载介绍系统负载介绍一、定义系统负载Load Average指单位时间内CPU 等待队列中就绪 / 运行进程的平均数量反映 CPU 繁忙程度分 1 分钟、5 分钟、15 分钟三个均值。二、查看命令uptime最简查看负载top实时负载 进程资源htop可视化负载监控cat /proc/loadavg读取原始负载数据三、负载判断标准多核 CPU假设 CPU 核心数为 Nload NCPU 空闲资源充足load NCPU 满载无剩余算力load NCPU 过载进程排队等待响应变慢示例4 核 CPU负载 4 为满负荷负载 6 代表大量进程阻塞。四、负载高常见原因CPU 密集程序编译、视频转码、数据计算IO 阻塞磁盘读写慢进程等待磁盘拉高负载但 CPU 使用率低大量线程 / 进程并发资源争抢内存不足触发 swap 交换磁盘 IO 飙升五、负载与 CPU 使用率区别CPU 使用率当前 CPU 正在运算的比例系统负载包含运行 等待 CPU/IO 的全部进程IO 阻塞时负载高、CPU 占用低是典型现象六、优化排查思路top按 P 排序查找高 CPU 进程iostat查看磁盘 IO判断 IO 瓶颈free -h检查内存与 Swap 占用限制并发进程、优化磁盘、扩容 CPU / 内存stress 工具Linux 中的stress工具用于对系统进行压力测试可模拟 CPU、内存、I/O 和磁盘等资源的高负载状态。通过指定参数如-c压 CPU、-m压内存可创建负载帮助发现系统在压力下的稳定性问题常用于性能调优或硬件验证。# 安装[rootcentos7 ~10:08:19]# yum install -y stress# 帮助信息[rootcentos7 ~10:31:33]# stress --helpstress imposes certain types of compute stress on your system Usage: stress[OPTION[ARG]]... -?,--helpshow thishelpstatement--versionshow version statement -v,--verbosebe verbose -q,--quietbe quiet -n, --dry-run show what would have beendone-t,--timeoutNtimeoutafter N seconds--backoffNwaitfactor of N microseconds before work starts -c,--cpuN spawn N workers spinning on sqrt()-i,--ioN spawn N workers spinning on sync()-m,--vmN spawn N workers spinning on malloc()/free()--vm-bytes B malloc B bytes per vm worker(default is 256MB)--vm-stride Btoucha byte every B bytes(default is4096)--vm-hang NsleepN secs beforefree(default none,0is inf)--vm-keep redirty memory instead of freeing and reallocating -d,--hddN spawn N workers spinning on write()/unlink()--hdd-bytes BwriteB bytes per hdd worker(default is 1GB)Example: stress--cpu8--io4--vm2--vm-bytes 128M--timeout10s Note: Numbers may be suffixed with s,m,h,d,y(time)or B,K,M,G(size).压力测试-CPU# 消耗2个CPU[rootcentos7 ~10:31:52]# stress -c 2stress: info:[3202]dispatching hogs:2cpu,0io,0vm,0hdd# top 监控[xzhcentos7 ~10:32:02]$toptop-10:32:44 up1:42,2users, load average:1.07,0.29,0.14Tasks:195total,4running,191sleeping,0stopped,0zombie %Cpu(s):99.4us,0.3sy,0.0ni,0.0id,0.0wa,0.0hi,0.3si,0.0st KiB Mem:4026116total,2940324free,514972used,570820buff/cache KiB Swap:4063228total,4063228free,0used.3266204avail Mem PIDUSERPR NI VIRT RES SHR S %CPU %MEM TIME COMMAND3204root2007312960R100.00.00:37.43 stress3203root2007312960R99.30.00:37.24 stress745root20029556452924040S0.30.10:11.95 vmtoolsd3205xzh20016210823561588R0.30.10:00.11top......压力测试-内存# 消耗前内存[rootcentos7 ~10:33:11]# free -mtotal usedfreeshared buff/cache available Mem:39315022871185573189Swap:396703967# 消耗 1G 内存[rootcentos7 ~10:33:19]# stress -m 1 --vm-bytes 1Gstress: info:[3225]dispatching hogs:0cpu,0io,1vm,0hdd# 消耗后内存[xzhcentos7 ~10:32:49]$free-mtotal usedfreeshared buff/cache available Mem:393111662207185572526Swap:396703967压力测试-磁盘# 消耗磁盘IO[rootcentos7 ~]# stress -d 1 --hdd-bytes 2G# 监视活动状态百分比%util[rootcentos7 ~10:35:31]# yum install -y sysstat iotop#[rootcentos7 ~10:35:40]# sar -dp 1Linux3.10.0-1160.71.1.el7.x86_64(centos7.xzh.cloud)2026年07月22日 _x86_64_(2CPU)10时35分53秒 DEV tps rd_sec/s wr_sec/s avgrq-sz avgqu-sz await svctm %util10时35分54秒 sda367.330.00376142.571024.000.421.160.9936.3410时35分54秒 sr00.000.000.000.000.000.000.000.0010时35分54秒 centos-root366.340.00375128.711024.000.431.160.9936.3410时35分54秒 centos-swap0.000.000.000.000.000.000.000.0010时35分54秒 centos-home0.000.000.000.000.000.000.000.00......网络测试# 传送一个大size的文件[rootcentos7 ~10:41:59]# wget http://192.168.50.200/course-materials/iso/CentOS-7-x86_64-DVD-2207-02.iso# 监控带宽[rootcentos7 ~10:40:45]# sar -n DEV 1......10时43分18秒 IFACE rxpck/s txpck/s rxkB/s txkB/s rxcmp/s txcmp/s rxmcst/s10时43分19秒 lo0.000.000.000.000.000.000.0010时43分19秒 virbr0-nic0.000.000.000.000.000.000.0010时43分19秒 virbr00.000.000.000.000.000.000.0010时43分19秒 ens3328807.001710.0042095.60101.280.000.000.00......监控总结以下是针对 Linux 系统监控的几条实用建议涵盖关键监控维度和最佳实践核心指标实时监控重点跟踪 CPU 使用率用户态 / 系统态占比、内存占用含缓存 /swap 使用率、磁盘 I/O读写吞吐量、IOPS和网络流量带宽利用率、连接数。可通过top/htop实时、vmstat/iostat系统级等工具快速查看。部署专业监控工具对于服务器集群或长期监控需求建议使用 Prometheus Grafana可视化强、Zabbix全功能监控或 Nagios轻量告警等工具实现指标集中收集、趋势分析和历史数据查询。设置关键阈值告警针对核心指标配置告警阈值如 CPU 持续 5 分钟超 80%、磁盘空间不足 10%通过邮件、短信或即时通讯工具推送告警避免故障扩大。注意避免告警风暴可设置告警合并或延迟。监控进程与服务状态定期检查关键服务如 Nginx、MySQL的运行状态、进程数及资源消耗可通过systemctl status或自定义脚本实现。对异常退出的进程结合日志排查崩溃原因。日志集中管理与分析将系统日志/var/log/messages、应用日志集中存储如使用 ELK 栈关注错误信息ERROR级别、登录异常/var/log/auth.log和磁盘错误dmesg | grep error必要时配置日志告警规则。磁盘健康监控除空间使用率外需关注磁盘坏块smartctl工具检测 S.M.A.R.T 信息和文件系统完整性定期运行fsck非挂载状态下避免硬件故障导致数据丢失。网络与安全监控监控端口开放状态netstat/ss、异常连接尤其是外部 IP 的高频访问和防火墙规则生效情况。可结合tcpdump抓包分析可疑流量。定期性能基线分析记录系统正常运行时的指标基线如平均负载、内存使用峰值当指标偏离基线时及时排查避免微小异常累积成故障。自动化监控脚本对个性化需求如特定目录文件数、应用响应时间编写 Shell 或 Python 脚本定期执行检查输出结果至监控系统或直接触发告警。监控权限与安全限制监控工具的权限如仅授予读取日志和指标的权限加密传输监控数据防止监控系统本身成为安全薄弱点。通过分层监控基础指标→服务状态→业务性能和主动预警可显著提升系统稳定性和故障响应效率。监控维度核心指标常用排查命令告警阈值参考核心作用CPU 监控平均负载、us/sy/id/wa 使用率、上下文切换uptime、top、mpstat、pidstat负载≥CPU 核心数CPU 持续 5min80%判断计算资源瓶颈区分 CPU 密集 / IO 阻塞高负载内存监控可用内存、缓存、Swap 使用率free -h、vmstat、smem可用内存 20%Swap20%预防内存耗尽、频繁交换引发系统卡顿磁盘 IO 监控IOPS、读写吞吐、% util、iowaitiostat -x、iotop、smartctl磁盘 util 持续 100%磁盘剩余 10%定位磁盘读写瓶颈、检测硬盘硬件故障网络监控带宽占用、TCP 连接、丢包延迟ss、iftop、mtr、tcpdump带宽 80%大量异常外部连接排查带宽打满、网络攻击、链路丢包问题服务进程监控进程 CPU / 内存占用、服务运行状态systemctl、ps、pstree核心服务离线单进程占用 90% CPU保障业务服务持续稳定运行日志监控系统报错、登录异常、应用 ERRORcat、grep、ELK 日志栈持续出现 ERROR、陌生 IP 登录提前发现入侵、程序崩溃、系统报错综合监控平台全量指标、历史曲线、告警PrometheusGrafana、Zabbix、Nagios自定义多指标阈值集群统一监控、长期性能趋势分析自定义巡检业务指标、目录文件、接口耗时Shell/Python 脚本业务响应超时、目录文件暴涨适配个性化业务监控需求2.Linux 服务管理systemd 介绍基本概念CentOS 7 使用 Systemd 引导系统启动速度最快所有进程无论有无依赖关系则都是并行启动很多时候进程没有真正启动而是只有一个信号或者说是标记而已在真正利用的时候才会真正启动。Systemd为了解决上文的问题而诞生。它的目标是为系统的启动和管理提供一套完整的解决方案。服务从业务角度来称呼例如 web 服务数据库服务。守护进程daemonweb 服务器对外提供 web 服务由 web 相关的进程提供支持。例如# 安装软件包[rootcentos7 ~10:43:51]# yum install -y httpd# 启动服务[rootcentos7 ~11:13:45]# systemctl start httpd# 查看进程[rootcentos7 ~11:15:12]# ps -C httpd fPID TTY STAT TIME COMMAND3785? Ss0:00 /usr/sbin/httpd-DFOREGROUND3796? S0:00\_ /usr/sbin/httpd-DFOREGROUND3797? S0:00\_ /usr/sbin/httpd-DFOREGROUND3798? S0:00\_ /usr/sbin/httpd-DFOREGROUND3799? S0:00\_ /usr/sbin/httpd-DFOREGROUND3800? S0:00\_ /usr/sbin/httpd-DFOREGROUhttpd 服务对应的守护进程是3785、3796…systemd 架构systemd 是 Linux 下 PID1 的初始化进程替代 SysVinit采用事件驱动、并行启动。核心将各类资源抽象为Unit 单元service/target/mount/timer 等通过配置定义依赖Requires/Wants与启动顺序After/Before内置 journald 统一收集系统日志依托 cgroups 管理进程组、限制资源提供 systemctl、journalctl 等工具管理单元target 替代传统运行级别完成系统初始化、服务启停、关机重启全生命周期管控。unit 类型systemctl 命令用于管理不同类型的系统对象这些对象称之为units。单元类型作用后缀示例Service unit定义系统服务.servicehttpd.serviceSocket unit进程间通信 socket.socketsshd.socketTarget unit模拟传统运行级别整合一组单元.targetmulti-user.targetTimer unit实现定时任务.timerbackup.timerDevice unit内核识别的硬件设备.devicedev-sda1.deviceMount unit定义文件系统挂载点.mountmnt-data.mountSnapshot unit管理系统快照.snapshotclean.snapshotSwap unit管理 Swap 交换设备.swapdev-sdb2.swapAutomount unit文件系统自动挂载点.automountmnt-cdrom.automountPath unit监控文件变动触发服务.pathlog-monitor.pathSlice unit配合 cgroup 进行资源管控.sliceuser.slice查看 unit 列表信息# 列出状态为loaded units[rootcentos7 ~16:53:11]# systemctl list-unitssystemctl list-units命令输出说明字段说明UNIT服务单元名称LOADsystemd 是否正确解析单元配置并加载至内存ACTIVE单元高级别激活状态表示单元是否成功启动SUB单元低级别激活状态提供更详细状态信息随单元类型、运行状态变化DESCRIPTION单元简短描述# -t选项查看特定类型unit 清单[rootcentos7 ~16:53:27]# systemctl list-units -t timerUNIT LOAD ACTIVE SUB DESCRIPTION systemd-tmpfiles-clean.timer loaded active waiting Daily Cleanup of Temporary Directori unbound-anchor.timer loaded active waiting daily update of the root trust ancho LOADReflects whether the unit definition was properly loaded. ACTIVEThe high-level unit activation state, i.e. generalization of SUB. SUBThe low-level unit activation state, values depend on unit type.2loadedunitslisted. Pass--allto see loaded but inactive units, too. To show all installed unit files usesystemctl list-unit-files.# 列出类型为service状态为active和inactive unit[rootcentos7 ~]# systemctl list-units --type service --all# 列出所有unit包括未loaded的unit[rootcentos7 ~16:53:37]# systemctl list-unit-files# 查看失败的服务[rootcentos7 ~16:54:05]# systemctl --failed --type service查看单个 unit 信息[xzhcentos7 ~16:54:37]$ systemctl status sshd.service ● sshd.service - OpenSSH server daemon Loaded: loaded(/usr/lib/systemd/system/sshd.service;enabled;vendor preset: enabled)Active: active(running)since 三2026-07-2216:50:46 CST;4min 31s ago Docs: man:sshd(8)man:sshd_config(5)Main PID:1228(sshd)Tasks:1CGroup: /system.slice/sshd.service └─1228 /usr/sbin/sshd-D关键字概述loaded单元配置文件已处理active(running)正在运行active(exited)已成功完成一次性配置active(waiting)运行中正在等待事件inactive不再运行enabled系统引导时启动disabled系统引导时不启动static无法启动依赖其他单元启动控制系统服务命令任务systemctl statusUNIT查看单元状态的详细信息。systemctl stopUNIT在运行中的系统上停止一项服务。systemctl startUNIT在运行中的系统上启动一项服务。systemctl restartUNIT在运行中的系统上重新启动一项服务。systemctl reloadUNIT重新加载运行中服务的配置文件。systemctl maskUNIT禁用服务使其无法手动启动或在系统引导时启动。systemctl unmaskUNIT使屏蔽的服务变为可用。systemctl enableUNIT将服务配置为在系统引导时启动。使用--now选项也会启动该服务。systemctl disableUNIT禁止服务在系统引导时启动。使用--now选项也会停止该服务。# 停止服务[rootcentos7 ~16:57:50]# systemctl stop sshd.service# 客户端连接测试[rootcentos7 ~16:58:37]# ssh xzh10.1.8.10ssh: connect tohost10.1.8.10 port22: Connection refused# 启动服务[rootcentos7 ~17:01:38]# systemctl start sshd.service# 客户端连接测试[rootcentos7 ~17:03:29]# ssh xzh10.1.8.10The authenticity ofhost10.1.8.10 (10.1.8.10)cant be established. ECDSA key fingerprint is SHA256:R/m5F/fO4mbXy7tOrX7ht5X3p5yPKzQuoy2wYtC6LE. ECDSA key fingerprint is MD5:f4:44:73:b7:ed:03:1f:61:cc:c1:06:b8:62:2d:10:29. Are you sure you want to continue connecting (yes/no)? yes Warning: Permanently added 10.1.8.10 (ECDSA) to the list of known hosts. xzh10.1.8.10s password: Last login: Wed Jul2216:51:322026from10.1.8.1# 重启服务相当于stop再start[rootcentos7 ~]# systemctl restart sshd.service# 一般用于配置文件变动后重新加载[rootcentos7 ~17:06:39]# systemctl restart sshd.service# 重新加载服务服务对应的主进程不会重启只会重新加载一次配置文件。# 禁止服务开机自启[rootcentos7 ~17:07:20]# systemctl disable sshd.service[rootcentos7 ~17:07:42]# systemctl is-enabled sshd.servicedisabled# 重启系统验证[rootcentos7 ~17:08:02]# reboot# 设置服务开机自启[rootcentos7 ~17:08:25]# systemctl enable sshd.service[rootcentos7 ~17:08:45]# systemctl is-enabled sshdenabled# 重启系统验证[rootcentos7 ~17:08:48]# reboot# 禁用服务服务被禁用后将无法start因为服务的配置文件指向/dev/null[rootcentos7 ~17:12:40]# systemctl mask sshd.service# 取消禁用[rootcentos7 ~17:12:47]# systemctl unmask sshd.serviceunit 配置文件unit 配置文件存放在多个位置/etc /systemd/system/unit.service优先生效。一般是管理员自定义的配置。/usr/lib /systemd/system/unit.service其次生效。软件包自带的默认配置。配置文件说明示例单元文件/usr/lib/systemd/system/sshd.service说明# 标识该部分为 Unit 配置用于描述服务的基本信息、依赖关系等。 [Unit] # 服务的描述信息说明这是 OpenSSH 服务器守护进程便于管理员识别服务用途。 DescriptionOpenSSH server daemon # 指定服务的文档路径这里指向 sshd 命令的手册页man 8 sshd和配置文件的手册页man 5 sshd_config方便用户查阅帮助。 Documentationman:sshd(8) man:sshd_config(5) # 定义服务的启动顺序sshd 服务必须在 network.target网络服务就绪和 sshd-keygen.serviceSSH 密钥生成服务之后启动确保依赖的资源已准备好。 Afternetwork.target sshd-keygen.service # 表示 sshd 服务 希望 sshd-keygen.service 运行但不是强制依赖。如果 sshd-keygen.service 启动失败sshd 仍会尝试启动通常用于生成初始 SSH 密钥若密钥已存在则不影响。 Wantssshd-keygen.service # 标识该部分为 Service 配置用于定义服务的启动方式、执行命令、重启策略等。 [Service] # 定义服务的类型为 notify表示服务启动后会主动通知 systemd 自己已就绪通过 sd_notify() 函数systemd 会等待这个通知后再继续后续流程确保服务真正可用。 Typenotify # 指定环境变量文件的路径/etc/sysconfig/sshd 中通常定义 OPTIONS 等变量如额外的 sshd 启动参数这些变量会被后续的 ExecStart 引用。 EnvironmentFile/etc/sysconfig/sshd # 服务启动时执行的命令 ExecStart/usr/sbin/sshd -D $OPTIONS # /usr/sbin/sshdsshd 守护进程的可执行文件路径。 # -D表示 sshd 以非守护进程模式运行前台运行因为 systemd 通常管理前台进程便于监控。 # $OPTIONS引用 EnvironmentFile 中定义的额外参数如 -p 2222 指定端口。 # 服务重载配置时执行的命令 ExecReload/bin/kill -HUP $MAINPID # kill -HUP 发送 SIGHUP 信号给 sshd 主进程使其重新加载配置文件无需重启服务。 # $MAINPID 是 systemd 自动维护的服务主进程 ID。 # 定义服务停止时的杀死模式process 表示只杀死服务的主进程sshd 主进程其子进程如已建立的 SSH 连接会被保留避免强制中断现有连接。 KillModeprocess # 定义服务的重启策略当服务因非正常退出如崩溃、信号终止时systemd 会自动重启服务正常退出如主动停止则不重启。 Restarton-failure # 服务重启前的等待时间这里设置为 42 秒避免频繁重启导致资源耗尽。 RestartSec42s # 标识该部分为 Install 配置用于定义服务如何被 启用即系统启动时自动运行。 [Install] # 表示当系统启动到 multi-user.target多用户命令行模式非图形界面时该服务会被自动启动。这是服务器的默认运行级别确保 SSH 服务在系统启动后可用。 WantedBymulti-user.target开发一个 study 服务开发 studyd 服务主程序 study脚本说明这是一个无限循环的脚本每 5 秒会向/var/log/study.log文件中追加一行包含当前时间的日志内容为[时间]: IM studying [ Linux ]。[rootcentos7 ~15:11:59]# vim /usr/local/bin/study#!/bin/bash# 第一行内容是脚本的 解释器声明shebang指定该脚本使用 /bin/bash 作为解释器执行。系统会根据这一行找到对应的 shell 程序来解析后续命令。# 启动一个无限循环while 是循环关键字true 是一个永远为真的条件因此这个循环会一直执行下去直到被外部终止如 CtrlC。whiletrue# 循环体的开始标记do 和后面的 done 之间的内容是循环中重复执行的命令。do# 执行 date 命令获取当前系统时间并通过 $(...) 捕获其输出将结果赋值给变量 DATE。DATE$(date)# echo 命令输出字符串其中 $DATE 会被替换为变量的值# 是追加重定向符号将输出内容追加到 /var/log/study.log 文件中# 最终输出内容类似 Fri Oct 31 10:00:00 CST 2025: IM studying [ Linux ]。echo$DATE: IM studying [ Linux ]/var/log/study.log# 让脚本暂停执行 5 秒sleep 命令用于延迟单位默认为秒避免循环执行过快。sleep5# 循环体的结束标记与前面的 while 和 do 配合标志着一次循环的结束。done[rootcentos7 ~15:13:35]# chmod x /usr/local/bin/study创建 studyd 服务单元文件# 参考 sshd.service[rootcentos7 ~15:13:45]# cp /usr/lib/systemd/system/sshd.service \/etc/systemd/system/studyd.service[rootcentos7 ~15:13:58]# vim /etc/systemd/system/studyd.service[Unit]Descriptionstudy server daemon[Service]ExecStart/usr/local/bin/study[Install]WantedBymulti-user.target# 通知 systemd 读取 unit 变化[rootcentos7 ~15:20:59]# systemctl daemon-reload# 启用并启动服务[rootcentos7 ~15:21:13]# systemctl enable studyd --now# 查看服务状态[rootcentos7 ~15:21:17]# systemctl status studyd● studyd.service - study server daemon Loaded: loaded(/etc/systemd/system/studyd.service;enabled;vendor preset: disabled)Active: active(running)since 三2026-07-2215:21:13 CST;8s ago Main PID:3389(study)CGroup: /system.slice/studyd.service ├─3389 /bin/bash /usr/local/bin/study └─3432sleep57月2215:21:13 centos7.xzh.cloud systemd[1]: Started study server daemon.验证日志[rootcentos7 ~15:21:22]# tail -f /var/log/study.log2026年 07月22日 星期三15:21:14 CST: IM studying [ Linux ] 2026年 07月 22日 星期三 15:21:19 CST: IM studying[Linux]2026年 07月22日 星期三15:21:24 CST: IM studying [ Linux ] 2026年 07月 22日 星期三 15:21:29 CST: IM studying[Linux]2026年 07月22日 星期三15:21:34 CST: IM studying [ Linux ] 2026年 07月 22日 星期三 15:21:39 CST: IM studying[Linux]2026年 07月22日 星期三15:21:44 CST: IM studying[Linux]......