在服务器运维与性能优化的实际工作中,精准掌握内存使用状况是保障业务稳定运行的核心前提,查看服务器内存占用率最常用且最权威的命令是 free、top 和 vmstat,free -h 是快速判断内存健康状况的首选工具,而 top 则用于定位具体的高内存占用进程,对于运维人员而言,不仅要会执行命令,更要具备解读输出数据背后逻辑的能力,特别是要正确理解 Linux 系统特有的 Buffer 与 Cache 机制,避免被表象数据误导。

核心工具详解:从宏观监控到微观定位
服务器内存管理涉及系统层面与进程层面,针对不同的排查需求,需要使用不同的命令组合。
free 命令:系统级内存概览
free 命令是查看服务器内存占用率最基础的入口,它直接读取 /proc/meminfo 文件,提供物理内存和交换分区的使用情况。
- 推荐参数:建议使用
free -h参数。-h选项会自动根据数值大小以人类易读的方式显示,避免手动换算字节。 - 输出解读重点:
- Mem 行:展示物理内存情况。
- Swap 行:展示交换分区情况。
- available 列:这是评估系统内存是否紧张的最核心指标,它表示系统当前可以立即分配给应用程序使用的内存总量。很多初学者只关注 used 列,看到数值很高就认为内存不足,这是错误的,Linux 会尽可能利用空闲内存作为文件缓存,这部分内存被标记为 buff/cache,当应用程序申请内存时,这部分空间会被立即释放回收。
top 命令:进程级实时监控
当通过 free 命令发现内存占用率异常偏高时,需要使用 top 命令定位具体的“肇事进程”。
- 交互式操作:在
top界面中,按下大写M键,进程列表会按照内存使用率降序排列,占用内存最高的进程会置顶显示。 - 关键指标解析:
- VIRT (Virtual Memory):进程使用的虚拟内存总量,该数值通常很大,包含了申请但未实际使用的内存,不能作为判断实际物理内存占用的依据。
- RES (Resident Memory):进程实际使用的物理内存大小。这是排查内存泄漏或高内存消耗进程的关键指标。
- SHR (Shared Memory):进程使用的共享内存,可能被多个进程共同占用。
vmstat 命令:深度性能分析
vmstat 能够展现系统整体的 CPU、内存、I/O 状态,特别适合分析内存的变化趋势。
- 使用方法:
vmstat 1 5表示每秒采样一次,共采样 5 次。 - 核心关注点:
- si (swap in):从交换分区写入物理内存的数据量。
- so (swap out):从物理内存写入交换分区的数据量。
- 判断逻辑:
si和so的数值长期持续大于 0,说明系统物理内存严重不足,正在频繁进行数据交换,此时服务器性能会大幅下降,必须立即扩容或优化应用。
进阶排查方案:定位隐蔽的内存问题
常规命令能解决大部分显性问题,但在处理内存泄漏或僵尸进程时,需要更专业的手段。

使用 ps 命令批量排序
top 命令的交互模式不适合脚本化输出,可以使用 ps 命令配合 sort 进行排序。
- 命令组合:
ps aux --sort=-%mem | head -n 10 - 原理解析:该命令列出所有进程,并按照内存使用率从高到低排序,显示前 10 行,这有助于快速生成系统快照,便于日志记录和自动化告警。
识别内存泄漏
内存泄漏是指程序申请了内存但未能正确释放,导致系统可用内存持续减少。
- 排查步骤:
- 使用
top或ps锁定可疑进程 PID。 - 进入
/proc/[PID]/map_files或使用pmap -x [PID]命令查看进程的详细内存映射。 - 观察该进程的 RES 值是否随时间线性增长,如果是,则极大概率存在代码级的内存泄漏,需联系开发人员修复代码。
- 使用
理解 Buffer 与 Cache 的专业含义
在执行服务器内存占用率命令时,对 buff/cache 的误解是最大的误区。
- Buffer:主要用于存储磁盘块设备的元数据,是块设备读写的缓存。
- Cache:主要用于存储文件内容的页缓存。
- 优化建议:这两部分内存属于系统优化行为,旨在加速文件读取,如果手动强制释放这部分内存(如执行
echo 3 > /proc/sys/vm/drop_caches),虽然会看到 free 内存激增,但会导致系统文件读取性能在短时间内显著下降。专业的运维策略是让内核自动管理这部分内存,除非在特定测试场景下,否则不建议手动释放。
内存报警阈值设定与优化策略
建立科学的监控体系,比事后排查更有价值。
报警阈值设定原则

- 可用内存监控:建议监控
available指标,当available低于物理内存总量的 10% 时,应触发报警。 - Swap 使用率监控:Swap 的使用是内存紧张的强信号,建议 Swap 使用率超过 20% 时触发报警,超过 50% 时视为严重故障。
OOM Killer 机制解析
当内存耗尽且无法回收时,Linux 内核会触发 OOM Killer,选择一个进程强制杀死以释放内存。
- 查看日志:通过
dmesg或/var/log/messages搜索 “Out of memory” 关键词,可以查看到被杀死的进程信息。 - 调整策略:可以通过调整
/proc/[PID]/oom_score_adj的值(范围 -1000 到 1000),来降低关键业务进程被杀死的概率,数值越小越不容易被选中。
相关问答
问:执行 free 命令时,发现 used 内存非常高,但 available 也很充足,这种情况需要处理吗?
答:不需要处理,这是 Linux 内核的正常优化行为,used 内存高是因为系统将空闲内存用于缓存文件数据,这部分内存实际上是可以随时被回收利用的,只要 available 数值充足,就代表系统有足够的内存供新程序运行,无需进行任何优化操作。
问:服务器出现内存不足导致服务卡顿,但无法立即扩容,有什么临时解决方案?
答:可以采取以下临时措施:使用 top 命令排查并停止非核心的高内存占用进程;如果是非关键业务,可以适当调整 Swap 分区的大小,增加虚拟内存,虽然会降低性能,但能防止系统崩溃;可以临时清理系统缓存(sync; echo 1 > /proc/sys/vm/drop_caches),释放部分被 Cache 占用的内存,但这仅是权宜之计。
如果您在服务器运维过程中有独特的内存优化技巧或遇到过棘手的内存故障,欢迎在评论区分享您的经验。
【版权声明】:本站所有内容均来自网络,若无意侵犯到您的权利,请及时与我们联系将尽快删除相关内容!
发表回复