← 返回文章列表

04 // 正文

运维基础入门指南

运维(Operations)这个岗位听起来神秘,干起来其实很朴素:让系统稳定跑着,坏了快速修好,慢了想办法优化。如果把开发比作"造车",运维就是"车队管家"——管着车的日常保养、故障抢修和路线调度。这篇文章先帮你把"运维到底干什么"讲清楚,再给出一张从系统、网络、脚本到监控、安全、云原生的技能地图。

运维工程师到底在干什么

一句话概括:运维负责保障业务稳定、高效、安全地跑在服务器上。拆开看,主要有七件事:

  • 系统部署与配置:装系统、装服务、写配置,让环境"就位"
  • 监控与告警:盯住健康指标,把故障掐死在摇篮里
  • 性能优化:找到瓶颈,让系统跑得更快更省
  • 故障排除:出事后快速定位、恢复,并复盘根因
  • 安全管理:补丁、加固、防爆破,守住防线
  • 容量规划:预估资源需求,别等高峰期才扩容
  • 备份与恢复:数据必须有两手准备,且恢复流程要真演练过

💡 小知识

运维的终极 KPI 不是"我修得快",而是"压根不出事"。把所有重复的、可以预判的事情自动化,是这份工作的精髓。

必备基础一:操作系统与命令

Linux 是运维的主战场,先把日常高频命令练成肌肉记忆:

  • 文件操作lscdcpmvrm
  • 内容搜索grepfindawksed
  • 进程与资源pstopfreedfdu
  • 服务管理systemctljournalctl
  • 权限与用户chmodchownuseraddsudo

理解文件系统目录结构(/etc 配置、/var 数据日志、/opt 第三方软件)、权限模型(rwx + 用户/组/其他人)和服务管理(Unit 抽象),比背一百条命令更重要。

必备基础二:网络常识

网络是运维的另一条腿,不要求深到抓包逐字节分析,但下面的常识必须有:

  • 协议模型:知道 TCP/IP 分层、TCP 与 UDP 的区别
  • 常用端口:HTTP(80)、HTTPS(443)、SSH(22)、DNS(53)
  • 排查工具pingsstraceroutenslookupcurl
  • 基础设施:路由器、交换机、负载均衡器各自管什么
📌 注意:网络排查有个万能思路:"分层剥离"——先确认链路通不通(ping),再确认端口通不通(ss/telnet),再看应用层报什么错(curl)。一层层往里收,问题无处可藏。

核心技能三件套:脚本、Git、配置管理

当代运维的三件核心武器,缺一不可:

# 1. Shell 脚本:把重复劳动交给机器
#!/bin/bash
set -euo pipefail
echo "磁盘使用率:"
df -h | awk '$5 > 80 {print $1" 使用率过高: "$5}'
uptime
# 2. Git:一切变更留痕
git add .
git commit -m "update nginx config"
git push origin main
  • Shell:自动化一切可自动化的,是效率的起点
  • Git:配置即代码,改了什么、谁改的、能不能回滚,全靠它
  • 配置管理Ansible(SSH 免代理,上手最快)、Puppet / Chef(声明式管理大批机器)

监控与日志:让系统"说话"

监控是运维的眼睛。重点关注四个维度的指标:

类别 指标 工具示例
CPU 使用率、负载、等待时间 tophtopvmstat
内存 使用率、缓存、swap freevmstatatop
磁盘 空间、I/O、使用率 dfiostatiotop
网络 带宽、连接数、延迟 iftopnethogsss

日志管理走三条路:收集(ELK 等集中式)、轮转(logrotate 防撑爆磁盘)、实时看(journalctl / tail -f)。日志不只是排障用的,也是安全审计的依据。

安全运维:守住底线

安全贯穿运维的方方面面,几个基本盘:

  • 访问控制:SSH 用密钥、防火墙白名单、sudo 最小授权
  • 补丁管理:定期更新,修复已知漏洞
  • 入侵检测:Fail2ban、AIDE、Lynis 定期审计
  • 数据加密:传输走 TLS,敏感文件加密存储
  • 备份策略:3-2-1 原则(3 份副本、2 种介质、1 份异地),并且要定期演练恢复

云原生时代的新技能

容器、编排、基础设施即代码正在重塑运维:

  • 容器技术:Docker,应用与环境一起打包
  • 编排工具:Kubernetes,管理成百上千个容器
  • 基础设施即代码:Terraform,服务器也能用代码定义
  • 微服务架构:服务拆分、注册发现、链路追踪、日志聚合

学习路径建议

  1. 基础阶段:Linux 命令行、网络基础、操作系统概念,先把地基打牢
  2. 实践阶段:自己搭服务器、配 Nginx、写脚本,动手比看书快十倍
  3. 进阶阶段:监控告警、自动化工具、安全加固,解决"稳定"问题
  4. 专家阶段:云原生、架构设计、故障复盘,解决"复杂"问题

最佳实践建议

  • 变更先测试:生产环境的任何改动,先在测试机验证
  • 一切留痕:配置、脚本、操作记录都进 Git 或日志
  • 备份要演练:没恢复过的备份约等于没有备份
  • 权限最小化:能不用 root 就不用,能用脚本就不手敲
  • 持续学习:运维技术迭代快,关注行业动态,别停在舒适区
运维是一门实践性极强的学科,理论要靠在真机上反复折腾才能变成直觉。不管工具怎么变,运维的核心始终只有一件事:让业务稳定、高效、安全地运行。

这张地图只画了轮廓,每一块都值得单独深耕。建议按"基础 → 实践 → 进阶 → 专家"的顺序走,并配合本博客的系统管理、网络服务、自动化分类文章逐个击破。工具会过时,但解决问题的能力不会。

相关资源