个人优势
- 24年互联网基础设施及运维经验,近8年专注AWS、阿里云等云平台、DevOps体系、Kubernetes(k8s)建设及CI/CD自动化快速交付、自动化运维体系建设。具备大型互联网及多AZ架构高可用、高并发生产环境实战经验,从平台角度推动研发效率及稳定性持续提升。
- 擅长及主导过多个云平台从0到1建设,完成Spring Cloud微服务传统架构向Docker架构(含AWS ECS)迁移、Docker架构向Kubernetes(含AWS EKS云原生)架构迁移,k8s平台治理、稳定性治理及监控可观测性平台建设,实现平台标准化。擅长疑难问题分析及解决。
- 核心技术栈:AWS(EKS/EC2/ALB/CDN)、Kubernetes、DevOps、Docker、Linux、Terraform、Jenkins、GitLab CI、GitHub Actions、GitOps、ArgoCD、Harbor、Prometheus、Grafana、Zabbix、ELK、MySQL、Redis、MongoDB、Kafka、PostgreSQL、Minio、Shell。
基本信息
专业技能
云平台与基础设施运维
- 私有云:擅长vCenter、OpenStack H3C CAS等虚拟化及云平台的部署、运维和资源管理,以及 OpenLDAP 统一身份认证体系建设及企业级开源平台(如Gitlab、Confluence、Zimbra、Nextcloud、Phabricator、SonarQube、Archery/Yearning、Minio等)搭建整合。
- 公有云:擅长 AWS、阿里云、腾讯云、华为云、Cloudflare、政务云 等云平台规划及建设,包括 EC2、ECS、EKS、RDS、SLB、ALB、NLB、VPC、Route 53、CloudFront、S3、EFS、ECR、OSS、CDN、WAF、IAM、CloudWatch 等云服务的设计规划、部署及运维管理。具备云上生产环境业务迁移、跨地域部署、弹性扩容、高可用架构设计、灾备建设及灾难恢复演练能力。
容器化与云原生技术
- 容器化:熟悉 Docker 容器技术及容器生命周期管理。熟悉 Dockerfile、Docker Compose 镜像构建与容器编排。熟悉 Harbor 等镜像仓库的部署与运维管理。
- 云原生:具备独立部署 Kubernetes 集群能力。熟悉 Kubernetes 核心组件、网络模型、存储管理及资源调度机制。熟悉 Deployment、StatefulSet、DaemonSet、Ingress、Service、ConfigMap、Secret 等资源对象管理。熟悉 Helm、Metrics Server 等云原生生态组件。
DevOps与自动化运维
- CI/CD持续集成与持续交付:规划 GitLab、Jenkins、Maven、Nexus、NPM、Nacos、ArgoCD 等 DevOps 工具链的部署及运维管理。独立设计和实施 CI/CD 流程,实现代码构建、测试、发布/灰度发布、回滚等自动化交付体系。
- 自动化运维:基于 Ansible、SaltStack、Puppet 等自动化运维工具,编写 Playbook 等实现服务器批量管理、配置管理、应用部署及自动化巡检。基于Terraform管理vCenter私有云及AWS等公有云基础设施。熟悉 Shell、Python、Go 语言开发,可结合 API、SDK 实现运维自动化平台建设及运维工具开发。
监控体系与可观测性建设
- 监控平台:规划 Prometheus、Grafana、Zabbix等监控平台的部署与运维,构建主机、应用、中间件、数据库及业务指标监控体系。
- 日志与链路追踪:基于 ELK(Elasticsearch、Logstash、Kibana)搭建日志平台,利用 SkyWalking、Pinpoint 等 APM 性能监控工具,实现日志采集、链路追踪、性能分析及故障定位。
- 可观测性:实施 Metrics、Logs、Traces 三大可观测性体系建设。落地告警平台对接,实现邮件、短信、钉钉、企业微信、Telegram、飞书等多渠道告警通知。
数据库
- 熟悉MySQL的安装部署、主从复制、读写分离、性能调优、SQL优化、MHA高可用、大表分区、容备恢复、异地同步、数据迁移等。
网络与安全
- 网络设备:熟悉华为等企业级网络、存储设备的VLAN、VPN、ZONE、LUN等配置,具备企业级网络规划、组网实施及故障排查能力。
- 网络安全:熟悉WAF、防火墙、堡垒机、安全审计等运维管理。熟悉Web安全风险及防护、渗透测试、漏洞扫描、入侵检测等。
项目经验
从 0 到 1 建设私有云与 DevOps 平台
项目描述
独立负责公司内网私有云基础设施建设,完成数据中心网络、服务器、虚拟化平台、DevOps平台、监控体系及自动化运维体系建设。
主要职责及项目成果
数据中心与私有云建设
- 负责服务器、存储、交换机、防火墙等基础设施选型与部署。设计企业网络架构、存储架构及安全区域划分。
- 基于 VMware vCenter(Esxi)/Proxmox VE 构建企业级私有云平台。建设无人值守安装系统,实现批量自动化装机。
DevOps平台与自动化运维建设
- 建设DevOps工具链(GitLab/Jenkins/Nexus/SonarQube/Confluence/禅道),基于OpenLDAP实现统一身份认证(SSO),支撑研发。
- 建设 CI/CD 自动化交付平台,实现构建、测试、发布及灰度发布流程自动化。使用 Ansible、Shell、Python、Go 开发自动化运维工具。
可观测性与安全体系建设
- 搭建Prometheus、Grafana、Zabbix、JumpServer、Archery/Yearning等系统,实现运维审计与权限管理。建立安全基线及运维规范。
- 成果:节省云租赁成本约 30%;交付效率提升 60%;MTTR 缩短 50%。
从 0 到 1 建设Kubernetes平台
项目描述
独立负责Kubernetes平台建设与运维管理,实现微服务架构资源调度、服务治理、自动扩缩容、监控告警及安全管理能力。
主要职责及项目成果
Kubernetes平台建设
- 基于kubeadm搭建Kubernetes集群。实现高可用、Calico/Etcd及负载均衡架构设计。负责集群升级、扩容、故障恢复及生命周期管理。
应用交付与服务治理
- 使用 Helm 构建统一部署模板,实现应用标准化发布。实施 HPA 自动扩缩容、资源配额管理及调度优化。
- 基于 Ingress Controller 实现统一流量入口管理及 HTTPS 证书自动化管理。支撑 Spring Cloud 微服务在 Kubernetes 平台稳定运行。
可观测性建设及安全治理
- 搭建Prometheus+Grafana监控,建设ELK/EFK日志平台,实现日志集中采集与分析。建立统一告警平台,实现故障快速发现与定位。
- 实施 RBAC 权限管理体系。配置 Network Policy 网络隔离策略。建立镜像安全扫描及漏洞修复流程。推动容器安全基线建设。
性能优化与故障处理
- 负责资源调优、网络优化及性能分析。处理 Pod 异常、JVM Full GC 导致 Pod 频繁重启、资源竞争等生产问题。优化调度策略,提高资源利用率及平台稳定性。
- 提升应用交付效率与资源利用率。完善监控告警及故障应急响应机制。运维成本降低 30%;MTTR 缩短 50%。
从 0 到 1 建设AWS EKS云原生平台
项目背景
原有Docker架构在弹性扩容及高并发等方面渐显瓶颈,为满足业务持续增长需求,独立负责整体云原生平台规划建设及生产环境迁移。
主要职责及项目成果
云原生架构设计与实施
- 负责AWS生产环境整体架构设计与实施,基于Kubernetes实现容器编排,并结合Aurora Mysql、MSK(Kafka)、DocumentDB(MongoDB)等云原生服务构建高可用、高扩展、高安全的生产环境,包括计算、网络、存储、数据库、容器平台及安全体系建设。
- 基于AWS EKS搭建Kubernetes平台,利用Helm实现标准化部署。设计基于ALB+CloudFront+Route 53+Lambda的全球加速与流量调度。
DevOps与自动化运维
- 结合AWS Cli/Terraform实现环境标准化及配置统一管理。推动应用容器化改造,实现镜像构建、镜像仓库管理及自动化部署。
- 建立基于GitLab、Harbor、ECR、ArgoCD、GO语言自编脚本的CI/CD自动化发布、回滚版本体系。
可观测性建设
- 建设基于 Prometheus、Grafana、CloudWatch、Loki 的统一监控与日志平台,使MTTR下降50%。
- 实现Kubernetes集群、应用服务、数据库、中间件及云资源全链路监控。建立告警分级与故障响应机制,显著缩短线上问题定位时间。
高可用与安全体系建设
- 构建跨可用区(Multi-AZ)高可用架构。实施 IAM、Security Group、VPC 网络隔离等安全控制措施。支撑高并发且可用性达99.95%。
- 建立数据库备份、跨区域灾备及容灾恢复机制。制定并实施RTO/RPO策略及灾难恢复演练。
工作经历
工作总结概览
- 2002–2010:打下 Linux、数据库、网络、DNS、大规模服务器运维基础。
- 2010–2017:在美亚柏科负责大型基础设施(近1000台机架式服务器)、超算中心、GPU 集群和运维体系建设,开始承担团队管理。
- 2018–2024:从传统运维升级到Spring Cloud微服务自动化运维、DevOps、私有云、公有云、容器化,主导CI/CD与Kubernetes落地。
- 2025–2026:聚焦 AWS 云原生,完成 Docker → ECS → EKS 架构演进,具备企业级Kubernetes云平台建设及迁移能力。 最近就职公司均因公司业务调整、架构调整或公司注销而离职。本人更关注平台稳定性及技术方向,薪资可结合岗位综合考虑。
厦门华海云谷数字科技有限公司
技术专家
- 负责AWS生产环境整体规划及架构升级,完成CloudFront+Nginx+Docker向CloudFront+S3+ALB+ECS,再到CloudFront+ALB+EKS云原生架构的演进与优化,包括 VPC、IAM、EKS、ALB、CloudFront、Aurora、MSK、DocumentDB、S3、ECR、CloudWatch 等核心服务。
- 负责8个AWS账号9套 Kubernetes(Amazon EKS)平台建设,熟练使用AWS Cli或Terraform(Iac)进行运维管理,包括集群部署、自动扩容升级、网络治理、Ingress管理、证书管理、Secret管理及应用生命周期管理,实现多AZ高可用,保障业务高可用及支撑高并发。
- 建设并维护GitLab CI /GitOps(ArgoCD)标准化自动交付体系,实现持续集成、自动化测试、安全扫描及零停机发布,发布效率提高90%。建设 Prometheus、Grafana、CloudWatch、Loki 等可观测性平台,实现全链路监控、日志分析及告警管理,MTTR下降50%。
厦门屯粮积草网络科技有限公司
高级运维工程师
- 负责python及java多平台MySQL、MongoDB、Redis、Kafka、RabbitMQ、Nacos、Seata、Canal、Elasticsearch、MinIO等运维。
- 建立CI/CD自动化交付体系,完善监控平台及运维规范建设。推动数据库安全治理,实施生产库只读访问控制及Archery数据脱敏管理。
- 持续进行MySQL参数调优、慢SQL优化、python及其组件迭代升级优化,解决高并发系统宕机问题,提升系统稳定性及并发处理能力。
- 负责录音模块重构开发,加载耗时17.1s→564ms;负责Go语言开发网络质量测试工具,为呼叫中心网络优化及故障分析提供数据支撑。
联生活(厦门)科技集团有限公司
运维工程师
- 负责 Spring Cloud 微服务平台建设与运维,管理 MySQL、Redis、Nacos、RocketMQ、SkyWalking、Sentinel、XXL-Job 等核心组件。
- 建设CI/CD自动化发布体系,实现灰度发布及自动化交付。建立Prometheus、Grafana、Zabbix多维度监控体系,实现业务监控与预警。
- 搭建 Harbor、Rancher等云原生管理平台,主导公司容器化改造,推动业务系统平稳迁移至 Kubernetes 环境。
厦门海西医药交易中心有限公司
运维主管
- 运维体系与SOP:从零开始设计 CI/CD 流水线的经验,Kafka/ELK/FastDFS/Doris/TiDB大数据平台,完善监控告警,效率提升约 35%。
- 平台与稳定性:多云(私有云+阿里云+腾讯云+政务云) + 微服务组件运维与故障响应,保障 7×24 稳定运行。
- 交付自动化与合规:医保行业项目多环境交付,交付周期缩短约 90%;参与 ISO9001/CMMI4/等保2.0 落地。运维团队管理(5人)。
早期工作概览
贰叁肆玖 / 美亚柏科(7年) / 网宿科技 / 东南融通(6年) / 重庆热点 / 数字引擎
- 从事Linux系统运维、网络安全及Web应用开发,积累了服务器批量部署、监控体系建设、java网站运维及自动化运维的基础能力,服务器安全配置规范初具雏形,具备丰富的故障排除、优化、备份、迁移等经验,为后续大型互联网及云平台运维工作奠定技术基础。
- 代表成果:公司权威DNS平台遭受超大规模DDoS攻击,完成架构重构并恢复业务,挽回损失 400万+,获得东南融通集团级通报表彰。
- 美亚柏科:主导信息安全整改与漏洞治理,安全事件发生率降约70%,参与公司官网、法眼视频分析系统等多个平台的安全渗透测试。