Quick Overview
Salary
$38 - $42/hr
Seniority
Mid Senior
Work mode
Hybrid
Location
Hampton, VA, United States
Posted
Yesterday
AWSC#CloudFormationDatadogGitHub ActionsJavaJenkinsKubernetesPythonTerraformZero Trust
Job Description
Role Summary
The Senior Site Reliability Engineer (SRE) supports complex cloud-based environments with a focus on reliability, resilience, and recoverability. This role leads disaster recovery exercises, validates platform rebuild procedures, develops infrastructure automation, and supports modern deployment practices. The position collaborates with cross-functional engineering teams to enhance platform reliability, improve automation, and support large-scale cloud modernization and continuity initiatives.
Responsibilities
- Support full-lifecycle platform portability and disaster recovery (DR) exercises, including validation of platform rebuild procedures and recovery playbooks.
- Execute infrastructure-level recovery activities and validate the ability to rebuild platforms within established recovery objectives.
- Verify data completeness, integrity, and accuracy during recovery exercises and document findings and remediation recommendations.
- Identify gaps across infrastructure, deployment automation, monitoring, and data recovery processes and collaborate with engineering teams to implement corrective actions.
- Design, implement, and support Infrastructure as Code (IaC) workflows using technologies such as Terraform and AWS CloudFormation.
- Build and maintain standardized CI/CD pipelines and automated deployment processes.
- Manage and optimize Kubernetes clusters and containerized workloads, including provisioning, scaling, and reliability improvements.
- Develop and maintain observability solutions using CloudWatch, Datadog, or comparable monitoring and alerting technologies.
- Develop automation, tooling, and scripts using languages such as Python or Java to reduce manual processes and improve operational consistency.
- Collaborate with platform engineering, security, application, and data teams to support secure, reliable, and consistent platform operations.
- Participate in on-call rotations, root-cause analysis, and incident response activities to improve system resilience and operational effectiveness.
Required Qualifications
- Bachelor’s degree with 7 to 10 years of relevant experience in Site Reliability Engineering, DevOps, cloud engineering, infrastructure engineering, or a related discipline; master’s degree with 5 to 8 years of relevant experience; or equivalent professional experience in lieu of a degree.
- Advanced hands-on experience with AWS services across compute, networking, storage, identity and access management, and serverless technologies.
- Strong experience with Infrastructure as Code technologies such as Terraform and AWS CloudFormation.
- Experience developing CI/CD deployment pipelines and progressive delivery processes using GitHub Actions or comparable technologies.
- Strong knowledge of Kubernetes administration, container orchestration, and containerized deployments.
- Experience validating disaster recovery processes, performing system recovery or rebuild activities, and conducting data integrity checks.
- Experience creating and maintaining dashboards, metrics, logs, and alerts using CloudWatch, Datadog, or comparable observability platforms.
- Proficiency with programming or scripting languages such as Python, Java, C#, or Go.
- Demonstrated ability to troubleshoot complex infrastructure and distributed-system issues, including networking, cascading failures, backpressure, and consistency challenges.
- Strong analytical, problem-solving, documentation, and communication skills.
- Ability to work effectively in a fast-paced environment supporting business-critical systems.
Preferred Qualifications
- Relevant AWS DevOps, DevSecOps, Solutions Architect, SysOps Administrator, Developer, or comparable cloud certifications.
- Kubernetes certifications such as CKA or CKAD.
- Familiarity with Zero Trust security principles and cloud security best practices.
- Experience with GitLab, Jenkins, or comparable CI/CD platforms.
- Experience working within highly regulated or complex enterprise environments.
- Experience supporting large-scale cloud modernization initiatives.
- Experience supporting disaster recovery exercises, continuity planning, platform recovery, or readiness assessments.
Additional Requirements
- Ability to obtain and maintain the required Public Trust determination.
- Ability to participate in an on-call rotation as required.
- Ability to support authorized overtime or non-standard work hours based on business and project requirements.
Similar jobs
- RE
Senior Staff Application Technology Architect – Artificial Intelligence & Machine Learning
NewRenesas Electronics
Morrisville, NC🇺🇸On-site10 hours agoEdge ComputingEmbedded SystemsMachine Learning+7Technology - RE
Senior Staff Application Technology Architect – Artificial Intelligence & Machine Learning
NewRenesas Electronics
Plano, TX🇺🇸On-site10 hours agoEdge ComputingEmbedded SystemsMachine Learning+7Technology - TI

MQ Architect OR MQ Integration Engineer
NewTwo95 International Inc.
United States🇺🇸Remote15 hours agoPackerSVNAWS+9Technology - GE
Application Architect
Genesis10
Plano, TX🇺🇸$64 - $72/hrHybrid4 days agoSQLSplunkHTTP+3Technology - NS
Enterprise Architect II
NewNITYA Software Solutions, Inc.
TX🇺🇸On-siteYesterdayTechnology - SS
Principal Network Architect
NewSSTech LLC
Plano, TX🇺🇸HybridYesterday5GDNSServiceNow+1Technology