Why This Role Stands Out
This hybrid Lead Site Reliability Engineer role offers an exciting opportunity to architect and implement critical observability and disaster recovery solutions for a global leader in digital transformation. You'll develop cutting-edge platform-as-code strategies using AWS CDK and TypeScript, making this an ideal position for experienced SREs passionate about scalable infrastructure and deep system visibility. Apply now to shape the future of EPAM's resilient cloud footprint and drive significant impact.
Quick Overview
Job Description
We are seeking a specialized Observability & Infrastructure Engineer to lead the monitoring, telemetry, and platform-as-code initiatives critical to our multi-region disaster recovery roadmap. You will architect and implement robust observability pipelines, ensure deep visibility across our distributed AWS footprint, and codify our monitoring infrastructure using modern tools like Terraform, AWS CDK, and TypeScript.
Req.# Responsibilities Disaster Recovery Observability: Design, deploy, and validate monitoring and telemetry strategies supporting our transition from single-region (us-east-1) to multi-region (us-east-2 pilot-light and future Active-Active) architectures Platform-as-Code (PaC): Manage and automate Datadog configurations (Monitors, Dashboards, Synthetics, SLOs, and composite alerts) and AWS infrastructure using Terraform, AWS CDK, and TypeScript Telemetry & Ingestion Pipelines: Architect and scale high-throughput telemetry ingest pipelines utilizing AWS Lambda, Amazon S3, Amazon Kinesis, and Firehose Observability Pipelines & Routing: Implement and maintain log routing, enrichment, and redaction workflows using OP2 / Vector (Observability Pipelines Worker) alongside Splunk, Google Cloud Platform Pub/Sub sinks, and OpenTelemetry (OTel) AWS-Native Monitoring & Incident Response: Configure comprehensive CloudWatch metrics and alarms for edge, ALB, CloudFront, Route 53, and VPC Lattice, alongside Lambda runtime monitoring and Datadog-to-PagerDuty alert routing Requirements AWS CDK & TypeScript for infrastructure provisioning and automation Agent & Cluster Agent deployment/management Monitors, Dashboards, Synthetics, and SLOs managed via Terraform Advanced constructs: Composite monitors, cardinality management, and retention controls OP2 / Vector (Observability Pipelines Worker) Log routing, enrichment, and redaction Splunk & Google Cloud Platform Pub/Sub sinks; OpenTelemetry standards CloudWatch metrics and alarms (Edge, ALB, CloudFront, Route 53, VPC Lattice) AWS Lambda runtime monitoring & performance tuning PagerDuty integration and alert-to-page wiring from Datadog
Similar jobs
- SA
Lead DevOps Engineer
NewSAIC
MD🇺🇸$200.0k - $240k/yrRemote8 hours agoMongoDBAWSLogstash+7Technology - WO
Sr Software Development Engineer, SRE (US Federal) with Security Clearance
NewWorkday
Reston, VA🇺🇸$163.8k/yrHybridYesterdayDockerAWSSplunk+8Technology - AG
Azure Cloud Platform Engineer with Security Clearance
NewAgensys Corporation
Houston, TX🇺🇸HybridYesterdayAzureGitHub ActionsTerraformTechnology - PS
Mid-Level DevOps Software Engineer, SE2 with Security Clearance
NewPower3 Solutions
Hanover, MD🇺🇸$206k - $239k/yrHybridYesterdayMongoDBLogstashAgile+9Technology - XT
Senior Systems Engineer/Senior DevOps Engineer with Security Clearance
NewX Technologies, Inc
San Antonio, TX🇺🇸HybridYesterdayDockerAnsibleBash+5Technology - ON
Site Reliability Engineer II
NewAuto ApplyOnapsis
Dallas🇺🇸Hybrid14 hours agoOracleAWSTDD+10Technology - NE
Site Reliability Engineer
NewAuto ApplyNebius
Remote - United States🇺🇸$130k - $180k/yrRemote6 hours agoBashPythonTechnology - EL
Senior DevOps Engineer (NOAA badge required)
NewAuto ApplyElement84
Alexandria HQ (remote)🇺🇸Remote14 hours agoDockerDynamoDBSQL+20Technology - CM
Senior AI Platform Engineer
NewAuto ApplyCode Metal
Boston Hub🇺🇸Hybrid4 hours agoAPI GatewayMLflowSalesforce+7Technology - CL
Platform Engineer (Kubernetes), Mid-Level
NewAuto ApplyClera
San Francisco🇺🇸$180k - $210k/yrOn-site15 hours agoService MeshArgoCDGrafana+4Technology - WE
Site Reliability Engineer, Cloud Infrastructure
NewAuto ApplyWeave
Weave - Headquarters (Lehi🇺🇸Remote14 hours agoDockerGCPAnsible+11Technology - CO
Senior Site Reliability Engineer
NewAuto ApplyCoalition, Inc.
Any location🇺🇸Hybrid9 hours agoMicroservicesAWSCapacity Planning+7Technology