Senior SRE Observability & Reliability Engineer
Quick Overview
Job Description
Role: Senior SRE Observability & Reliability Engineer
Location: Remote
Job Description:
We are seeking a Senior SRE Observability & Reliability Engineer to drive reliability, observability, and operational excellence across enterprise applications and platforms.
This role will assess application health and operational maturity, identify gaps in monitoring, alerting, logging, tracing, and incident management processes, and implement scalable observability solutions that improve system performance, availability, and business outcomes.
The ideal candidate will have extensive experience in Site Reliability Engineering (SRE), Application Performance Monitoring (APM), observability platforms, telemetry engineering, and operational analytics.
Responsibilities include designing and implementing monitoring and telemetry frameworks, optimizing alerting and incident response processes, building executive dashboards and reliability scorecards, establishing SRE governance standards, and driving continuous improvement through data-driven insights.
Key Responsibilities
Assess application reliability, performance, telemetry coverage, and operational maturity. Identify gaps in observability, monitoring, logging, tracing, RCA processes, alerting, and reporting.
Design and implement APM, distributed tracing, structured logging, and telemetry ingestion solutions.
Define and optimize SLIs, SLOs, alerting strategies, and reliability metrics.
Understand business process, lead RCA activities, and establish tagging, compliance, and governance standards.
Develop executive dashboards, scorecards, heatmaps, and operational analytics using Grafana, ServiceNow Performance Analytics, and Power BI.
Build telemetry pipelines and integrate data from Splunk, Dynatrace, AppDynamics, ServiceNow, and cloud platforms.
Develop runbooks, monitoring standards, and SRE best practices to improve operational effectiveness.
Required Skills & Technologies:
Observability & Monitoring: Splunk, Dynatrace, Grafana, AppDynamics, Open Telemetry, ServiceNow Performance Analytics
Programming & Automation: Python, Java, .NET, REST APIs, scripting and automation
Cloud & Infrastructure: Kubernetes, AWS, Google Cloud Platform, Microservices, Container Platforms
Analytics & Reporting: Power BI, ETL/Data Integration, Data Modelling, Dashboard Development, KPI & Scorecard Design
Reliability Engineering: SRE, Incident Management, RCA, Availability Engineering, Service Health Monitoring, Operational Governance
Experience 8–10+ years of experience in SRE, Observability Engineering, Infrastructure Operations, or Application Support.
Proven experience implementing enterprise observability and telemetry solutions.
Strong expertise in executive reporting, reliability scorecards, and operational analytics.
Experience integrating monitoring and telemetry platforms into a unified observability ecosystem.
Strong stakeholder management and communication skills with the ability to translate technical insights into business value.
This role is ideal for a hands-on reliability engineering professional who can combine deep technical expertise with operational leadership to improve application resilience, observability maturity, and service reliability across the enterprise.
Skills
Similar jobs
FULL-TIME Role || Lead Platform Engineer
Tek Pyramids · San Francisco, United States
44 minutes agoData Center SRE
Spotline · Austin, United States
44 minutes agoDevOps Software Engineer (Top Secret with agreement to obtain CI Poly)
North Point Technology · Littleton, United States
45 minutes agoSenior Automation Platform Engineer / DevOps Engineer
Swanktek Inc · Reston, United States
47 minutes agoSenior Network Automation Engineer with Security Clearance
Anduril Industries · Costa Mesa, United States
48 minutes ago$146k - $194k/yrSoftware Engineer - DevOps
iTech US, Inc. · Parsippany-Troy Hills, United States
1 hour ago