Senior Site Reliability Engineer (SRE)

Site Reliability Engineering (SRE)ObservabilityPrometheusGrafanaELK StackDatadogMonitoring and AlertingPythonJavaJava 2 Platform Enterprise Edition (J2EE)AngularAkamai Content Delivery Network (CDN)

Description

GSPANN is hiring a Senior Site Reliability Engineer (SRE) to safeguard the uptime and performance of business-critical eCommerce platforms, leading incident response, observability, and automation efforts.

Roles and Responsibilities

  • Manage the availability, reliability, scalability, and performance of business-critical eCommerce applications and services.
  • Lead incident management activities, service restoration efforts, RCA, and postmortem reviews to drive long-term reliability improvements.
  • Design, implement, and optimize observability solutions, including logging, monitoring, metrics, tracing, and alerting frameworks.
  • Build and maintain enterprise monitoring solutions using Prometheus, Grafana, ELK Stack, and Datadog, or equivalent observability platforms.
  • Develop proactive monitoring and alerting strategies to minimize downtime and improve system availability.
  • Implement and maintain automation solutions and operational tooling using Python, Java, J2EE, and Angular.
  • Collaborate with Development, Infrastructure, DevOps, and Operations teams to build resilient, scalable, and highly available system architectures.
  • Ensure system reliability, fault tolerance, and operational excellence by applying SRE best practices.
  • Optimize production environments by applying networking, DNS, load balancing, and security principles.
  • Ensure high-traffic, customer-facing digital and eCommerce platforms perform reliably by monitoring and improving their performance.
  • Manage Akamai CDN configurations to improve application responsiveness and content delivery performance.
  • Support Apache Kafka environments for event-driven and distributed architectures.
  • Build and maintain operational dashboards, runbooks, escalation procedures, and service health reports.
  • Optimize application and infrastructure performance by identifying and resolving bottlenecks.
  • Collaborate with engineering teams to support application deployments, release validation, and platform stability.
  • Drive continuous improvement initiatives focused on automation, observability, monitoring maturity, and platform reliability.
  • Support business continuity and critical incident response by participating in rotational shifts and on-call activities.

Skills and Experience

  • Bring strong experience in SRE supporting large-scale, customer-facing applications.
  • Demonstrate hands-on expertise with observability and monitoring tools such as Prometheus, Grafana, ELK Stack, and Datadog, or similar platforms.
  • Apply expertise in designing and managing enterprise monitoring, alerting, logging, metrics, and distributed tracing solutions.
  • Work with Python, Java, J2EE, or Angular to build automation and operational tooling.
  • Demonstrate solid understanding of Incident Management, Problem Management, RCA, and Postmortem processes.
  • Manage high-availability production environments and mission-critical systems.
  • Bring strong knowledge of Networking, DNS, Transmission Control Protocol/Internet Protocol (TCP/IP), Security, and Load Balancing concepts.
  • Utilize CDN technologies, preferably Akamai, in production environments.
  • Bring experience supporting Apache Kafka and event-driven architectures.
  • Demonstrate familiarity with cloud-native environments, distributed systems, and scalable architectures.
  • Develop automation frameworks that improve operational efficiency.
  • Bring strong troubleshooting, analytical, and problem-solving skills.
  • Demonstrate excellent collaboration and communication skills with cross-functional teams.
  • Work with rotational shift schedules (S1 and S2), including one weekend day per week, following patterns such as Sunday-Thursday or Tuesday-Saturday.
  • Manage on-call rotations and production support for high-priority incidents and escalations, including coverage during public holidays (with compensatory time off) and U.S. public holidays or critical business events requiring night shifts.

Apply Now

PDF or DOCX up to 5MB