GSPANN is hiring a Senior Site Reliability Engineer (SRE) to safeguard the uptime and performance of business-critical eCommerce platforms, leading incident response, observability, and automation efforts.
Description
Roles and Responsibilities
- Manage the availability, reliability, scalability, and performance of business-critical eCommerce applications and services.
- Lead incident management activities, service restoration efforts, RCA, and postmortem reviews to drive long-term reliability improvements.
- Design, implement, and optimize observability solutions, including logging, monitoring, metrics, tracing, and alerting frameworks.
- Build and maintain enterprise monitoring solutions using Prometheus, Grafana, ELK Stack, and Datadog, or equivalent observability platforms.
- Develop proactive monitoring and alerting strategies to minimize downtime and improve system availability.
- Implement and maintain automation solutions and operational tooling using Python, Java, J2EE, and Angular.
- Collaborate with Development, Infrastructure, DevOps, and Operations teams to build resilient, scalable, and highly available system architectures.
- Ensure system reliability, fault tolerance, and operational excellence by applying SRE best practices.
- Optimize production environments by applying networking, DNS, load balancing, and security principles.
- Ensure high-traffic, customer-facing digital and eCommerce platforms perform reliably by monitoring and improving their performance.
- Manage Akamai CDN configurations to improve application responsiveness and content delivery performance.
- Support Apache Kafka environments for event-driven and distributed architectures.
- Build and maintain operational dashboards, runbooks, escalation procedures, and service health reports.
- Optimize application and infrastructure performance by identifying and resolving bottlenecks.
- Collaborate with engineering teams to support application deployments, release validation, and platform stability.
- Drive continuous improvement initiatives focused on automation, observability, monitoring maturity, and platform reliability.
- Support business continuity and critical incident response by participating in rotational shifts and on-call activities.
Skills and Experience
- Bring strong experience in SRE supporting large-scale, customer-facing applications.
- Demonstrate hands-on expertise with observability and monitoring tools such as Prometheus, Grafana, ELK Stack, and Datadog, or similar platforms.
- Apply expertise in designing and managing enterprise monitoring, alerting, logging, metrics, and distributed tracing solutions.
- Work with Python, Java, J2EE, or Angular to build automation and operational tooling.
- Demonstrate solid understanding of Incident Management, Problem Management, RCA, and Postmortem processes.
- Manage high-availability production environments and mission-critical systems.
- Bring strong knowledge of Networking, DNS, Transmission Control Protocol/Internet Protocol (TCP/IP), Security, and Load Balancing concepts.
- Utilize CDN technologies, preferably Akamai, in production environments.
- Bring experience supporting Apache Kafka and event-driven architectures.
- Demonstrate familiarity with cloud-native environments, distributed systems, and scalable architectures.
- Develop automation frameworks that improve operational efficiency.
- Bring strong troubleshooting, analytical, and problem-solving skills.
- Demonstrate excellent collaboration and communication skills with cross-functional teams.
- Work with rotational shift schedules (S1 and S2), including one weekend day per week, following patterns such as Sunday-Thursday or Tuesday-Saturday.
- Manage on-call rotations and production support for high-priority incidents and escalations, including coverage during public holidays (with compensatory time off) and U.S. public holidays or critical business events requiring night shifts.