Senior Site Reliability Engineer
Simelabs - An Astek Company
Job Description
Senior Software Engineer / SRE (Observability Focus)
About the Role
As a Senior Software Engineer / Site Reliability Engineer (SRE) – Observability at Aspire, you will play a
key role in enhancing platform reliability, monitoring, and modernization initiatives across our cloudnative environments. This position combines software engineering (60–70%) with site reliability
engineering (30–40%), with a strong focus on Kubernetes, AWS, and observability platforms such as
Datadog. You will design, implement, and maintain scalable monitoring solutions while driving platform
reliability, performance, and operational excellence.
What You'll Do
• Design, implement, and maintain observability solutions using Datadog and related monitoring
technologies.
• Configure and manage dashboards, alerts, APM, metrics, logs, and distributed tracing.
• Monitor and optimize Kubernetes-based, containerized, and microservices-driven applications.
• Integrate observability tools into AWS cloud environments and cloud-native services.
• Build and maintain API integrations to support monitoring and platform automation.
• Integrate observability into CI/CD pipelines to improve deployment visibility and operational
insights.
• Automate monitoring, operational workflows, and repetitive tasks using Python and other
scripting languages.
• Install, configure, and maintain Datadog agents, integrations, and secure platform
configurations.
• Manage API keys, user roles, permissions, and access controls within observability platforms.
• Collaborate with engineering, DevOps, and infrastructure teams to improve platform reliability
and performance.
• Lead proactive maintenance initiatives and continuous platform improvements to enhance
scalability, stability, and operational efficiency.
• Troubleshoot production issues and implement long-term reliability improvements across
distributed systems.
What You'll Need
• 5+ years of experience in Software Engineering, Site Reliability Engineering, or Platform
Engineering.
• Strong proficiency in Python, JavaScript (Node.js), or Java.
• Hands-on experience designing, consuming, and integrating RESTful APIs.
• Strong experience working with Kubernetes, including deployment, operations, and monitoring.
• Experience with Datadog (preferred) or similar observability platforms such as Prometheus and
Grafana.
• Strong understanding of application performance monitoring (APM), logging, metrics, tracing,
dashboards, and alerting.
• Experience monitoring containerized and microservices-based architectures.
• Hands-on experience with AWS cloud services and cloud-native infrastructure.
• Experience integrating observability platforms into AWS environments.
• Experience integrating monitoring and observability into CI/CD pipelines.
• Strong scripting and automation skills, with Python preferred.
• Demonstrated ownership of platform reliability, scalability, and performance improvements.
• Proven ability to lead maintenance activities and drive continuous operational enhancements.
• Strong communication and collaboration skills in distributed, cross-functional teams.
Nice to Have
• Experience owning and operating internal engineering platforms.
• Familiarity with Go (Golang).
• Experience with additional observability platforms such as New Relic, Dynatrace, Elastic, or
Splunk Observability.
• Experience working within highly available, cloud-native production environments.
• Experience supporting globally distributed engineering teams, preferably with APAC/JST time
zone overlap
About the Role
As a Senior Software Engineer / Site Reliability Engineer (SRE) – Observability at Aspire, you will play a
key role in enhancing platform reliability, monitoring, and modernization initiatives across our cloudnative environments. This position combines software engineering (60–70%) with site reliability
engineering (30–40%), with a strong focus on Kubernetes, AWS, and observability platforms such as
Datadog. You will design, implement, and maintain scalable monitoring solutions while driving platform
reliability, performance, and operational excellence.
What You'll Do
• Design, implement, and maintain observability solutions using Datadog and related monitoring
technologies.
• Configure and manage dashboards, alerts, APM, metrics, logs, and distributed tracing.
• Monitor and optimize Kubernetes-based, containerized, and microservices-driven applications.
• Integrate observability tools into AWS cloud environments and cloud-native services.
• Build and maintain API integrations to support monitoring and platform automation.
• Integrate observability into CI/CD pipelines to improve deployment visibility and operational
insights.
• Automate monitoring, operational workflows, and repetitive tasks using Python and other
scripting languages.
• Install, configure, and maintain Datadog agents, integrations, and secure platform
configurations.
• Manage API keys, user roles, permissions, and access controls within observability platforms.
• Collaborate with engineering, DevOps, and infrastructure teams to improve platform reliability
and performance.
• Lead proactive maintenance initiatives and continuous platform improvements to enhance
scalability, stability, and operational efficiency.
• Troubleshoot production issues and implement long-term reliability improvements across
distributed systems.
What You'll Need
• 5+ years of experience in Software Engineering, Site Reliability Engineering, or Platform
Engineering.
• Strong proficiency in Python, JavaScript (Node.js), or Java.
• Hands-on experience designing, consuming, and integrating RESTful APIs.
• Strong experience working with Kubernetes, including deployment, operations, and monitoring.
• Experience with Datadog (preferred) or similar observability platforms such as Prometheus and
Grafana.
• Strong understanding of application performance monitoring (APM), logging, metrics, tracing,
dashboards, and alerting.
• Experience monitoring containerized and microservices-based architectures.
• Hands-on experience with AWS cloud services and cloud-native infrastructure.
• Experience integrating observability platforms into AWS environments.
• Experience integrating monitoring and observability into CI/CD pipelines.
• Strong scripting and automation skills, with Python preferred.
• Demonstrated ownership of platform reliability, scalability, and performance improvements.
• Proven ability to lead maintenance activities and drive continuous operational enhancements.
• Strong communication and collaboration skills in distributed, cross-functional teams.
Nice to Have
• Experience owning and operating internal engineering platforms.
• Familiarity with Go (Golang).
• Experience with additional observability platforms such as New Relic, Dynatrace, Elastic, or
Splunk Observability.
• Experience working within highly available, cloud-native production environments.
• Experience supporting globally distributed engineering teams, preferably with APAC/JST time
zone overlap
If this opportunity aligns with your career goals, kindly share your updated resume with us at hr@simelabs.com
Send your resume to
hr@simelabs.com