Search by job, company or skills

5-10 Years
SGD 6,000 - 9,000 per month
Early Applicant
Quick Apply
  • Posted 2 hours ago
  • Be among the first 10 applicants

Job Description

Role Overview

The Observability Engineer leads the enterprise observability and service reliability strategy across infrastructure and application domains. This role drives proactive monitoring, automation, and resilience initiatives to enhance system availability, ensure regulatory compliance, and reduce mean time to resolution (MTTR).

Key Responsibilities

  • Observability Strategy & Governance: Define enterprise observability architecture aligned with operational resilience standards. Deploy and optimize full-stack observability platforms (metrics, logs, traces) and integrate them with ITSM and AIOps systems for predictive alerting.
  • Reliability Engineering & Automation: Implement SRE frameworks, define error budget policies, and codify operational reliability. Automate runbooks, self-healing workflows, and auto-remediation actions using Python, Ansible, and Terraform.
  • Cloud & Platform Observability: Architect and manage telemetry solutions for cloud-native workloads across AWS and Azure, embedding observability into landing zones and CI/CD pipelines via Infrastructure-as-Code (IaC).
  • Operational Excellence: Partner with cross-functional teams to conduct resilience testing, chaos engineering, and capacity validation. Maintain executive dashboards for operational risk indicators and act as a technical advisor during major incidents and audits.

Competencies and Qualifications

  • Technical Background: Qualification in Computer Science, Information Technology, or equivalent practical experience.
  • Domain Experience: Track record in Infrastructure, Cloud, or Site Reliability Engineering (SRE), with experience operating as an SRE subject matter expert, ideally within financial services or regulated environments.
  • Observability Platforms: Hands-on proficiency with tools such as Datadog, Dynatrace, Splunk, or ELK Stack.
  • Automation & Cloud: Expertise in Infrastructure-as-Code and scripting (Terraform, Ansible, Python) alongside cloud observability tooling (AWS CloudWatch/X-Ray, Azure Monitor/Log Analytics).
  • SRE & Compliance: Deep understanding of SRE principles (SLOs/SLAs, error budgets), financial sector operational resilience frameworks (e.g., MAS TRM, DORA), and automated remediation.
  • Certifications: Relevant certifications in observability platforms, IaC, cloud engineering (AWS/Azure), SRE, or ITIL are advantageous.

More Info

Job Type:
Function:
Employment Type:

About Company

About Optimum Solutions, Singapore
www.theoptimum.net
Optimum Solutions (Registration Number: 199700895N) is Singapore's leading Information Technology , Consulting and Professional Services company with Competence in Digital Transformation, Automation, Robotics, Cloud,Big Data, Analytics and Emerging technologies projects. Optimum has been successfully delivering IT projects since 1997 and has been a key IT service provider to clients delivering Software Design, Development, Engineering and IT Transformation Projects.

Job ID: 152428103

Similar Jobs

Singapore

Skills:

JenkinsBitbucketAnsibleRestful ApisJiraKubernetesPythonOpenTelemetryRed Hat OpenShiftAWS EventBridge

Sin Ming, Singapore

Skills:

SolarwindsItsmSplunkAlert ManagementMonitoring

Singapore

Skills:

SolarwindsPython ScriptingKibanaElasticsearchLogstashDynatraceGrafanaElk StackRest ApisOpenTelemetryAWS monitoring services

Singapore

Skills:

Python ScriptingLinuxRegexRest ApisElk StackSdlclog ingestiontelemetry pipelinesGrok filteringparsingAWS monitoring services

Singapore

Skills:

SolarwindsPrometheusDynatraceSplunkGrafanaDatadogAWSServiceNow ITOMAzure monitoring platformsOpenTelemetrycloud monitoring and observability tools

Beware of Scammers

We don’t charge money for job offers