Ingeniero de Confiabilidad de Sitio (SRE) y Observabilidad

AvantGarde Human Capital Reclutamiento

Ciudad De México, MXonsitePosted Jul 18, 2026
Posting intelligenceActively listedReposted 2×, possible evergreen/ghost posting

Skills

kubernetesprometheuscassandraterraformpagerdutyopsgenieansiblegrafanadatadogpythonkafkacicdgo

About the role

DESCRIPCIóN

Empresa del sector financiero busca un(a) Site Reliability Engineer (SRE) & Observability Engineer con experiencia en ambientes de misión crítica, enfocado en garantizar la disponibilidad, estabilidad y desempeño de plataformas tecnológicas de alta disponibilidad.

¿Cuál será tu misión?

Serás responsable de asegurar la estabilidad y observabilidad de servicios críticos mediante prácticas de Site Reliability Engineering (SRE), liderando iniciativas de monitoreo proactivo, automatización, gestión de incidentes, análisis de causa raíz y mejora continua.

Responsabilidades principales

Diseñar, administrar y evolucionar la plataforma de observabilidad (métricas, logs y trazas).

Definir e implementar indicadores de confiabilidad (SLIs/SLOs) y administrar error budgets.

Liderar la respuesta técnica ante incidentes críticos (Sev1 y Sev2).

Realizar análisis de causa raíz (RCA) y conducir post-mortems.

Automatizar procesos operativos para reducir trabajo manual (toil) y minimizar errores.

Implementar mejoras continuas para incrementar la disponibilidad y resiliencia de los servicios.

Colaborar con equipos de desarrollo, infraestructura y operaciones para fortalecer la confiabilidad de las plataformas.

REQUISITOS

Buscamos profesionales con:

Ingeniería en Sistemas, Computación, Telecomunicaciones o carrera afín. (Título indispensable)

7 años de experiencia en: Site Reliability Engineering (SRE), Observabilidad y monitoreo, Plataformas de misión crítica, Gestión de incidentes mayores, Automatización de operaciones y sistemas distribuidos.

Conocimientos técnicos

Herramientas de observabilidad: Prometheus, Grafana, ELK / OpenSearch, Datadog, New Relic, PRTG, OpenTelemetry y AxonOps (deseable).

Tecnologías: Kubernetes, Apache Cassandra, Kafka, Linux, Bases de datos SQL y NoSQL

Automatización: Python, Bash, Go, Ansible, Terraform y CI/CD

Gestión de confiabilidad: SLIs / SLOs, Error Budgets, PagerDuty u Opsgenie, ITIL v4, ISO 20000

Inglés intermedio-avanzado.

Questions about this role

Click "Apply with AI Applyd" above. We auto-fill the application from your resume and answer screening questions in seconds. No copy and paste, no juggling tabs.

Compensation for DevOps / SRE roles in Mexico varies widely by seniority, employer size, and remote vs onsite arrangement. Check the salary range on this listing when published, or browse our DevOps / SRE hub for Mexico medians across recent openings.

Most applications complete in under 90 seconds. You can track the status in your dashboard and watch the screenshot proof land the moment the application submits.

AI Applyd supports Greenhouse, Lever, Ashby, Workday, iCIMS, SmartRecruiters, Personio, Teamtailor and other major ATS platforms. If we can submit through the platform, we do.

Want AI Applyd to auto-apply to roles like this?

We tailor your resume per posting, fill the forms, and track replies for you.