Site Reliability Engineer (SRE) (Santiago)

Site Reliability Engineer (SRE) (Santiago)

02 sep
|
Fondo Autónomo de Protección Previsional
|
Santiago

02 sep

Fondo Autónomo de Protección Previsional

Santiago

Propósito y Valores del FAPP

Propósito: Contribuir a mejorar las pensiones de los trabajadores de Chile, resguardando el financiamiento de incentivos que complementen al ahorro individual a lo largo de generaciones.

Visión: Construir una institución pública robusta y confiable —con independencia, rigor técnico y perspectiva de largo plazo— que cumpla con su mandato de financiamiento de beneficios complementarios dispuestos por la Reforma de Pensiones, para mejorar la calidad de vida de los pensionados de Chile.

Misión: Administrar de manera autónoma, eficiente y transparente los recursos destinados a financiar los beneficios del Seguro Social que complementen las pensiones basadas en ahorro previsional, para aportar a una mayor protección previsional de los pensionados actuales y futuros.

Descripción

Buscamos un(a) Site Reliability Engineer (SRE) para garantizar que los sistemas de AFAPP en producción operen con disponibilidad, estabilidad y trazabilidad. El/la SRE será responsable de la operación continua del ecosistema tecnológico — monitoreo, alertas, gestión de incidentes y respuesta ante fallas — asegurando los estándares de disponibilidad que exige una entidad pública regulada. Este rol es crítico para la operación del ecosistema tecnológico institucional.

Principales responsabilidades o Monitorear la disponibilidad y rendimiento de todos los sistemas en producción, asegurando cobertura continua mediante alertas y dashboards operacionales.

o Responder ante incidentes en producción: detección, contención, escalamiento y resolución,



siguiendo protocolos de gestión de incidentes definidos.

o Participar en la transición de proyectos a producción, validando que los sistemas estén operativamente listos antes del go-live.

o Coordinar con los equipos de infraestructura y ciberseguridad según la naturaleza del incidente.

o Mantener actualizados los registros de incidentes: apertura, seguimiento, resolución y lecciones aprendidas.

o Aportar insumos técnicos de disponibilidad y rendimiento al área de continuidad operacional para la construcción del Plan de Continuidad del Negocio (BCP) y el Plan de Recuperación ante Desastres (DRP).

o Colaborar en la definición y mantención de SLAs técnicos del ecosistema en producción.

o Aportar en la construcción de Dashboards donde se busque tener un enfoque tanto técnico (servicios) como funcional (productos).

Requisitos o Educación

Título profesional en Ingeniería Civil en Computación, Ingeniería Civil Informática, Ingeniería de Sistemas o carreras afines.

o Experiencia:

Mínimo 3 años en operación de sistemas en producción, con foco en observabilidad, monitoreo y gestión de incidentes en entidades reguladas del sector previsional o financiero.

o Habilidades y competencias:





- Capacidad de diagnóstico y resolución bajo presión en entornos productivos.
- Comunicación clara y oportuna ante incidentes, incluyendo escalamiento cuando corresponda.
- Habilidad de sintetizar conclusiones a problemas complejos y presentar soluciones a diferentes stakeholders.
- Disciplina en registro y documentación operacional.
- Buen nivel de inglés (deseable).

o Requisitos específicos:
- Experiencia en Google Cloud Platform (GCP) como infraestructura principal (GKE, Pub/Sub, CloudSql PostgreSQL, Cloud Run, Bigquery)
- Conocimiento de herramientas de observabilidad: métricas, logs, trazas y dashboards operacionales sobre GCP.
- Experiencia en definición y seguimiento de SLIs, SLOs y SLAs en entornos productivos.
- Familiaridad con prácticas de on-call y gestión estructurada de incidentes (ej. runbooks, postmortems).

Conocimientos

- Google Cloud Platform (GCP): servicios de operaciones, monitoreo y logging nativos.
- Programación: conocimientos de infraestructura como código.
- Linux y Stack TCP: conocimientos básicos de sistemas operativos y stack tcp/ip, balanceo y ruteo de tráfico.
- Kubernetes: manejo de clusters, yaml y configuración de deployments.
- Arquitectura: conocimientos básicos de arquitectura de eventos y dominios.
- Github: experiencia en el ciclo de vida de un desarrollo.
- Gestión de incidentes: metodologías de respuesta, escalamiento y análisis postmortem.
- Conceptos de SLI/SLO/SLA y su aplicación en entornos regulados.

📌 Site Reliability Engineer (SRE) (Santiago)
🏢 Fondo Autónomo de Protección Previsional
📍 Santiago

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineer (sre) (santiago) / santiago

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: site reliability engineer (sre) (santiago) / santiago