02 ago
|
Falabella Tecnología Corporativo
|
Pudahuel
02 ago
Falabella Tecnología Corporativo
Pudahuel
* Descripción empresa: Somos más de 88 mil personas que cada día trabajamos por el firme Propósito - Simplificar y Disfrutar más la Vida. Estamos presentes en 9 países y compuestos por cinco grandes marcas posicionadas de diversas industrias: Falabella Retail, Sodimac, Banco Falabella, Tottus y Mallplaza. Cada una de éstas nos hace ser quienes somos, y es entre todos, como Un Solo Equipo, que buscamos diariamente reinventarnos y superar las experiencias de nuestros clientes.
Un Equipo lleno de sueños que hace que las cosas pasen. nos atrevemos a emprender e innovar, a tomar riesgos y a generar oportunidades que nos permitan estar siempre a la vanguardia lo que nos lleva a reinventarnos para entregar la mejor experiencia de compra en cualquier punto de encuentro con nosotros.
* Misión del cargo: Implementar de manera segura el producto, se pueda monitorear mediante la observación, además de colaborar con el equipo
* Funciones del cargo: 1. Desempeñar bajo un enfoque proactivo en la detección de problemas, determinación de puntos de mejora y cuellos de botella en el rendimiento de las plataformas, llevando a cabo el análisis de los sistemas, la gestión de la configuración y desarrollar mejoras para el rendimiento, la disponibilidad y la confiabilidad del software del sistema. Con la finalidad de permitir mejora continua en los procesos operacionales del ciclo de
vida del producto y comprender de mejor forma el funcionamiento de ellos y asegurar estabilidad en la producción.
2. Colaborar en la construcción una cultura SRE en toda la organización al compartir mejores prácticas, enfoques, documentación y código con otros equipos de ingeniería, aplicando mecanismos de observabilidad y seguridad.
Para lograr desarrollar un enfoque de comunidad que esté en constante crecimiento en base a conocimientos y experiencias conjuntas
3. Solucionar problemas complicados multiplataforma considerando el sistema operativo, las redes y la base de datos en un contexto On Premise, SaaS, IaaS basado en la nube y manejar incidentes de producción en vivo, depurar/solucionar problemas de aplicaciones e infraestructura, seguir e implementar las mejores prácticas de SRE apalancado por la automatización y disminución del TOIL. Para asegurar la comprensión end to end y lograr soluciones efectivas a las problemáticas.
4. Documentar conocimiento sobre las plataformas a medida que se adquiere con el tiempo, crear runbooks y asegurarse de que la información crítica del sistema esté disponible para aquellos que la necesitan. Para lograr facilidad en el acceso a la información base del producto y con ello asegurar comprensión del mismo en situaciones de crisis (incidentes).
5. Diseñar e implementar mecanismos que permitan definir e implementar niveles de servicio (SLI, SLO y SLA). Con el objetivo de mantener las plataformas disponibles según compromiso, logrando indicadores reales y efectivos.
6. Ser contacto inicial en el proceso de gestión de incidentes,
siendo capaz de utilizar e implementar mejoras en el proceso, aplicar conocimientos sobre Gestión de incidentes tales como análisis post-Mortem. Para asegurar respuesta rápida y efectiva ante problemas en los sistemas productivos.
7. Crear herramientas que apoyen la gestión end to end en el ciclo de vida del producto (software y otros), optimizando y priorizando la implementación y utilización de flujos continuos de despliegue (CI/CD) y aplicando automatización y Scripting a cualquier tarea o parte de las plataformas o que se identifique que realiza manualmente y que permita la identificación temprana de problemas en el código. Con la finalidad de asegurar calidad y velocidad en la puesta en producción de nuevos features y reducir el Toil y los riesgos del trabajo manual
* Requisitos: -+3 años en Observabilidad: Datadog, Prometheus, Grafana, Loki, OpenTelemetry.
-Manejo de herramientas para Infra como codigo y despliegue como: Terraform, Helm, ArgoCD, GitOps.
-+3 años en Programación o Scripting: Bash, Python, GO, Rust
-+3 años de experiencia en Chaos Engineering.
-Expertise en Kubernetes (GKE/EKS), contenedores y networking.
-Experiencia sólida en Cloud: IAM, VPC, Load Balancers, Storage, Compute
-Conocimiento de seguridad en cloud: rotación de claves, OIDC, Vault, políticas IAM.
-Experiencia con bases de datos (relacional, no relacional y en memoria) y cachés distribuidos.
-Capacidad para documentar clara y para liderar mejoras técnicas.
* Condiciones oferta: * Descripción proceso de selección: Súmate a nuestro equipo y se parte de la transformación de Falabella:
1. Postula a la oferta.
2. Revisa tu email.
📌 Senior Site Reliability Software Engineer (Pudahuel)
🏢 Falabella Tecnología Corporativo
📍 Pudahuel