DevOps / SRE IA

Publicada 9 de Septiembre

Objetivo del rol: Responsable de estandarizar y operar las capacidades de CI/CD, calidad de código y plataforma necesarias para el despliegue y operación de soluciones de IA, asegurando continuidad, estabilidad y escalabilidad.


Funciones y responsabilidades:


Homologar y estandarizar pipelines de CI/CD entre las distintas células de desarrollo.

Implementar mecanismos de monitoreo y control de calidad de código.

Automatizar procesos de integración, despliegue y operación de soluciones de IA.

Administrar y operar el AI Gateway en ambientes productivos.

Asegurar la disponibilidad, estabilidad y observabilidad de la plataforma.

Gestionar el traspaso técnico de componentes desarrollados por el AI Engineer, asegurando su correcta operación.

Definir estándares y buenas prácticas de DevOps aplicadas a soluciones de IA.

Trabajar coordinadamente con Tech Leads, AI Engineers y equipos de desarrollo.

Requisitos mínimos

Experiencia como DevOps/SRE (3+ años) con dominio de **CI/CD**, idealmente **Jenkins** (orquestador presente en casi todos los aplicativos de HDI).


- Conocimiento práctico de entornos **multi-cloud** (AWS, Azure, GCP) y de infraestructura on-premise, con foco en portabilidad y evitar dependencia de un solo proveedor.


- Experiencia operando y homologando herramientas de calidad/seguridad de código en pipeline: **SonarQube** y **Dependabot** (o equivalentes).


- Conocimiento de operación productiva de servicios críticos: monitoreo, alertamiento, gestión de incidentes, SLOs/SLIs.


- Familiaridad con conceptos de **gobierno de IA en producción**: gateways de tráfico a LLMs, control de failover entre proveedores, gestión de accesos y cuentas corporativas.


- Conocimiento básico de bases de datos relacionales (Oracle) y de bases vectoriales (PostgreSQL + pgvector) a nivel de operación/mantenimiento.


Experiencia previa operando un **AI Gateway** o proxy de LLMs en producción (autenticación centralizada, métricas de consumo de tokens, políticas de DLP).


- Conocimiento de *semantic caching* (PostgreSQL + pgvector) y de cómo optimizar su performance y tasa de acierto.


- Experiencia construyendo o manteniendo paneles de administración de infraestructura (gestión de cuentas/accesos, métricas de costo por usuario/célula/proyecto).


- Certificaciones cloud (AWS/Azure/GCP) o de SRE.


- Experiencia en homologación de estándares de CI/CD y calidad de código a escala (múltiples equipos/células en simultáneo), no solo un equipo único.


- Experiencia en entornos regulados donde la auditoría de accesos y consumo es un requisito de cumplimiento.