
DevOps / SRE IA
Publicada 9 de SeptiembreObjetivo del rol: Responsable de estandarizar y operar las capacidades de CI/CD, calidad de código y plataforma necesarias para el despliegue y operación de soluciones de IA, asegurando continuidad, estabilidad y escalabilidad.
Funciones y responsabilidades:
Homologar y estandarizar pipelines de CI/CD entre las distintas células de desarrollo.
Implementar mecanismos de monitoreo y control de calidad de código.
Automatizar procesos de integración, despliegue y operación de soluciones de IA.
Administrar y operar el AI Gateway en ambientes productivos.
Asegurar la disponibilidad, estabilidad y observabilidad de la plataforma.
Gestionar el traspaso técnico de componentes desarrollados por el AI Engineer, asegurando su correcta operación.
Definir estándares y buenas prácticas de DevOps aplicadas a soluciones de IA.
Trabajar coordinadamente con Tech Leads, AI Engineers y equipos de desarrollo.
Requisitos mínimos
Experiencia como DevOps/SRE (3+ años) con dominio de **CI/CD**, idealmente **Jenkins** (orquestador presente en casi todos los aplicativos de HDI).
- Conocimiento práctico de entornos **multi-cloud** (AWS, Azure, GCP) y de infraestructura on-premise, con foco en portabilidad y evitar dependencia de un solo proveedor.
- Experiencia operando y homologando herramientas de calidad/seguridad de código en pipeline: **SonarQube** y **Dependabot** (o equivalentes).
- Conocimiento de operación productiva de servicios críticos: monitoreo, alertamiento, gestión de incidentes, SLOs/SLIs.
- Familiaridad con conceptos de **gobierno de IA en producción**: gateways de tráfico a LLMs, control de failover entre proveedores, gestión de accesos y cuentas corporativas.
- Conocimiento básico de bases de datos relacionales (Oracle) y de bases vectoriales (PostgreSQL + pgvector) a nivel de operación/mantenimiento.
Experiencia previa operando un **AI Gateway** o proxy de LLMs en producción (autenticación centralizada, métricas de consumo de tokens, políticas de DLP).
- Conocimiento de *semantic caching* (PostgreSQL + pgvector) y de cómo optimizar su performance y tasa de acierto.
- Experiencia construyendo o manteniendo paneles de administración de infraestructura (gestión de cuentas/accesos, métricas de costo por usuario/célula/proyecto).
- Certificaciones cloud (AWS/Azure/GCP) o de SRE.
- Experiencia en homologación de estándares de CI/CD y calidad de código a escala (múltiples equipos/células en simultáneo), no solo un equipo único.
- Experiencia en entornos regulados donde la auditoría de accesos y consumo es un requisito de cumplimiento.