
Ingeniero de datos Semi Senior
Publicada 21 de AgostoPropósito del Rol
Diseñar, desarrollar e implementar en producción un motor end-to-end de enriquecimiento de datos que combina ingeniería de datos moderna (Arquitectura Medallón), web scraping seguro y técnicas avanzadas de IA Generativa.
Responsabilidades y Funciones
Motor de Enriquecimiento & LLMs:
Desarrollar en Python un pipeline de dos etapas: extracción de evidencia web con citas y clasificación con reglas de negocio.
Implementar un juez automático de validación previo a la persistencia.
Diseñar, evaluar y versionar prompts mediante la gestión de golden sets etiquetados con usuarios, evaluando métricas por campo en MLflow con iteración disciplinada.
Requisitos mínimos
Arquitectura de Datos (Databricks):
Diseñar e implementar el modelo de datos medallón (Bronze / Silver / Gold) en Unity Catalog, garantizando versionado por material, estados del dato e idempotencia.
Ingestar e integrar datos desde múltiples fuentes a través de las distintas capas.
Orquestación, Apps & Entregables:
Construir paneles en Databricks Apps para validación humana (aprobar/rechazar/publicar) y un chat interactivo de consulta.
Orquestar ejecuciones masivas por lotes con Lakeflow Jobs, incluyendo control de avance, reintentos y gate de costos con AI Gateway.
Configurar Genie Space para consultas de negocio, diseñar layouts de carga masiva, generar documentación técnica/runbooks y capacitar a usuarios finales.
Desplegar mediante pipelines CI/CD (Databricks Asset Bundles) respetando políticas de seguridad (Secret Scopes, Service Principals, permisos UC).
Requisitos Excluyentes
3+ años de experiencia en ingeniería de datos o software usando Python en entornos productivos (código modular/profesional, no solo notebooks).
2+ años de experiencia demostrable en Databricks: Unity Catalog, Delta Lake, Jobs/Workflows y SQL avanzado.
2+ años de experiencia aplicada con LLMs: integración vía API, prompt engineering, salidas estructuradas (JSON/tool calling) y evaluación de calidad con métricas.
Consumo y desarrollo de APIs REST, así como web scraping avanzado con gestión de errores, timeouts y evasión de bloqueos.
Control de versiones con Git y experiencia en DevOps / CI/CD; capacidad de autogestión frente a un backlog con entregas semanales.
Español nativo con excelentes habilidades de comunicación hacia actores de negocio no técnicos, e Inglés técnico fluido de lectura.