Ingeniero de datos Semi Senior

Publicada 21 de Agosto

Propósito del Rol


Diseñar, desarrollar e implementar en producción un motor end-to-end de enriquecimiento de datos que combina ingeniería de datos moderna (Arquitectura Medallón), web scraping seguro y técnicas avanzadas de IA Generativa.




Responsabilidades y Funciones


Motor de Enriquecimiento & LLMs:


Desarrollar en Python un pipeline de dos etapas: extracción de evidencia web con citas y clasificación con reglas de negocio.

Implementar un juez automático de validación previo a la persistencia.

Diseñar, evaluar y versionar prompts mediante la gestión de golden sets etiquetados con usuarios, evaluando métricas por campo en MLflow con iteración disciplinada.

Requisitos mínimos

Arquitectura de Datos (Databricks):


Diseñar e implementar el modelo de datos medallón (Bronze / Silver / Gold) en Unity Catalog, garantizando versionado por material, estados del dato e idempotencia.




Ingestar e integrar datos desde múltiples fuentes a través de las distintas capas.




Orquestación, Apps & Entregables:


Construir paneles en Databricks Apps para validación humana (aprobar/rechazar/publicar) y un chat interactivo de consulta.

Orquestar ejecuciones masivas por lotes con Lakeflow Jobs, incluyendo control de avance, reintentos y gate de costos con AI Gateway.

Configurar Genie Space para consultas de negocio, diseñar layouts de carga masiva, generar documentación técnica/runbooks y capacitar a usuarios finales.

Desplegar mediante pipelines CI/CD (Databricks Asset Bundles) respetando políticas de seguridad (Secret Scopes, Service Principals, permisos UC).



Requisitos Excluyentes


3+ años de experiencia en ingeniería de datos o software usando Python en entornos productivos (código modular/profesional, no solo notebooks).

2+ años de experiencia demostrable en Databricks: Unity Catalog, Delta Lake, Jobs/Workflows y SQL avanzado.

2+ años de experiencia aplicada con LLMs: integración vía API, prompt engineering, salidas estructuradas (JSON/tool calling) y evaluación de calidad con métricas.

Consumo y desarrollo de APIs REST, así como web scraping avanzado con gestión de errores, timeouts y evasión de bloqueos.

Control de versiones con Git y experiencia en DevOps / CI/CD; capacidad de autogestión frente a un backlog con entregas semanales.

Español nativo con excelentes habilidades de comunicación hacia actores de negocio no técnicos, e Inglés técnico fluido de lectura.