GP

Data Engineer - Streaming & Batch Pipelines

Getnet Platforms

Madrid, ESonsitePosted Aug 5, 2026
Posting intelligenceActively listed

Skills

cloudformationclusteringterraformsparkkafkascalacicdemraws

About the role

SE REQUIERE

Experiencia

3+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala.

Estudios

Technical degree-level education: Bachelor's degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar.

Technical skills

Apache Spark con PySpark o Scala: batch y Spark Structured Streaming.

Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas.

Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium.

Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless.

AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso.

Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning.

SQL avanzado y modelado de datos dimensional.

Change Data Capture y Slowly Changing Dimensions.

Git, CI/CD y buenas prácticas de testing en proyectos de datos.

Otras informaciones

Se valorará:

Experiencia con Kafka Streams o ksqlDB.

Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters.

Conocimientos de Terraform o CloudFormation para infraestructura como código.

Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago.

Certificaciones AWS, como Data Analytics Specialty o Solutions Architect.

Buscamos un perfil con capacidad para realizar debugging profundo en sistemas distribuidos, autonomía y mentalidad "you build it, you run it".

RESPONSABILIDADES CLAVE

Diseñar, construir y operar pipelines de ingesta y transformación de datos en tiempo real y por lotes sobre una plataforma AWS nativa de streaming basada en Kafka/Confluent, Spark Structured Streaming y Delta Lake, con foco en fiabilidad, rendimiento y escalabilidad.

Actividades principales

Diseñar, desarrollar y mantener pipelines de streaming con Spark Structured Streaming y procesos batch sobre AWS.

Implementar lógica CDC, joins de enriquecimiento, gestión de checkpoints y offsets, y tratamiento de DLQ.

Integrar y mantener conectores y componentes de Confluent Kafka, incluyendo topics, Schema Registry, particionado y optimización del throughput.

Construir y optimizar tablas Delta Lake mediante particionado, Z-Ordering o Liquid Clustering, compactación, operaciones MERGE/upsert y gestión de esquemas.

Desarrollar y mantener jobs en AWS Glue, incluyendo crawlers, catálogo y procesos ETL, así como funciones AWS Lambda para orquestación y procesamiento event-driven.

Operar y optimizar cargas Spark en EMR y EMR Serverless mediante tuning de memoria, particionado, shuffle, Adaptive Query Execution y resolución de cuellos de botella.

Colaborar con los equipos de Data Science y Machine Learning en la preparación de datasets y pipelines de features para SageMaker.

Diseñar estrategias para gestionar tablas de referencia o lookup a gran escala, utilizando point lookup, caching y particionado para realizar joins de enriquecimiento eficientes.

Implementar monitorización, alertado y mecanismos de resiliencia para pipelines 24/7, incluyendo heartbeats, reintentos y checkpointing.

Evolucionar el framework interno de ETL basado en YAML y Spark, aplicando CI/CD, testing e infraestructura como código.

Questions about this role

Click "Apply with AI Applyd" above. We auto-fill the application from your resume and answer screening questions in seconds. No copy and paste, no juggling tabs.

Compensation for Data Engineer roles in Spain varies widely by seniority, employer size, and remote vs onsite arrangement. Check the salary range on this listing when published, or browse our Data Engineer hub for Spain medians across recent openings.

Most applications complete in under 90 seconds. You can track the status in your dashboard and watch the screenshot proof land the moment the application submits.

AI Applyd supports Greenhouse, Lever, Ashby, Workday, iCIMS, SmartRecruiters, Personio, Teamtailor and other major ATS platforms. If we can submit through the platform, we do.

Want AI Applyd to auto-apply to roles like this?

We tailor your resume per posting, fill the forms, and track replies for you.