Databricks Engineer
hace 2 días
Santa Cruz de Tenerife
Bluetab, an IBM Company. certificados ¡Great Place to Work & Best Work to Place! como una de las mejores compañías para trabajar. Una compañía muy techie que nos ha llevado a ser el brazo fuerte de IBM en Data, Cloud, ML & IA y donde, para empresas clave de diversos sectores, ayudamos a acelerar y optimizar estrategias en plataformas de datos y en la nube, sacando al máximo las ventajas de su arquitectura y entornos de desarrollo. Dentro de nuestra línea estratégica de Cloud Native estamos buscando apasionados/as del Cloud Azure (somos Databricks & Gold Microsoft Partner) para participar en proyectos a nivel nacional e internacional donde podrás ponerte a prueba al máximo. En Bluetab, an IBM Company , llevamos la ingeniería de datos al siguiente nivel . Buscamos un Data Engineer con al menos 4-5 años de experiencia consolidada , que domine Scala, Python o PySpark, desarollando y ejecutando procesos Spark, o sobre Databricks en entornos Cloud . Si te apasiona el mundo del Big Data , disfrutas enfrentándote a retos complejos y te encanta optimizar pipelines de datos a gran escala , esta es tu oportunidad para unirte a un equipo donde la innovación, la escalabilidad y la eficiencia son nuestra hoja de ruta. Desarrollar y optimizar pipelines de datos en Scala, Python o PySpark desarrollando y ejecutando procesos en Spark, o sobre Databricks , garantizando rendimiento, calidad y escalabilidad. Diseñar y construir arquitecturas Data Lake y Data Warehouse en entornos Cloud (Azure mayormente o sino en entornos AWS o GCP). Transformar datos a gran escala mediante Spark, aplicando buenas prácticas de procesamiento distribuido. Optimizar queries y almacenamiento en Databricks , asegurando eficiencia en el consumo de datos y reducción de costos. Integrar múltiples fuentes de datos , asegurando su calidad, consistencia y trazabilidad. Colaborar con equipos multidisciplinares , impulsando la mejora continua en procesos de ingesta, transformación y explotación de datos. Sólida experiencia en desarrollo con Scala o Python o PySpark sobre Spark para procesamiento distribuido. Experiencia con Databricks y conocimiento en arquitecturas Data Lakehouse. Conocimiento en SQL avanzado , optimización de queries y modelos de datos escalables. Experiencia en despliegues y automatización con herramientas como Terraform, Airflow o similares . Familiaridad con entornos Cloud . Mentalidad analítica y enfoque en la eficiencia , optimización y escalabilidad de procesos de datos. Actitud colaborativa y pasión por la innovación , trabajando en equipo para resolver desafíos complejos. Valorable: Inglés - desde nivel B2. • Contrato indefinido con salario competitivo acorde a tu experiencia y conocimientos técnicos., • Teletrabajo flexible , con la opción de trabajar desde nuestra sede en Madrid o en nuestros Hubs de Alicante, Barcelona, Bilbao y Málaga., • Horarios flexibles adaptados a tu vida personal, y jornada intensiva los viernes y en los meses de verano (julio y agosto)., • 23 días de vacaciones para disfrutar y desconectar., • Tarjeta restaurante como beneficio social adicional., • Seguro médico y póliza dental con una amplia cobertura., • Plan de retribución flexible : Transporte y Guardería., • Formación continua gamificada con acceso a más de 1900 cursos y certificaciones oficiales., • Programa de desarrollo de carrera . ¡Serás el dueño de tu crecimiento!, • Un extra de 50€ de regalo en el mes de tu cumpleaños, para celebrarte. Consideramos que la diversidad es enriquecedora y queremos velar por la inclusión e igualdad de oportunidades, por lo que contamos con un Plan de Igualdad y un Código Ético que recoge estos principios para garantizar la no discriminación de nuestras colaboradoras y colaboradores por cuestión de raza, color, nacionalidad, origen social, edad, sexo, estado civil, orientación sexual, ideología, opiniones políticas, religión o cualquier otra condición personal, física o social. Si buscas un entorno desafiante, lleno de innovación y en constante evolución , este es tu sitio. xqbhyrx • Diseño y evolución de la arquitectura Medallion (Bronze → Silver → Gold) sobre Databricks / Delta Lake., • Definición de estándares de ingesta, particionado, compactación y versionado de tablas Delta., • Gobierno de la plataforma: Unity Catalog, gestión de permisos, linaje de datos y calidad (Great Expectations o similar)., • Evaluación y decisión de patrones de procesamiento: batch, micro-batch (Structured Streaming) y near real-time según el caso de uso., • Diseño de modelos dimensionales (esquemas estrella y copo de nieve) orientados a casos de uso de pricing, forecasting y personalización., • Definición de tablas de hechos y dimensiones: transacciones POS, catálogo de productos, maestro de tiendas, calendario promocional., • Colaboración con el equipo de ML para diseñar y mantener el feature store sobre la capa Gold., • Documentación del modelo de datos en un catálogo semántico accesible para usuarios de negocio y analítica., • Construcción de pipelines de ingesta desde fuentes heterogéneas: ERP (SAP u otros), POS, APIs de e-commerce, feeds de Retail Media, NPS., • Uso de Azure Data Factory para orquestación de movimientos de datos entre sistemas origen y el lakehouse — con preferencia por mantener la lógica de transformación en Databricks (PySpark / #J-18808-Ljbffr