Tasks:
- * Build scalable ETL/ELT pipelines
- * Implement CI/CD practices
- * Implement data sharding, caching, and monitoring
- * Ingest and process structured and unstructured data
- * Maintain data lineage and reproducibility
- * Manage infrastructure with IaC
- * Optimize distributed data processing
- * Preprocess and validate model training data
Perks/Benefits:
Skills/Tech stack required:
[Apache Flink] [Apache Spark] [Caching] [CI/CD] [Cloud Object Storage] [Data Augmentation] [Data Lakes] [Data Lineage] [Data Preprocessing] [Data Quality] [Data Quality Validation] [Data Sharding] [English] [ETL/ELT] [Feature extraction] [Kubernetes] [Monitoring and Alerting] [Object storage] [Quality validation] [Ray] [Terraform]
Educational requirements:
N/A
Role(s):
[AI Data Infrastructure Engineer] [Data Engineer] [Data Infrastructure Engineer] [Distributed Systems Engineer] [Engineer] [Infrastructure Engineer] [Systems Engineer]