Key Responsibilities
- 数据流水线建设: 设计并开发可扩展的 ETL/ELT 数据流水线,抽取、清洗和转换来自结构化(SQL)与非结构化(日志、文档)源的数据。
- AI/ML 数据准备: 与 AI Engineer 合作,构建 Feature Store(特征商店),支持向量检索与实时机器学习推理的数据供给。
- 数据湖与架构优化: 管理和优化基于 Lakehouse(如 Databricks/Delta Lake)的数据架构,提升超大规模数据集的查询性能。
- 流式数据处理: 基于 Apache Kafka / Spark Streaming 处理高频实时金融交易数据。
- 数据治理与安全: 严格执行 Mashreq 数据安全标准,实施脱敏、列级权限控制(RBAC)及数据质量监控。
Required Qualifications & Skills
- 经验背景: 4+ 年大数据与数据工程经验,具备处理 TB/PB 级别数据量的经验。
- 核心技术: 深入掌握 Python, SQL, PySpark, Scala;熟练掌握 Hive, Delta Lake, Snowflake 或 Redshift。
- 数据组件: 精通 Apache Kafka, Airflow, Databricks, Azure Data Factory。
- 云架构: 熟悉 Azure/AWS 数据服务及 CI/CD 自动化数据部署流水线。