Thông tin dự án:
Synodus là công ty cung cấp dịch vụ phần mềm, chuyên thiết kế, phát triển và duy trì các hệ thống Data Lakehouse on-premises và Enterprise BI/Data Warehouse cho khách hàng thuộc nhiều lĩnh vực khác nhau. Các dự án chủ yếu tập trung vào triển khai hệ thống on-premises, do đó ứng viên có kinh nghiệm với Oracle Data Warehouse là điểm cộng. Ngoài ra, công ty còn có các dự án với khách hàng trong nước và nước ngoài (thuộc thị trường các nước nói
tiếng Anh), sử dụng công nghệ on-premises hoặc kết hợp cloud.
MÔ TẢ CÔNG VIỆC:
• Xây dựng và tối ưu hóa các pipeline dữ liệu cho khách hàng trong môi trường on premises: Thu thập, xử lý, làm sạch, chuyển đổi dữ liệu và trực quan hóa dữ liệu, đồng thời đảm bảo quản trị và bảo mật dữ liệu theo yêu cầu cụ thể của khách hàng.
• Thiết lập và quản lý cơ sở hạ tầng on-premises để hỗ trợ trích xuất, chuyển đổi và tải dữ liệu hiệu quả từ nhiều nguồn, sử dụng các công nghệ như Apache Spark, Apache Flink, Apache NiFi, Apache Kafka, Hadoop, Minio, K8S/Docker, Trino, Iceberg, v.v.
• Tối ưu hóa quy trình sản xuất và triển khai dữ liệu cho khách hàng: Tự động hóa các quy trình thủ công, cải thiện hiệu suất truyền tải dữ liệu, tái thiết kế cơ sở hạ tầng để tăng khả năng mở rộng và đáp ứng yêu cầu dự án của khách hàng.
• Hợp tác chặt chẽ với khách hàng để hiểu và đáp ứng các yêu cầu cụ thể về hệ thống dữ liệu on premises.
• Làm việc với các chuyên gia dữ liệu và phân tích để nâng cao tính năng và hiệu quả của hệ thống dữ liệu on-premises.
• Phối hợp với đội DevOps để triển khai các dự án dữ liệu on-premises, đảm bảo tính ổn định, hiệu suất cao và bảo mật theo tiêu chuẩn của khách hàng.
Có ít nhất 4 năm kinh nghiệm trong vai trò Data Engineer, với trọng tâm triển khai hệ thống on-premises.
Có tối thiểu 2 năm kinh nghiệm vị trí Leader (đối với apply vị trí Data Engineer Lead)
Có kinh nghiệm với
Software Engineer, đặc biệt liên quan đến triển khai hệ thống dữ liệu on-premises.
Thành thạo ít nhất một trong các ngôn ngữ lập trình: Java, Scala, Python, và nắm vững các khái niệm cốt lõi như lập trình đa luồng, đồng bộ hóa, xử lý cơ sở dữ liệu, xử lý tệp, ghi log, các thuật toán xử lý dữ liệu cơ bản, kiểm thử dữ liệu, v.v.
Có kinh nghiệm với RDBMS (SQL Server, MySQL, PostgreSQL, đặc biệt là Oracle), Linux (bash scripts, firewall,...), Git, Kafka, Spark, Hadoop, Airflow.
Có kiến thức về kiểm thử, lập tài liệu trong các dự án đã thực hiện, đặc biệt trong môi trường on-premises.
Có kinh nghiệm tham gia các dự án Data Lakehouse hoặc Data Warehouse on-premises là lợi thế.
Có kỹ năng tư vấn để đáp ứng các yêu cầu triển khai on-premises.