Mô tả công việc
- Tham gia khảo sát, phân tích yêu cầu, thiết kế và triển khai các hệ thống dữ liệu lớn, kho dữ liệu, Data Lake/Lakehouse cho các dự án chuyển đổi số.
- Triển khai, cấu hình và vận hành các thành phần trong hệ sinh thái Big Data mã nguồn mở Apache như Hadoop, HDFS, Spark, Hive, Kafka, NiFi, Airflow và các công nghệ liên quan.
- Xây dựng pipeline thu thập, tích hợp, đồng bộ và xử lý dữ liệu từ nhiều nguồn: cơ sở dữ liệu quan hệ, API, file dữ liệu, log hệ thống, dữ liệu batch, streaming hoặc near real-time.
- Thiết kế và phát triển các luồng ETL/ELT phục vụ làm sạch dữ liệu, chuẩn hóa dữ liệu, kiểm soát chất lượng dữ liệu, đối soát dữ liệu và chuyển đổi dữ liệu theo yêu cầu nghiệp vụ.
- Tham gia thiết kế các lớp dữ liệu trong
kiến trúc Lakehouse: dữ liệu thô, dữ liệu đã chuẩn hóa, dữ liệu phục vụ phân tích, báo cáo và khai thác nghiệp vụ.
- Xây dựng kho dữ liệu, data mart, mô hình dữ liệu, dataset phục vụ BI, dashboard điều hành, báo cáo quản trị và các nhu cầu phân tích dữ liệu.
- Tối ưu hiệu năng xử lý dữ liệu, truy vấn dữ liệu, phân vùng dữ liệu, dung lượng lưu trữ và tính ổn định của hệ thống trong quá trình triển khai/vận hành.
- Phối hợp với BA, BI
Developer, đội
phát triển phần mềm, DevOps, hạ tầng, bảo mật và các bên nghiệp vụ/khách hàng để triển khai hệ thống trên môi trường thử nghiệm và production.
- Xây dựng tài liệu kỹ thuật, tài liệu thiết kế, tài liệu cài đặt/vận hành, tài liệu bàn giao và hướng dẫn khai thác hệ thống dữ liệu.
- Nghiên cứu, đề xuất và áp dụng các công nghệ mới trong lĩnh vực Big Data, Data Engineering, Data Lakehouse, Data Governance, BI/Analytics.
Yêu cầu
- Tốt nghiệp đại học chuyên ngành CNTT, Khoa học máy tính, Hệ thống thông tin, Khoa học dữ liệu hoặc các chuyên ngành liên quan.
- Tối thiểu 2 năm kinh nghiệm làm việc trong lĩnh vực Big Data, Data Engineering, kho dữ liệu, xử lý dữ liệu hoặc các vị trí tương đương.
- Có kinh nghiệm thiết kế, xây dựng và vận hành pipeline ETL/ELT; hiểu các nguyên tắc thu thập dữ liệu, làm sạch dữ liệu, chuẩn hóa dữ liệu và kiểm soát chất lượng dữ liệu.
- Có kinh nghiệm với các công nghệ Big Data/Data Platform:
· Hadoop, HDFS, YARN;
· Apache Spark, Spark SQL, PySpark hoặc Scala Spark;
· Apache Hive, Trino/Presto, Impala hoặc các công cụ truy vấn dữ liệu lớn tương đương;
· Apache Kafka, Kafka Connect hoặc các nền tảng xử lý dữ liệu streaming/near real-time;
· Apache NiFi, Apache Airflow hoặc các công cụ xây dựng, điều phối luồng dữ liệu;
· Apache Iceberg, Delta Lake, Apache Hudi hoặc các công nghệ phục vụ kiến trúc Lakehouse;
· MinIO/S3, PostgreSQL, ClickHouse, Elasticsearch hoặc các hệ lưu trữ/phân tích dữ liệu liên quan.
- Có kiến thức về Data Warehouse, Data Lake, Lakehouse, Data Mart; nắm được mô hình dữ liệu phục vụ phân tích như star schema, snowflake schema, fact/dimension table.
- Có khả năng sử dụng SQL tốt; biết tối ưu truy vấn, tối ưu phân vùng dữ liệu và xử lý dữ liệu khối lượng lớn.
- Có kinh nghiệm lập trình xử lý dữ liệu bằng Python, Java hoặc Scala là lợi thế.
Quyền lợi
- Mức lương thỏa thuận, cạnh tranh với thị trường.
- Phụ cấp xăng xe, điện thoại, trang phục,... hàng tháng.
- Các chế độ BHXH, BHYT, nghỉ phép, chế độ khám sức khỏe hàng năm đầy đủ theo quy định của Công ty và pháp luật.
- Thưởng tháng lương thứ 13, thưởng hiệu suất kinh doanh, thưởng KPI theo hiệu quả công việc.
- Thưởng các ngày sinh nhật, lễ, Tết (Sinh nhật Công ty, 30/4-1/5, 2/9, Tết dương lịch,...)
- Tham gia các hoạt động văn hóa nội bộ, team building, nghỉ mát hàng năm.
- Làm việc trong môi trường chuyên nghiệp, trẻ trung, năng động.
- Tham gia vào dự án quy mô lớn, có ảnh hưởng và tính ứng dụng cao, tiếp cận công nghệ, hạ tầng và giải pháp hiện đại.
Thông tin khác
Thời gian làm việc
Thứ 2 - Thứ 6 (từ 08:30 đến 17:30)
Thông tin chung
Nơi làm việc
- Hà Nội: Số 28 Trần Bình, Phường Cầu Giấy (quận Cầu Giấy cũ)
- Quảng Ninh: (Tất cả phường)