Chúng tôi cần tuyển một Data Engineer level Intermediate trở lên làm việc full-time để xây dựng, vận hành và phát triển hệ thống dữ liệu của công ty: từ khâu thu thập dữ liệu từ nhiều nguồn khác nhau, xử lý - tổng hợp, cho đến trình bày dữ liệu
phục vụ cho việc ra quyết định. Công việc cụ thể:
Thiết kế, xây dựng và vận hành data pipeline (ETL/ELT): trích xuất dữ liệu từ nhiều nguồn khác nhau như Google Datastore, MongoDB, PostgreSQL..., xử lý - chuẩn hóa - tổng hợp và lưu vào PostgreSQL làm data warehouse phục vụ báo cáo, phân tích.
Xây dựng và duy trì các job xử lý dữ liệu theo lịch (batch) và/hoặc near real-time, đảm bảo dữ liệu chính xác, đầy đủ, kịp thời.
Thiết kế schema, mô hình dữ liệu (data modeling) cho warehouse/mart phù hợp với nhu cầu báo cáo và phân tích.
Xây dựng, tối ưu và quản trị các dashboard, báo cáo trên Apache Superset (hoặc công cụ BI tương đương), phối hợp với các bộ phận nghiệp vụ để chuyển yêu cầu thành dashboard/biểu đồ hữu ích.
Giám sát pipeline dữ liệu: phát hiện và xử lý sự cố (data quality, missing data, job fail...), thiết lập cảnh báo khi pipeline gặp vấn đề.
Tối ưu hiệu năng truy vấn và lưu trữ trên PostgreSQL: indexing, partitioning, tuning query, quản lý dung lượng.
Đảm bảo bảo mật dữ liệu: kiểm soát quyền truy cập, mã hóa, ẩn dữ liệu nhạy cảm (PII), tuân thủ quy định về dữ liệu người dùng.
Viết tài liệu về data pipeline, data dictionary, quy trình xử lý dữ liệu và tham gia đào tạo lại cho team khi cần.
Phối hợp với đội
Developer, DevOps để triển khai, vận hành các thành phần liên quan đến dữ liệu trên hạ tầng chung (Kubernetes, GCP, Viettel IDC).
Có ít nhất 3 năm kinh nghiệm ở vị trí Data Engineer / Backend Engineer làm việc chuyên sâu về dữ liệu / BI Engineer.
Nắm vững quy trình xử lý dữ liệu end-to-end: từ thu thập, làm sạch, chuẩn hóa, tổng hợp cho đến trình bày; hiểu rõ khái niệm ETL/ELT, data warehouse, data mart, batch vs streaming.
Thành thạo SQL (đặc biệt là PostgreSQL): viết query phức tạp, tối ưu query, hiểu về execution plan, index, partition.
Có kinh nghiệm làm việc với ít nhất 2 trong số các hệ quản trị dữ liệu: Google Datastore/Firestore, MongoDB, PostgreSQL, MySQL hoặc tương đương.
Có kinh nghiệm xây dựng data pipeline bằng ít nhất một trong các công cụ: Apache Airflow, Prefect, Dagster, dbt, Luigi hoặc tương đương. Nếu đã từng tự xây pipeline bằng Python/scheduler cũng được chấp nhận.
Thành thạo Python cho xử lý dữ liệu (pandas, SQLAlchemy hoặc tương đương).
Có khả năng tìm hiểu và nắm bắt nghiệp vụ khách hàng nhanh chóng: chủ động trao đổi với các bộ phận nghiệp vụ / khách hàng để hiểu bản chất bài toán, từ đó chuyển hóa yêu cầu nghiệp vụ thành mô hình dữ liệu và pipeline phù hợp.
Có khả năng đánh giá tính đúng đắn của dữ liệu (data validation / data quality): biết đặt câu hỏi phản biện với số liệu, phát hiện dữ liệu bất thường, đối chiếu chéo giữa các nguồn, xây dựng các kiểm tra tự động (data quality check) để đảm bảo dữ liệu tin cậy trước khi đưa lên báo cáo.
Có tư duy về bảo mật dữ liệu: hiểu về phân quyền, dữ liệu nhạy cảm (PII), mã hóa, audit log; biết cách thiết kế pipeline sao cho hạn chế rủi ro rò rỉ dữ liệu.
Có tư duy tối ưu: biết cách đánh giá và cải thiện hiệu năng pipeline, hiệu năng truy vấn, tối ưu chi phí lưu trữ và tính toán.
Có khả năng đọc hiểu tài liệu
tiếng Anh tốt, có khả năng tự học công nghệ mới.
Cẩn thận, tỉ mỉ với dữ liệu, có tinh thần trách nhiệm cao (vì sai số dữ liệu ảnh hưởng trực tiếp đến quyết định kinh doanh).
Ưu tiên (là lợi thế):
Thành thạo Apache Superset: cấu hình, quản trị, tối ưu dashboard, viết custom chart, tích hợp với các nguồn dữ liệu khác nhau.
Có kinh nghiệm với data modeling cho warehouse (star schema, snowflake schema, dimensional modeling).
Có kinh nghiệm với các công nghệ big data / xử lý dữ liệu lớn: Spark, Kafka, ClickHouse, BigQuery...
Có kinh nghiệm làm việc với hạ tầng cloud (Google Cloud Platform), Docker, Kubernetes.
Có khả năng xây dựng và dẫn dắt team dữ liệu: định hình quy trình, chuẩn hóa cách làm việc, mentor thành viên junior - hướng phát triển thành Data Lead trong tương lai.
Có kinh nghiệm với các công cụ giám sát pipeline / data quality (Great Expectations, Monte Carlo hoặc tương đương).
Mức lương: từ 20.000.000 - 30.000.000 Vnđ (tham khảo mặt bằng Data Engineer Intermediate/Middle tại Hà Nội), có review định kỳ.
Thưởng performance, thưởng dự án.
Có cơ hội thăng tiến lên Senior Data Engineer / Data Lead và được hỗ trợ học tập công nghệ mới, thi chứng chỉ (GCP Data Engineer, dbt, Airflow...).
Được chủ động thiết kế và định hình hệ thống dữ liệu của công ty ngay từ giai đoạn đầu.
Được hưởng đầy đủ các chế độ đãi ngộ với người lao động theo Luật Lao động Việt Nam.
Chế độ đãi ngộ: tham gia BHXH và các chế độ khác theo quy định của Nhà nước.
Thưởng tháng 13, du lịch hàng năm.
Môi trường trẻ trung, năng động.