Data Engineer - 2YOE+
Hạn nộp hồ sơ: 09/10/2026 (Còn 28 ngày)
Ứng tuyển sớm để được ưu tiên
Kết nối với Nhà tuyển dụng để tìm hiểu thông tin và gia tăng cơ hội trúng tuyển
Nhà tuyển dụng đang online
Thu nhập: Thỏa thuận
Ngành nghề: IT Phần Mềm/CNTT
Địa điểm: Hà Nội
Thời gian ứng tuyển: 30/09/2026
Hiện tại Sapo vận hành LakeHouse trên Cloudera/Hadoop, pipeline orchestrate bằng Airflow, dữ liệu đi qua 3 tầng Raw → Cleansed → Aggregated, truy vấn qua Dremio và ClickHouse, tiêu thụ bằng Power BI và Jupyter.
Sapo đang tìm kiếm Data Engineer tham gia trực tiếp vào việc xây dựng, vận hành và phát triển hệ thống dữ liệu Lakehouse quy mô lớn. Bạn sẽ làm chủ một phần quan trọng của hệ thống dữ liệu, từ thu thập và xử lý dữ liệu nguồn, xây dựng pipeline đến cung cấp dữ liệu phục vụ các báo cáo và hoạt động ra quyết định của Business.
Mô tả công việc
Xây dựng & vận hành Data Pipeline
Xây dựng, vận hành và tối ưu các Data Pipeline thu thập dữ liệu từ nhiều nguồn như SQL Server, PostgreSQL, MySQL vào hệ thống Data Lakehouse.
Thiết kế, phát triển và quản lý workflow/DAG trên Airflow, đảm bảo pipeline hoạt động ổn định, chính xác và hiệu quả.
Xử lý và quản lý dữ liệu xuyên suốt các tầng Raw → Cleansed → Aggregated, đáp ứng nhu cầu khai thác dữ liệu của các phòng ban.
Tối ưu hiệu năng lưu trữ và truy vấn dữ liệu trên các nền tảng như Dremio và ClickHouse.
Theo dõi chất lượng dữ liệu, xây dựng cơ chế kiểm tra, cảnh báo và chủ động xử lý các sự cố liên quan đến Data Pipeline.
Xây dựng và cập nhật các tài liệu kỹ thuật như Data Dictionary, Runbook và tài liệu vận hành nhằm đảm bảo khả năng kế thừa và mở rộng hệ thống.
Bảo mật & vận hành hạ tầng dữ liệu
Tham gia xây dựng và triển khai cơ chế phân quyền truy cập dữ liệu theo nguyên tắc Least Privilege trên các nền tảng Lakehouse, Dremio, ClickHouse và Power BI.
Đảm bảo an toàn cho dữ liệu nhạy cảm thông qua các giải pháp như masking, mã hóa và quản lý thông tin bảo mật (secret) theo tiêu chuẩn, hạn chế hardcode trong hệ thống.
Phối hợp cùng đội ngũ trong việc vận hành và giám sát hạ tầng dữ liệu: dung lượng lưu trữ, tài nguyên xử lý, hiệu năng các Data Job và hệ thống log.
Tham gia xây dựng và thực hiện các quy trình backup, retention, restore và quản lý log phục vụ nhu cầu kiểm toán và vận hành hệ thống.
Phát triển dữ liệu phục vụ Business & báo cáo
Xây dựng và duy trì các báo cáo Power BI ở mức cơ bản, bao gồm Data Model, DAX Measure và các hình thức trực quan hóa dữ liệu phổ biến.
Làm việc trực tiếp với các bộ phận Kinh doanh, Vận hành, Tài chính và Sản phẩm để phân tích nhu cầu, làm rõ bài toán dữ liệu và chuẩn hóa định nghĩa các chỉ số quan trọng.
Xây dựng và cung cấp các Data Set đáng tin cậy, phục vụ hoạt động phân tích và ra quyết định của doanh nghiệp.
Đóng vai trò kết nối giữa hệ thống dữ liệu và nhu cầu thực tế của Business, đảm bảo dữ liệu được khai thác đúng mục đích và mang lại giá trị thực tiễn.
Ứng dụng AI trong khai thác dữ liệu
Nghiên cứu và ứng dụng các công cụ AI/LLM nhằm nâng cao hiệu quả trong quá trình phân tích và xử lý dữ liệu.
Ứng dụng LLM để hỗ trợ sinh và kiểm tra SQL, xử lý dữ liệu phi cấu trúc như ticket hoặc phản hồi khách hàng.
Tham gia xây dựng các công cụ AI đơn giản, hỗ trợ các phòng ban khai thác thông tin và giải đáp những câu hỏi phổ biến dựa trên dữ liệu.
Đảm bảo các kết quả được kiểm tra và xác thực trước khi sử dụng trong báo cáo hoặc phục vụ hoạt động ra quyết định.
Tuân thủ các quy định về bảo mật dữ liệu, đặc biệt đối với việc sử dụng dữ liệu nhạy cảm trên các công cụ và nền tảng AI bên ngoài.
Yêu cầu công việc
Có từ 2-4 năm kinh nghiệm Data Engineer, từng trực tiếp xây dựng và vận hành Data Pipeline trong môi trường Production.
Thành thạo SQL và Python cho xử lý dữ liệu; có kinh nghiệm với Pandas/PySpark và tối ưu truy vấn.
Có kinh nghiệm tự xây dựng, quản lý và vận hành DAG trên Airflow.
Làm việc được với ít nhất 2 trong các hệ quản trị cơ sở dữ liệu: SQL Server, PostgreSQL, MySQL; hiểu về Incremental Extract hoặc CDC.
Có kinh nghiệm hoặc kiến thức vận hành hệ sinh thái Hadoop (HDFS, Hive, Spark) và các nền tảng xử lý/truy vấn dữ liệu như ClickHouse, Dremio hoặc tương đương.
Có khả năng xây dựng báo cáo cơ bản trên Power BI, bao gồm Data Model, DAX, Publish và Refresh.
Có kiến thức cơ bản về bảo mật và vận hành hệ thống: phân quyền, quản lý Secret, xử lý dữ liệu nhạy cảm, Linux và đọc Log.
Đã ứng dụng LLM/AI vào công việc và có khả năng kiểm chứng kết quả; thành thạo Git và quy trình Branch/PR.
Kỹ năng & tư duy
Có tư duy hướng Business, chủ động tìm hiểu mục đích và giá trị của dữ liệu trước khi xây dựng giải pháp.
Có tinh thần chủ động, trách nhiệm và theo sát công việc đến khi hoàn thành.
Có thói quen xây dựng tài liệu, chia sẻ kiến thức và đảm bảo công việc có thể được bàn giao hiệu quả.
Ưu Tiên
Có kinh nghiệm về Cloudera CDP/CDH, Ranger, Data Modeling, dbt,Docker/Kubernetes, CI/CD
Từng có kinh nghiệm làm việc trong lĩnh vực E-commerce, Retail hoặc SaaS.
Có kiến thức về Data Security, AI/LLM (RAG, Text-to-SQL, LangChain, n8n), Machine Learning
Khả năng đọc hiểu tài liệu tiếng Anh là một lợi thế.
Quyền lợi
Thu nhập cạnh tranh, được xem xét và đánh giá định kỳ dựa trên năng lực và hiệu quả công việc.
Hưởng đầy đủ các chế độ, chính sách và phúc lợi theo quy định của Công ty và pháp luật.
Trực tiếp làm việc và phát triển trên hệ thống dữ liệu quy mô thực tế, với khối lượng dữ liệu và bài toán nghiệp vụ đa dạng.
Có cơ hội tham gia sâu vào quá trình xây dựng, vận hành và cải tiến hệ thống Data Lakehouse, không chỉ thực hiện các tác vụ xử lý dữ liệu đơn lẻ.
Được chủ động đề xuất, thử nghiệm và triển khai các giải pháp công nghệ phù hợp với bài toán thực tế.
Có ngân sách và cơ hội tham gia các khóa đào tạo, chứng chỉ hoặc hội thảo chuyên môn nhằm nâng cao năng lực.
Làm việc trực tiếp với các Business Stakeholder từ nhiều phòng ban, phát triển chuyên môn về dữ liệu và hiểu sâu hơn về cách một doanh nghiệp công nghệ vận hành và đưa ra quyết định dựa trên dữ liệu.
Liên hệ
Gửi CV và linkGitHub hoặc mô tả ngắn một pipeline bạn từng xây (nếu có) về email: [protected info]
Mọi thông tin xin vui lòng liên hệ Ms. Trang: [protected info]
Ứng tuyển vị trí: Data Engineer - 2YOE+
Click để tải lên CV của bạn
Tôi đã đọc, đồng ý cho Sapo thu thập, xử lý dữ liệu cá nhân cho mục đích tuyển dụng theo Chính sách bảo vệ dữ liệu cá nhân của Sapo
Ngành nghề: IT Phần Mềm/CNTT
Địa điểm: Hà Nội
Thời gian ứng tuyển: 30/09/2026
Hiện tại Sapo vận hành LakeHouse trên Cloudera/Hadoop, pipeline orchestrate bằng Airflow, dữ liệu đi qua 3 tầng Raw → Cleansed → Aggregated, truy vấn qua Dremio và ClickHouse, tiêu thụ bằng Power BI và Jupyter.
Sapo đang tìm kiếm Data Engineer tham gia trực tiếp vào việc xây dựng, vận hành và phát triển hệ thống dữ liệu Lakehouse quy mô lớn. Bạn sẽ làm chủ một phần quan trọng của hệ thống dữ liệu, từ thu thập và xử lý dữ liệu nguồn, xây dựng pipeline đến cung cấp dữ liệu phục vụ các báo cáo và hoạt động ra quyết định của Business.
Mô tả công việc
Xây dựng & vận hành Data Pipeline
Xây dựng, vận hành và tối ưu các Data Pipeline thu thập dữ liệu từ nhiều nguồn như SQL Server, PostgreSQL, MySQL vào hệ thống Data Lakehouse.
Thiết kế, phát triển và quản lý workflow/DAG trên Airflow, đảm bảo pipeline hoạt động ổn định, chính xác và hiệu quả.
Xử lý và quản lý dữ liệu xuyên suốt các tầng Raw → Cleansed → Aggregated, đáp ứng nhu cầu khai thác dữ liệu của các phòng ban.
Tối ưu hiệu năng lưu trữ và truy vấn dữ liệu trên các nền tảng như Dremio và ClickHouse.
Theo dõi chất lượng dữ liệu, xây dựng cơ chế kiểm tra, cảnh báo và chủ động xử lý các sự cố liên quan đến Data Pipeline.
Xây dựng và cập nhật các tài liệu kỹ thuật như Data Dictionary, Runbook và tài liệu vận hành nhằm đảm bảo khả năng kế thừa và mở rộng hệ thống.
Bảo mật & vận hành hạ tầng dữ liệu
Tham gia xây dựng và triển khai cơ chế phân quyền truy cập dữ liệu theo nguyên tắc Least Privilege trên các nền tảng Lakehouse, Dremio, ClickHouse và Power BI.
Đảm bảo an toàn cho dữ liệu nhạy cảm thông qua các giải pháp như masking, mã hóa và quản lý thông tin bảo mật (secret) theo tiêu chuẩn, hạn chế hardcode trong hệ thống.
Phối hợp cùng đội ngũ trong việc vận hành và giám sát hạ tầng dữ liệu: dung lượng lưu trữ, tài nguyên xử lý, hiệu năng các Data Job và hệ thống log.
Tham gia xây dựng và thực hiện các quy trình backup, retention, restore và quản lý log phục vụ nhu cầu kiểm toán và vận hành hệ thống.
Phát triển dữ liệu phục vụ Business & báo cáo
Xây dựng và duy trì các báo cáo Power BI ở mức cơ bản, bao gồm Data Model, DAX Measure và các hình thức trực quan hóa dữ liệu phổ biến.
Làm việc trực tiếp với các bộ phận Kinh doanh, Vận hành, Tài chính và Sản phẩm để phân tích nhu cầu, làm rõ bài toán dữ liệu và chuẩn hóa định nghĩa các chỉ số quan trọng.
Xây dựng và cung cấp các Data Set đáng tin cậy, phục vụ hoạt động phân tích và ra quyết định của doanh nghiệp.
Đóng vai trò kết nối giữa hệ thống dữ liệu và nhu cầu thực tế của Business, đảm bảo dữ liệu được khai thác đúng mục đích và mang lại giá trị thực tiễn.
Ứng dụng AI trong khai thác dữ liệu
Nghiên cứu và ứng dụng các công cụ AI/LLM nhằm nâng cao hiệu quả trong quá trình phân tích và xử lý dữ liệu.
Ứng dụng LLM để hỗ trợ sinh và kiểm tra SQL, xử lý dữ liệu phi cấu trúc như ticket hoặc phản hồi khách hàng.
Tham gia xây dựng các công cụ AI đơn giản, hỗ trợ các phòng ban khai thác thông tin và giải đáp những câu hỏi phổ biến dựa trên dữ liệu.
Đảm bảo các kết quả được kiểm tra và xác thực trước khi sử dụng trong báo cáo hoặc phục vụ hoạt động ra quyết định.
Tuân thủ các quy định về bảo mật dữ liệu, đặc biệt đối với việc sử dụng dữ liệu nhạy cảm trên các công cụ và nền tảng AI bên ngoài.
Yêu cầu công việc
Có từ 2-4 năm kinh nghiệm Data Engineer, từng trực tiếp xây dựng và vận hành Data Pipeline trong môi trường Production.
Thành thạo SQL và Python cho xử lý dữ liệu; có kinh nghiệm với Pandas/PySpark và tối ưu truy vấn.
Có kinh nghiệm tự xây dựng, quản lý và vận hành DAG trên Airflow.
Làm việc được với ít nhất 2 trong các hệ quản trị cơ sở dữ liệu: SQL Server, PostgreSQL, MySQL; hiểu về Incremental Extract hoặc CDC.
Có kinh nghiệm hoặc kiến thức vận hành hệ sinh thái Hadoop (HDFS, Hive, Spark) và các nền tảng xử lý/truy vấn dữ liệu như ClickHouse, Dremio hoặc tương đương.
Có khả năng xây dựng báo cáo cơ bản trên Power BI, bao gồm Data Model, DAX, Publish và Refresh.
Có kiến thức cơ bản về bảo mật và vận hành hệ thống: phân quyền, quản lý Secret, xử lý dữ liệu nhạy cảm, Linux và đọc Log.
Đã ứng dụng LLM/AI vào công việc và có khả năng kiểm chứng kết quả; thành thạo Git và quy trình Branch/PR.
Kỹ năng & tư duy
Có tư duy hướng Business, chủ động tìm hiểu mục đích và giá trị của dữ liệu trước khi xây dựng giải pháp.
Có tinh thần chủ động, trách nhiệm và theo sát công việc đến khi hoàn thành.
Có thói quen xây dựng tài liệu, chia sẻ kiến thức và đảm bảo công việc có thể được bàn giao hiệu quả.
Ưu Tiên
Có kinh nghiệm về Cloudera CDP/CDH, Ranger, Data Modeling, dbt,Docker/Kubernetes, CI/CD
Từng có kinh nghiệm làm việc trong lĩnh vực E-commerce, Retail hoặc SaaS.
Có kiến thức về Data Security, AI/LLM (RAG, Text-to-SQL, LangChain, n8n), Machine Learning
Khả năng đọc hiểu tài liệu tiếng Anh là một lợi thế.
Quyền lợi
Thu nhập cạnh tranh, được xem xét và đánh giá định kỳ dựa trên năng lực và hiệu quả công việc.
Hưởng đầy đủ các chế độ, chính sách và phúc lợi theo quy định của Công ty và pháp luật.
Trực tiếp làm việc và phát triển trên hệ thống dữ liệu quy mô thực tế, với khối lượng dữ liệu và bài toán nghiệp vụ đa dạng.
Có cơ hội tham gia sâu vào quá trình xây dựng, vận hành và cải tiến hệ thống Data Lakehouse, không chỉ thực hiện các tác vụ xử lý dữ liệu đơn lẻ.
Được chủ động đề xuất, thử nghiệm và triển khai các giải pháp công nghệ phù hợp với bài toán thực tế.
Có ngân sách và cơ hội tham gia các khóa đào tạo, chứng chỉ hoặc hội thảo chuyên môn nhằm nâng cao năng lực.
Làm việc trực tiếp với các Business Stakeholder từ nhiều phòng ban, phát triển chuyên môn về dữ liệu và hiểu sâu hơn về cách một doanh nghiệp công nghệ vận hành và đưa ra quyết định dựa trên dữ liệu.
Liên hệ
Gửi CV và linkGitHub hoặc mô tả ngắn một pipeline bạn từng xây (nếu có) về email: [protected info]
Mọi thông tin xin vui lòng liên hệ Ms. Trang: [protected info]
Ứng tuyển vị trí: Data Engineer - 2YOE+
Click để tải lên CV của bạn
Tôi đã đọc, đồng ý cho Sapo thu thập, xử lý dữ liệu cá nhân cho mục đích tuyển dụng theo Chính sách bảo vệ dữ liệu cá nhân của Sapo
Thông tin chung
- Thu nhập: Thỏa thuận
Việc làm tương tự khác
CÔNG TY CỔ PHẦN CÔNG NGHỆ SAPO - chi nhánh TP HCM
- Địa chỉ công ty: Lầu 3, Tòa Nhà Lữ Gia, Số 70 Lữ Gia, Phường 15, Quận 11, Tp Hồ Chí Minh
- Quy mô: Từ 26 - 100 nhân viên
- Lĩnh vực: IT phần mềm
Thông tin công việc
Vị trí:
Nhân viên
Hình thức làm việc:
Toàn thời gian
Việc làm tương tự
Cảnh báo dấu hiệu lừa đảo tuyển dụng
Đội ngũ hỗ trợ của JobOKO sẵn sàng đồng hành, tư vấn và giới thiệu những cơ hội việc làm phù hợp, giúp Ứng viên tự tin phát triển sự nghiệp và chinh phục mục tiêu nghề nghiệp bền vững.
Hotline CSKH
1900.63.63.84
Công ty Cổ phần JobOKO Toàn cầu
Đội ngũ hỗ trợ của JobOKO luôn chủ động tư vấn các giải pháp tuyển dụng tối ưu, cam kết đồng hành và hỗ trợ Quý Nhà tuyển dụng đạt được hiệu quả tuyển dụng bền vững.
Hotline CSKH
0962.107.888
Công ty Cổ phần JobOKO Toàn cầu