II. MÔ TẢ CÔNG VIỆC:
Phát triển Data Platform
Thiết kế, phát triển và vận hành pipeline dữ liệu từ OMS, WMS, OPS, PostgreSQL, MongoDB, API, SharePoint, Google Drive và object storage.
Chuẩn hóa
kiến trúc Lakehouse theo các lớp Bronze, Silver và Gold, bảo đảm dữ liệu có lineage, khả năng truy vết và tái xử lý
Xây dựng pipeline batch và incremental bằng Python, Airflow và PySpark.
Phát triển luồng CDC/streaming sử dụng Kafka, Kafka Connect/Debezium và PyFlink.
Thiết kế cơ chế watermark, deduplication, idempotency, schema evolution, retry và backfill.
Tối ưu hiệu năng xử lý, chi phí lưu trữ và thời gian cung cấp dữ liệu.
Data Modeling & Data Quality
Thiết kế dimension, fact table và data mart cho các domain đơn hàng, inbound, outbound, tồn kho, hoàn trả, SLA và năng suất vận hành
Xây dựng một nguồn dữ liệu thống nhất giữa nhiều hệ thống và nhiều trung tâm fulfillment.
Thiết lập data contract, kiểm tra schema, completeness, uniqueness, freshness và reconciliation.
Xây dựng monitoring, alerting và quy trình xử lý sự cố pipeline.
Phối hợp với đội sản phẩm và vận hành để thống nhất định nghĩa KPI, tránh sai lệch số liệu giữa các báo cáo.
Vận hành hạ tầng dữ liệu
Triển khai và vận hành workload dữ liệu trên Kubernetes với Airflow Kubernetes Executor, Spark Operator và Flink.
Quản lý cấu hình môi trường, secrets, resource limits, checkpoint, persistent storage và quyền truy cập dữ liệu.
Cải thiện CI/CD cho DAG, Spark job, Flink job và database migration.
Thực hiện troubleshooting từ application, orchestration, computer engine đến database và storage.
Xây dựng runbook, logging, metrics và quy trình khôi phục khi pipeline thất bại.
Dữ liệu
phục vụ kinh doanh
Cung cấp data mart và dataset tin cậy cho dashboard vận hành, tồn kho, SLA, chi phí và năng suất nhân viên.
Tự động hóa các báo cáo Excel, SharePoint và quy trình đối soát đang thực hiện thủ công.
Phát triển dữ liệu near real-time cho control tower và theo dõi hành trình đơn hàng.
Chuyển yêu cầu nghiệp vụ thành mô hình dữ liệu có định nghĩa rõ ràng, dễ sử dụng và dễ kiểm chứng.
Chủ động phân tích nguyên nhân dữ liệu bất thường và đề xuất cải tiến quy trình vận hành.
Technical Ownership
Review code, thiết lập coding convention, testing strategy và tiêu chuẩn phát triển pipeline.
Tài liệu hóa kiến trúc, data lineage, schema, SLA và quy trình vận hành.
Đánh giá công cụ mới dựa trên hiệu quả, chi phí và độ phức tạp vận hành.
Hướng dẫn các kỹ sư khác và đặt nền móng cho việc mở rộng đội ngũ Data.
Chịu trách nhiệm từ thiết kế, triển khai đến vận hành production, không chỉ dừng ở proof of concept.
III. YÊU CẦU CHUYÊN MÔN
Trình độ:
Tốt nghiệp Đại học các ngành: Công nghệ thông tin, Khoa học dữ liệu, Toán - Thống kê hoặc ngành tương đương
Tối thiểu 5 năm kinh nghiệm DataEngineer, trong đó có kinh nghiệm chủ trì xây dựng hệ thống dữ liệu từ đầu (không chỉ vận hành hệ thống có sẵn).
Ưu tiên ứng viên từng làm ở công ty vừa và nhỏ hoặc từng là người đầu tiên xây dựng hạ tầng dữ liệu cho một tổ chức - quen với việc tự ra quyết định kỹ thuật mà không có team lớn hỗ trợ.
Kỹ năng
Từ 5 năm kinh nghiệm Data Engineering hoặc vị trí tương đương.
Thành thạo Python và SQL, có khả năng viết code production, testable và dễ bảo trì.
Có kinh nghiệm thực tế với Apache Airflow và một hệ thống xử lý phân tán như Spark.
Hiểu sâu ETL/ELT, incremental loading, CDC, partitioning, data modeling và query optimization.
Có kinh nghiệm làm việc với PostgreSQL hoặc hệ quản trị cơ sở dữ liệu quan hệ tương đương.
Có khả năng thiết kế pipeline idempotent, hỗ trợ retry, backfill và schema evolution.
Có kinh nghiệm vận hành workload bằng Docker và Kubernetes.
Hiểu data quality, observability, security và quản lý secrets trong production.
Có khả năng phân tích sự cố end-to-end và làm việc độc lập với mức độ ownership cao.
Giao tiếp tốt với cả kỹ thuật và nghiệp vụ; có khả năng chuyển yêu cầu chưa rõ thành giải pháp dữ liệu cụ thể.
Kinh nghiệm với Delta Lake/lakehouse, Kafka, Kafka Connect, Debezium hoặc PyFlink.
Kinh nghiệm với S3-compatible object storage, BigQuery, MongoDB hoặc Oracle.
Hiểu dimensional modeling, star schema và thiết kế data mart.
Kinh nghiệm xây dựng dữ liệu cho logistics, fulfillment, OMS, WMS hoặc e-commerce.
Kinh nghiệm với FastAPI, Pydantic, SQLAlchemy, Alembic hoặc dependency injection.
Có kinh nghiệm xây dựng dashboard bằng Streamlit, Power BI, Metabase, Superset hoặc công cụ BI tương đương.
Kinh nghiệm thiết lập CI/CD, GitOps, monitoring và alerting cho data platform.
Từng giữ vai trò technicalowner hoặc xây dựng/nâng cấp nền tảng dữ liệu trong giai đoạn tăng trưởng.
IV. QUYỀN LỢI
Thời gian làm việc từ thứ 2 - thứ 6 ( 8h - 17h30)
Lương: Thỏa thuận tùy theo năng lực của ứng viên
Xét tăng lương 1 lần/ năm căn cứ vào hiệu quả công việc mang lại.
Phụ cấp ăn trưa: 1 triệu đồng/ tháng
Thưởng tết theo quy chế công ty
BHXH, phép năm theo luật lao động.
Môi trường làm việc trẻ, năng động, thân thiện, văn minh
Nhiều cơ hội được học hỏi, phát triển và thăng tiến tại Onflow.