Thông tin sơ bộ
Viettel Cyber Security (VCS) - Công ty An Ninh Mạng Viettel là đơn vị tập trung thực hiện, nghiên cứu, phát triển chuyên sâu các sản phẩm, giải pháp An toàn thông tin, đồng thời cung cấp sản phẩm, dịch vụ ATTT cho các tổ chức doanh nghiệp lớn trong và ngoài nước. Với thành tích ngăn ngừa hơn 25.000 cuộc tấn công mạng mỗi năm, hỗ trợ quản trị hơn 1.000 websites, 16.000 ứng dụng,
phục vụ hơn 100 khách hàng là các Bộ ngành, các Tập đoàn, doanh nghiệp lớn thuộc lĩnh vực ngân hàng, tài chính, bảo hiểm, chứng khoán..., VCS đang là đơn vị Top 1 về dịch vụ ATTT tại Việt Nam hiện nay.
Link: [protected info]
Consolidated Platform là nền tảng hợp nhất và liên kết dữ liệu từ nhiều sản phẩm An toàn thông tin, giám sát và quản trị hệ thống thông tin trong một tổ chức thành một thể thống nhất. Thế mạnh cốt lõi của sản phẩm là khả năng tập hợp dữ liệu và kết nối chéo giữa các nguồn vốn rời rạc - nhờ đó chuyên gia giám sát/quản trị ATTT và lãnh đạo (C-suite) vừa có bức tranh tổng quan, vừa điều tra được chi tiết mà không phải dùng quá nhiều công cụ.
Data Engineer là người dựng lớp nền dữ liệu cho nền tảng đó: đưa dữ liệu từ nhiều nguồn ATTT rời rạc (giám sát, phát hiện xâm nhập, quản lý tài sản, quản lý lỗ hổng, threat intelligence...) về một lakehouse chung, liên kết chúng lại thành bức tranh thống nhất về tài sản, lỗ hổng và sự kiện an ninh, rồi phục vụ ngược lại cho báo cáo, phân tích và các AI Agent của sản phẩm. Danh mục nguồn dữ liệu sẽ mở rộng dần theo lộ trình sản phẩm và theo từng khách hàng, nên công việc đòi hỏi khả năng biến một nguồn dữ liệu mới thành bảng dữ liệu đạt chuẩn production trong thời gian ngắn mà chất lượng vẫn giữ được.
Vị trí: Data Engineer (Experienced)
Ở level Experienced, bạn làm chủ trọn vẹn pipeline được giao - từ lúc ingest đến khi dữ liệu ra tới ứng dụng - kèm test và kiểm soát chất lượng ở mức cơ bản.
Mô tả công việc
Xây dựng và mở rộng data pipeline
Viết job ingest dữ liệu từ nguồn mới (REST API, file XML/CSV/JSON, Kafka topic) về lakehouse; xử lý incremental load, checkpoint và schema thay đổi theo thời gian.
Chuẩn hoá, clean và dedup dữ liệu về một schema chung; xây logic đối sánh và hợp nhất dữ liệu giữa các nguồn, giải quyết xung đột khi các nguồn mô tả cùng một đối tượng theo cách khác nhau.
Xây serving layer cho ứng dụng và báo cáo (upsert xuống PostgreSQL/MongoDB), đảm bảo dữ liệu ra đúng hạn và khớp với snapshot của nguồn.
Viết và bảo trì DAG điều phối: dependency, retry, backfill, schedule.
Chất lượng dữ liệu và vận hành
Khai báo data expectation cho bảng mình phụ trách (schema, constraint, volume, freshness) và cài test tự động ở biên giữa các layer; xử lý alert khi dữ liệu vi phạm.
Theo dõi job, debug lỗi và các vấn đề hiệu năng thường gặp (data skew, small file, OOM); tối ưu query và cấu trúc bảng.
Viết unit test cho logic transform; theo đúng convention branch/commit, code review và CI của đội.
Phối hợp
Làm việc cùng Product, BI và AI để nắm nhu cầu sử dụng dữ liệu; mô tả dữ liệu (metadata, lineage, data dictionary) để downstream và AI Agent dùng đúng ngữ cảnh, đúng phân quyền.
Yêu cầu công việc
Kiến thức, kỹ năng, kinh nghiệm chuyên môn:
Tối thiểu 2.5 năm kinh nghiệm Data Engineer, đã trực tiếp làm và vận hành pipeline trên production.
Thành thạo SQL nâng cao (window function, CTE, đọc EXPLAIN để tối ưu query) và Python (code có cấu trúc, module tái sử dụng, exception handling, logging, viết test bằng pytest).
Kinh nghiệm xử lý dữ liệu phân tán với Spark (ưu tiên PySpark): hiểu partition, shuffle, join strategy và đọc được Spark UI để tìm bottleneck.
Kinh nghiệm với orchestration tool (ưu tiên Airflow, hoặc Dagster/Prefect): thiết kế DAG, dependency, retry, backfill.
Hiểu
kiến trúc data warehouse/lakehouse: phân tầng dữ liệu, data modeling, incremental load, schema evolution.
Làm việc được với cả SQL và NoSQL (PostgreSQL, MongoDB), object storage chuẩn S3 (MinIO/S3) và Docker.
Có ý thức về data quality: tự kiểm tra null, duplicate, lệch số liệu trước khi bàn giao một bảng cho hệ thống khác dùng.
Ưu tiên
Kinh nghiệm với table format của lakehouse: Apache Iceberg (ưu tiên), Delta Lake hoặc Hudi - time travel, schema evolution, table maintenance.
Kinh nghiệm với query engine phân tán: Trino/Presto.
Kinh nghiệm với data quality framework (Great Expectations, Soda, dbt test) và data catalog / lineage (OpenMetadata, DataHub, Amundsen).
Kinh nghiệm ingest near-real-time qua Kafka; có làm stream processing là lợi thế.
Kiến thức miền ATTT: CVE/CVSS, log SIEM/EDR, quản lý tài sản CNTT, kết quả quét lỗ hổng.
Kinh nghiệm với Kubernetes hoặc cloud (AWS/GCP/Azure).
Học vấn/ Ngoại ngữ:
Ưu tiên tốt nghiệp Đại học chuyên ngành: An toàn thông tin, Công nghệ thông tin, Khoa học máy tính, Toán - Tin... hoặc chuyên ngành liên quan;
Tiếng Anh đọc viết tốt phục vụ công việc.
Vị trí: Senior Data Engineer
Ở vị trí Senior, bạn thiết kế nền tảng dữ liệu sao cho cả đội thêm được nguồn mới nhanh mà chất lượng không đi xuống: định hình chuẩn kỹ thuật cho pipeline, data model và semantic layer phục vụ phân tích và AI Agent, cùng bộ đo chất lượng dữ liệu làm căn cứ để quyết định phát hành. Bạn chịu trách nhiệm về độ tin cậy, hiệu năng và an toàn của nền tảng trên khối dữ liệu ATTT nhạy cảm, đồng thời dẫn dắt và mentor đội ngũ.
Mô tả công việc
Thiết kế kiến trúc và chuẩn kỹ thuật
Thiết kế kiến trúc lakehouse end-to-end cho nhiều tenant: phân tầng dữ liệu, chiến lược partition và tổ chức bảng, data contract giữa các layer.
Chuẩn hoá khung phát triển pipeline (job template, resource profile, cơ chế đăng ký luồng, checkpoint) để thêm một nguồn mới là việc lặp lại được thay vì thiết kế lại từ đầu.
Thiết kế data model và semantic layer (định nghĩa metric, entity, lineage nhất quán) phục vụ báo cáo, phân tích và AI Agent truy vấn dữ liệu.
Chất lượng, độ tin cậy và hiệu năng
Xây hệ đo data quality chạy trên toàn tập ở mỗi lần chạy - không chỉ xác minh bằng vài case mẫu: bộ metric, ngưỡng, quality gate, alert và runbook xử lý.
Sizing tài nguyên dựa trên số đo thật (volume, skew, cardinality) thay vì thử-sai; xử lý các bài toán hiệu năng ở quy mô lớn: data skew, small file, compaction, expire snapshot, chi phí lưu trữ.
Thiết lập data governance: data catalog, lineage, phân loại dữ liệu nhạy cảm, kiểm soát truy cập theo phân quyền.
Đưa CI/CD, test tự động và chuẩn code review vào quy trình phát triển pipeline.
Dẫn dắt và phối hợp
Mentor Data Engineer trong đội, review code và review thiết kế; xác lập ownership cho từng miền dữ liệu.
Đánh giá và chọn công nghệ cho kiến trúc nền tảng; phối hợp Product, AI, BI, Infra để đưa dữ liệu vào sản phẩm.
Yêu cầu công việc
Kiến thức, kỹ năng, kinh nghiệm chuyên môn:
Tối thiểu 5 năm kinh nghiệm mảng dữ liệu/phần mềm, trong đó ít nhất 2 năm thiết kế và vận hành nền tảng dữ liệu quy mô lớn trên production.
Thành thạo Spark tới mức tối ưu được: đọc physical plan, xử lý data skew, kiểm soát partition, shuffle và file size.
Đã thiết kế kiến trúc data warehouse/lakehouse: phân tầng, data modeling, CDC/incremental, versioning và schema evolution.
Kinh nghiệm vận hành orchestration ở quy mô nhiều pipeline: chuẩn hoá DAG, data SLA, backfill, quản lý dependency chéo.
Kinh nghiệm xây hệ thống data quality và observability cho pipeline (metric, alert, lineage).
Kiến thức vững về kiến trúc hệ thống: SQL/NoSQL, container/Kubernetes, message queue, object storage; kỷ luật kỹ thuật phần mềm tốt (testing, CI/CD, code review).
Có kinh nghiệm mentor và định hướng kỹ thuật cho đội.
Ưu tiên
Kinh nghiệm chạy Apache Iceberg trên production: compaction, expire snapshot, migration bảng; tuning Trino/Presto.
Kinh nghiệm xây semantic layer / data model phục vụ AI Agent truy vấn (text-to-SQL, chuẩn MCP).
Kinh nghiệm triển khai data governance framework, data contract, mô hình data ownership.
Kinh nghiệm thiết kế hệ thống dữ liệu multi-tenant và xử lý dữ liệu nhạy cảm theo yêu cầu tuân thủ.
Kinh nghiệm xử lý dữ liệu real-time ở quy mô production (Kafka và stream processing).
Kiến thức tổng quan ngành ATTT.
Học vấn/ Ngoại ngữ:
Ưu tiên tốt nghiệp Đại học chuyên ngành: An toàn thông tin, Công nghệ thông tin, Khoa học máy tính, Toán - Tin... hoặc chuyên ngành liên quan;
Tiếng Anh đọc viết tốt phục vụ công việc.