1. Phát triển LLM chuyên biệt cho Penetration Testing
Nghiên cứu, lựa chọn và huấn luyện/fine-tune open-source LLM cho các bài toán Cybersecurity và Penetration Testing.
Thực hiện domain adaptation bằng Continued Pretraining, SFT, LoRA/QLoRA, PEFT và các phương pháp post-training phù hợp.
Phát triển năng lực model về vulnerability analysis, code security, HTTP/API analysis, security reasoning và phân tích bằng chứng.
Tập trung xây dựng model có khả năng hiểu ngữ cảnh, hình thành giả thuyết, suy luận từ evidence và đưa ra kết luận có thể kiểm chứng.
2. Xây dựng dữ liệu huấn luyện
Thu thập, làm sạch và chuẩn hóa dữ liệu từ CVE, CWE, OWASP, MITRE ATT&CK, security advisory, pentest/bug bounty report, source code và security logs.
Xây dựng domain corpus, instruction dataset, reasoning dataset, positive/negative samples và synthetic data.
Thiết kế dữ liệu theo từng năng lực cần phát triển của model thay vì chỉ tăng số lượng dữ liệu.
3. Đánh giá và cải thiện Model
Xây dựng benchmark riêng cho từng năng lực: security knowledge, vulnerability detection, classification, reasoning, context understanding và false-positive control.
Đánh giá hallucination, độ chính xác của reasoning và khả năng sử dụng evidence.
Phân tích failure case để xác định lỗi đến từ data, training strategy hay model.
Vận hành vòng lặp: Train → Evaluate → Failure Analysis → Improve Data → Retrain.
1. Kiến thức nền tảng
Python; Machine Learning/Deep Learning; Transformer; tokenization; attention; training/inference.
Hiểu cơ bản về fine-tuning LLM và cách xây dựng/evaluate dataset.
Có khả năng đọc paper, documentation và source code
tiếng Anh.
2. Điểm cộng
Đã sử dụng PyTorch, Hugging Face Transformers/Datasets, PEFT, TRL, Unsloth, vLLM hoặc các framework tương đương.
Đã từng fine-tune LLM, xây dựng dataset hoặc thực hiện experiment về NLP/LLM.
Có kiến thức về Cybersecurity, OWASP, CVE/CWE, Web/API Security hoặc Penetration Testing.
Có project AI/LLM, research hoặc GitHub thể hiện năng lực thực tế.
3. Tư duy
Không chỉ biết chạy framework; cần hiểu model đang thiếu năng lực gì và vì sao.
Biết đặt giả thuyết, thiết kế experiment và dùng benchmark để kiểm chứng.
Có khả năng phân tích failure case và biến lỗi của model thành dữ liệu cho vòng training tiếp theo.
Ưu tiên tư duy nghiên cứu, khả năng tự học và hiểu bản chất hơn số lượng công cụ đã sử dụng.
Được đào tạo, hướng dẫn trực tiếp bởi Mentor nhiều kinh nghiệm; tham gia trực tiếp vào dự án R&D mô hình LLM thực tế thay vì chỉ làm các bài tập mô phỏng.
Cơ hội lên nhân viên chính thức nếu đạt kết quả tốt.
Lịch làm việc linh hoạt full-time/ part-time cho sinh viên để đảm bảo lịch học tại trường.
Môi trường Startup công nghệ trẻ trung, cởi mở, khuyến khích đặt giả thuyết và thử nghiệm cái mới.
Phụ cấp 4 triệu + ăn trưa.