VNG
Tóm tắt
Nghiên cứu, xây dựng hệ thống Content Safety & Guardrails: input/output moderation, phát hiện prompt injection & jailbreak, phát hiện và che (redact) PII, kiểm soát chủ đề, giảm thiểu hallucination. Xây dựng hoặc fine-tune các moderation/guard model (classifier, guard model dạng Llama Guard...) tối ưu cho tiếng Việt và đa ngôn ngữ. Thiết kế guardrails framework tích hợp vào pipeline agent/RAG và API serving (NeMo Guardrails, Guardrails AI hoặc tự xây), tối ưu độ trễ của lớp safety. Xây dựng benchmark safety và quy trình red-teaming: bộ dữ liệu đánh giá, adversarial testing tự động, theo dõi attack patterns mới. Cân bằng giữa an toàn và hữu ích: đo lường và giảm over-refusal, tinh chỉnh policy theo từng sản phẩm. Phối hợp với các team sản phẩm và pháp lý để định nghĩa taxonomy và policy nội dung phù hợp với thị trường Việt Nam và quốc tế.
Từ 2 năm (Middle) đến 4+ năm (Senior) kinh nghiệm NLP/ML Engineering; có kinh nghiệm xây dựng hệ thống text classification/moderation hoặc làm việc về LLM safety. Thành thạo Python, PyTorch và hệ sinh thái transformers; có kinh nghiệm fine-tune model phân loại và LLM. Hiểu các attack vector đối với hệ thống LLM: prompt injection, jailbreak, data exfiltration và các kỹ thuật phòng thủ tương ứng. Kinh nghiệm xây dựng dataset (labeling, synthetic data generation) và đánh giá model với trade-off precision/recall theo yêu cầu sản phẩm. Kinh nghiệm đưa model lên production: API, monitoring, đánh giá liên tục. Tiếng Anh đọc hiểu tốt; am hiểu ngôn ngữ và ngữ cảnh văn hóa tiếng Việt là lợi thế lớn.
Đang tải…
Nguồn: careers VNG