VNG
AI tóm tắt
Skills bắt buộc
Mô tả công việc Chúng tôi đang tìm kiếm Senior Inference Engineer có nền tảng vững về software engineering, distributed systems và performance optimization để xây dựng và tối ưu inference engine cho các hệ thống LLM serving quy mô lớn. Bạn sẽ làm việc ở cả research và production, đảm bảo các hệ thống LLM serving của chúng tôi nhanh, có khả năng mở rộng và hiệu quả. Công việc trải rộng xuyên suốt inference stack — từ kernel và runtime đến scheduling, memory management và distributed execution.
Trách nhiệm chính Profile, benchmark và phân tích bottleneck cho các workload LLM inference xuyên các tầng: kernel, memory, networking, scheduler Tối ưu các inference engine (vLLM, SGLang, TensorRT-LLM) về throughput, latency, memory efficiency, GPU utilization và chi phí Triển khai và tinh chỉnh các kỹ thuật tối ưu inference: batching, KV-cache management, quantization, speculative decoding, parallelism strategies, disaggregated serving Xây dựng instrumentation và profiling tooling để phát hiện bottleneck Đảm bảo độ tin cậy cho inference pipeline: A/B launches, rollback, model versioning, fault tolerance Phối hợp với đội Platform Engineering để cải thiện serving architecture dựa trên các phát hiện về hiệu năng Ghi chép và chia sẻ kinh nghiệm, đóng góp vào best practices nội bộ và các dự án AI open-source khi có thể Yêu cầu Bắt buộc:
Tối thiểu 5 năm kinh nghiệm ở vị trí Software Engineer, Performance Engineer hoặc tương đương. Nền tảng vững về Software Engineering, Software Architecture và Distributed Systems. Thành thạo ít nhất một trong các ngôn ngữ Python, Go hoặc C++. Có kinh nghiệm phát triển hoặc tối ưu các hệ thống distributed, high-throughput backend hoặc large-scale serving systems. Có kinh nghiệm benchmark, profiling và performance tuning trên môi trường production Có khả năng phân tích bottleneck về CPU, Memory, Network hoặc Storage . Có tư duy hệ thống tốt, khả năng phân tích Root Cause Analysis và giải quyết các bài toán hiệu năng phức tạp. Có tinh thần ownership và khả năng làm việc độc lập.
Điểm cộng Có kinh nghiệm với Linux internals, kernel tuning hoặc custom Linux kernel. Có hiểu biết về GPU Architecture hoặc CUDA Programming Có kinh nghiệm với AI/ML Serving Systems hoặc LLM Inference.- Đã làm việc với một trong các inference engine như vLLM, SGLang, TensorRT-LLM hoặc Triton Inference Server Có hiểu biết về batching, KV Cache, quantization, speculative decoding, tensor/pipeline parallelism hoặc disaggregated serving. Có kinh nghiệm với NVIDIA inference stack (TensorRT, Triton, CUTLASS, NCCL, cuBLAS, cuDNN) Có kinh nghiệm với observability stack như Prometheus, Grafana hoặc OpenTelemetry Có đóng góp open-source hoặc công trình nghiên cứu liên quan đến AI Infrastructure, ML Systems hoặc Performance Optimization
Nguồn: careers VNG