**Company:**
GSM
**Reporting to:**
Director of Engineering
**Scope:**
Ride\-hailing, Food Delivery, Payments và các nền tảng số chiến lược của GSM tại Việt Nam, Philippines, Indonesia, India và US.
About the Role
GSM đang tìm kiếm một
**Principal Site Reliability Engineer**
để dẫn dắt chiến lược hạ tầng và độ tin cậy hệ thống ở quy mô toàn cầu. Đây là vị trí Individual Contributor (IC) cao cấp nhất trong tổ chức Platform \& Infrastructure, chịu trách nhiệm định hình tầm nhìn dài hạn cho nền tảng công nghệ của GSM trên nhiều thị trường và nhiều nhà cung cấp cloud.
Khác với vai trò Staff SRE tập trung vào vận hành và tối ưu nền tảng hiện có, Principal SRE sẽ quyết định các chiến lược mang tính nền tảng như lựa chọn kiến trúc đa đám mây, mở rộng sản phẩm sang thị trường mới, tiêu chuẩn bảo mật, quản trị hạ tầng, tuân thủ pháp lý xuyên biên giới và mô hình vận hành cho toàn bộ tổ chức kỹ thuật.
Bạn sẽ là người mà các Staff Engineers, Engineering Managers và lãnh đạo công nghệ tìm đến khi phải giải quyết những bài toán hạ tầng phức tạp nhất, có ảnh hưởng đến nhiều quốc gia, nhiều hệ thống và nhiều đơn vị kinh doanh.
Key Responsibilities
1\. Infrastructure Strategy \& Platform Architecture
- Xây dựng và sở hữu chiến lược hạ tầng dài hạn phục vụ tăng trưởng của GSM trên toàn cầu.
- Định hướng kiến trúc cho toàn bộ nền tảng công nghệ, bao gồm chiến lược cloud, roadmap đầu tư nền tảng và các quyết định build\-versus\-buy.
- Chuyển hóa các kế hoạch kinh doanh như mở rộng thị trường, ra mắt sản phẩm mới hoặc M\&A thành kế hoạch triển khai hạ tầng khả thi.
- Đóng vai trò là chuyên gia kỹ thuật cao nhất trong các quyết định kiến trúc liên quan đến Platform, Security, Compliance và Product Engineering.
2\. Multi\-Cloud Infrastructure \& Governance
- Thiết kế và quản trị hệ sinh thái hạ tầng trải rộng trên
**AWS, Google Cloud Platform và Huawei Cloud**
.
- Xây dựng chiến lược Infrastructure as Code thống nhất bằng Terraform và Policy\-as\-Code, bảo đảm tính nhất quán giữa các môi trường và nhà cung cấp cloud.
- Thiết lập các tiêu chuẩn bảo mật mặc định như Zero Trust, mTLS, WAF, IAM Federation và Identity\-Based Access Control.
- Dẫn dắt chiến lược hợp tác với các nhà cung cấp cloud lớn nhằm tối ưu hiệu năng, độ ổn định và chi phí vận hành.
- Phối hợp với Security, Legal và Compliance để đáp ứng các yêu cầu pháp lý và tiêu chuẩn quốc tế như PCI\-DSS, GDPR hoặc các quy định địa phương.
3\. Global Kubernetes Platform \& Service Mesh
- Định hình kiến trúc Kubernetes đa cụm, đa vùng và đa cloud cho toàn bộ tổ chức.
- Chuẩn hóa các mô hình triển khai trên EKS, GKE và CCE.
- Thiết kế các cơ chế traffic management quy mô lớn thông qua Istio/Envoy bao gồm:
- Canary Deployment
- Traffic Shifting
- Rate Limiting
- Cross\-Cluster Routing
- gRPC Load Balancing
- Xây dựng và quản trị các Helm Charts, deployment templates và nền tảng self\-service cho các đội ngũ phát triển.
- Mentor và nâng cao năng lực cho Staff Engineers, Senior SREs và Platform Engineers.
4\. Observability \& Incident Readiness
- Xây dựng chiến lược quan sát hệ thống hợp nhất bao gồm Metrics, Logs, Traces và Alerting trên toàn bộ hệ sinh thái cloud.
- Thiết lập và thúc đẩy áp dụng SLI, SLO và Error Budget cho các dịch vụ trọng yếu như Dispatch, Payments và Order Routing.
- Thiết kế mô hình vận hành Follow\-the\-Sun để đảm bảo khả năng hỗ trợ sự cố 24/7 trên nhiều múi giờ.
- Đảm bảo khả năng điều tra nguyên nhân gốc cho các vấn đề sản xuất phức tạp liên quan đến latency, Kafka, database, network và distributed systems.
5\. Reliability Engineering \& Incident Leadership
- Chủ trì các đánh giá kiến trúc cho những thay đổi có mức độ rủi ro cao nhất.
- Đóng vai trò Incident Commander cuối cùng trong các sự cố nghiêm trọng ảnh hưởng đến nhiều quốc gia hoặc nhiều cloud provider.
- Điều phối xử lý sự cố, truyền thông với các bên liên quan và quản lý quá trình khôi phục dịch vụ.
- Xây dựng văn hóa học hỏi sau sự cố thông qua Postmortem, Root Cause Analysis và tự động hóa phòng ngừa tái diễn.
- Tối ưu hiệu suất của các hệ thống phân tán quy mô lớn với trọng tâm là latency và system resilience.
6\. High Availability \& Disaster Recovery
- Thiết kế chiến lược HA/DR đa vùng và đa cloud cho:
- PostgreSQL
- MySQL
- Redis
- Kafka
- Định nghĩa RPO/RTO theo từng nhóm dịch vụ và mức độ quan trọng kinh doanh.
- Lãnh đạo các chương trình kiểm thử Disaster Recovery và Chaos Engineering.
- Xây dựng kiến trúc dữ liệu xuyên biên giới, đảm bảo cân bằng giữa dữ liệu nội địa hóa và nhu cầu vận hành toàn cầu.
- Chuẩn hóa các mô hình caching, throttling, backpressure và scalability cho toàn bộ hệ sinh thái.
7\. Capacity Planning \& FinOps
- Dự báo nhu cầu tài nguyên hạ tầng theo từng thị trường và từng giai đoạn tăng trưởng.
- Thiết lập thực hành FinOps cho môi trường multi\-cloud.
- Tối ưu chi phí thông qua:
- Rightsizing
- Capacity Reservation
- Egress Optimization
- Workload Placement
- Trình bày các đánh đổi giữa chi phí, hiệu năng và rủi ro cho lãnh đạo công ty bằng ngôn ngữ kinh doanh.
8\. Regulatory Compliance \& Data Residency
- Dẫn dắt việc triển khai các yêu cầu về Data Residency và Cross\-Border Data Transfer tại các quốc gia GSM hoạt động.
- Thiết kế kiến trúc bảo mật, mã hóa và phân quyền đáp ứng yêu cầu pháp lý theo từng thị trường.
- Đại diện cho Platform Engineering trong các cuộc kiểm toán, đánh giá tuân thủ và làm việc với cơ quan quản lý khi cần thiết.
9\. New Market Expansion
- Đánh giá mức độ sẵn sàng của hạ tầng trước khi mở rộng sang quốc gia mới hoặc triển khai các sản phẩm có yêu cầu quản lý cao như Payments.
- Thực hiện technical due diligence về cloud, connectivity và regulatory landscape tại thị trường mục tiêu.
- Xác định kiến trúc tối thiểu cần thiết để ra mắt sản phẩm an toàn và có khả năng mở rộng.
Requirements
Technical Excellence
- Tối thiểu 12\+ năm kinh nghiệm về Infrastructure, Platform Engineering hoặc Site Reliability Engineering.
- Có kinh nghiệm vận hành production workload trên ít nhất 2 trong 3 nền tảng:
- AWS
- GCP
- Huawei Cloud
- Thành thạo Terraform, Kubernetes, Service Mesh, CI/CD, Observability Platforms và Distributed Systems.
- Hiểu sâu về Zero Trust Architecture, IAM Federation và Cloud Security.
Reliability \& Scale
- Đã từng dẫn dắt các hệ thống phục vụ hàng triệu người dùng hoặc khối lượng giao dịch lớn.
- Có kinh nghiệm trực tiếp xử lý các sự cố Sev0 hoặc Sev1 quy mô lớn.
- Hiểu rõ các mô hình HA/DR, failover, replication và business continuity.
Leadership \& Influence
- Đã từng là kỹ sư IC cao cấp nhất hoặc Principal Engineer trong tổ chức kỹ thuật quy mô lớn.
- Có khả năng xây dựng chiến lược kỹ thuật ảnh hưởng tới nhiều nhóm kỹ sư và lãnh đạo cấp cao.
- Có kinh nghiệm báo cáo trực tiếp tới Director, VP, CTO hoặc Ban điều hành.
- Giao tiếp xuất sắc trong môi trường đa quốc gia, đa văn hóa và áp lực cao.
Preferred Experience
- Kinh nghiệm trong Ride\-Hailing, Logistics, Food Delivery, Fintech hoặc Payments.
- Kinh nghiệm vận hành Huawei Cloud ở môi trường Production.
- Từng tham gia mở rộng sản phẩm sang thị trường mới từ giai đoạn khởi tạo đến vận hành quy mô lớn.
- Tiếng Anh thành thạo; tiếng Việt là lợi thế.