Wil jij werken aan de betrouwbaarheid van cloudplatformen die draaien onder bedrijfskritische applicaties binnen onder andere de overheid, zorg en vitale infrastructuur? Als Site Reliability Engineer bij KPN combineer je software engineering, automatisering en operations om onze OpenShift-platformen continu slimmer, veiliger en stabieler te maken. Zo lever je direct een bijdrage aan de cloudinfrastructuur waarop duizenden gebruikers dagelijks vertrouwen.
Jouw rol als Site Reliability Engineer – Cloud Native Platform (OpenShift)
Als Site Reliability Engineer ben je verantwoordelijk voor de betrouwbaarheid, beschikbaarheid en schaalbaarheid van onze Managed OpenShift-platformen. Je combineert software engineering, automatisering en operationele expertise om de dienstverlening continu te verbeteren. Daarbij richt je je niet alleen op incidentmanagement, maar vooral op het structureel verhogen van de stabiliteit en het voorkomen van verstoringen. Je werkt vanuit het principe Everything as Code en speelt een belangrijke rol in de verdere ontwikkeling van onze cloud-native platformdiensten. Met behulp van data, automatisering en observability zorg je ervoor dat onze platformen veilig, toekomstbestendig en efficiënt blijven functioneren. Zo maak je direct impact op bedrijfskritische dienstverlening voor onze klanten.
In deze rol:
- Verhoog je de beschikbaarheid en stabiliteit van onze OpenShift-platformen.
- Definieer en bewaak je Service Level Objectives (SLO's) en Error Budgets.
- Voer je reliability reviews en platform health assessments uit.
- Verminder je operationele risico's en technische schuld binnen het platform.
- Automatiseer je beheeractiviteiten met technieken zoals GitOps, Terraform, Ansible, Helm, Kubernetes Operators en CI/CD-pipelines.
- Ontwikkel en beheer je observability-oplossingen met onder andere Grafana, Loki, Tempo, OpenTelemetry en de LGTM-stack.
- Vertaal je operationele data naar concrete verbeteringen voor onze dienstverlening.
- Neem je bij complexe verstoringen de technische lead en voer je Root Cause Analyses uit.
- Automatiseer je oplossingen voor terugkerende incidenten en draag je bij aan Continual Service Improvement.
- Ben je verantwoordelijk voor OpenShift-upgrades, Kubernetes lifecycle management, platform hardening, capacity management en Disaster Recovery-validatie.
- Werk je samen met securityspecialisten aan de hoogste standaarden op het gebied van security en compliance.
- Draag je bij aan beveiligingsoplossingen rondom onder andere ACS, Policy as Code, image scanning, RBAC en multi-tenancy.
Zo maak je impact binnen KPN en zorg je ervoor dat onze cloudplatformen betrouwbaar blijven functioneren voor organisaties die op ons vertrouwen.