AI Site Reliability Engineer (m/w/d)
Über
Verantwortung
Du entwirfst und entwickelst skalierbare KI-Infrastrukturservices, die für GPU-Workloads optimiert sind
In dieser Rolle implementierst und verwaltest du Enterprise-KI-Plattformen (z. B. Kubernetes, OpenShift) für das Model Inference
Du betreibst und wartest leistungsstarke HPC-Cluster mit Bare-Metal- und virtuellen GPU-Servern
Du analysierst und behebst komplexe Infrastrukturvorfälle über Hardware- und Software-Stacks hinweg
In dieser Rolle unterstützt du Data-Science-Teams bei der Bereitstellung der benötigten Infrastruktur
Qualifikationen
Du verfügst über einen Bildungsabschluss in Informatik.
Du hast mindestens 5 Jahre Erfahrung in der IT-Systemadministration, davon über 3 Jahre mit Linux (bevorzugt RHEL) sowie fundierte Skripting-Kenntnisse in Shell, Python und Ansible.
Du bringst tiefgehendes Know-how in GPU-Topologien und -Architekturen (z.B. NVLink, PCIe-Switching) sowie in Container-Orchestrierung mit Kubernetes, Terraform und ArgoCD mit und hast erste Praxis mit Prometheus, Grafana und DCGM Exporter.
Du arbeitest nach ITIL-Methoden, agierst proaktiv und verantwortungsbewusst und überzeugst durch ausgeprägte analytische Fähigkeiten und lösungsorientiertes Denken.
Du behältst auch unter Zeitdruck den Überblick, setzt Prioritäten geschickt und lieferst verlässlich hochwertige Ergebnisse.
Du kommunizierst fliessend auf Englisch; Deutschkenntnisse sind ein Plus.