Cloud Platform Engineer GPU & Container (m/w/d)
Über
Rolle
Als Cloud Platform Engineer GPU & Container verantwortest Du eine Plattform, auf der Modelle trainiert und produktiv ausgerollt werden. Im Zentrum stehen Kubernetes-Cluster, GPU-Nodes und ein durchgehend automatisierter Betrieb mit Ansible und Infrastructure as Code. Hier zählt technisches Tiefenverständnis von der Firmware bis zum Container-Scheduler. Wer Performance-Engineering und stabile Systeme mag, findet in dieser Position viel Gestaltungsraum.
Verantwortung
Du entwirfst Infrastrukturservices für GPU-lastige Workloads und skalierst diese entlang wachsender Anforderungen.
Du betreibst Rechencluster im High-Performance-Computing-Umfeld, sowohl auf Bare Metal als auch virtualisiert.
Des Weiteren rollst Du Enterprise-Plattformen für Model Inference aus und automatisierst deren Lifecycle.
Bei tiefgreifenden Störungen übernimmst Du das Root-Cause-Analysis über Treiber, Netzwerk und Applikationsebene hinweg.
Darüber hinaus stellst Du Rechen- und Speicherumgebungen für Modellierungsteams bereit.
Zudem führst Du kritische Wartungsarbeiten durch und trägst die Bereitschaft im Turnus mit.
Qualifikationen
Ein abgeschlossenes Studium (Uni/FH) in Informatik bildet Deine fachliche Basis.
Mehrjährige Praxis in der Systemadministration bringst Du mit, mind. 3 Jahre davon vertieft auf Linux (RHEL bevorzugt).
Skripting beherrschst Du sicher, insbesondere mit Python, Shell und Konfigurationsmanagement.
GPU-Topologien wie NVLink oder PCIe-Switching sind Dir vertraut, ebenso Container-Orchestrierung samt Terraform und GitOps-Workflows.
Hinzu kommen erste Berührungspunkte mit Metrik- und Monitoring-Stacks inklusive GPU-Telemetrie.
Zudem denkst Du prozessorientiert nach ITIL, behältst unter Last den Überblick und arbeitest fliessend auf Englisch, Deutsch rundet Dein Profil ab.
Benefits