2 DevOps - Software in Aarau
Senior Platform Reliability Engineer (m/w/d)
Über
Rolle
Als Senior Platform Reliability Engineer bist Du die technische Instanz für eine On-Premise-Plattform, auf die sich mehrere Entwicklungsteams täglich verlassen. Hier zählt nicht die Anzahl der Tools, sondern schlanke Abläufe mit echtem Mehrwert. Deine Erfahrung mit OpenShift und Kubernetes setzt Du gezielt ein, um eine gewachsene Toolchain zu modernisieren. Sicherheit denkst Du von Anfang an mit. Entwicklung, Architektur und IT-Security schätzen Dich als Sparringpartner auf Augenhöhe.
Verantwortung
Du betreibst die zentralen Plattformbausteine wie Container Registry, Monitoring und OpenShift und entwickelst sie gezielt weiter
Für stabile Services sorgst Du mit vorausschauendem Incident Management und einem wachen Blick auf die Performance
Du baust einheitliche Build-, Test- und Release-Abläufe auf und pflegst sie kontinuierlich
Darüber hinaus begleitest Du Entwicklungsteams bei der Containerisierung, beim Deployment und im laufenden Betrieb ihrer Applikationen
Die bestehende Build- und Webserver-Landschaft bringst Du Schritt für Schritt auf einen modernen Stand und prüfst neue Tools auf ihren Nutzen
Zudem verankerst Du Security-, Compliance- und Governance-Vorgaben im Deployment und hältst Dokumentation sowie Best Practices aktuell
Qualifikationen
Ein Bachelor in Informatik oder Engineering bildet Dein Fundament, alternativ überzeugst Du mit einer gleichwertigen Qualifikation
Du blickst auf mehrere Jahre Berufspraxis im DevOps-Umfeld der Softwareentwicklung zurück
Container-Technologien wie Docker und Kubernetes setzt Du souverän ein und sicherst Registries wie Harbor zuverlässig ab
Im Alltag arbeitest Du routiniert mit Git und Continuous Integration/Continuous Delivery (CI/CD), idealerweise mit Tekton, ArgoCD oder TeamCity
Des Weiteren kennst Du Logging- und Monitoring-Lösungen wie Sentry oder den ELK-Stack, und Kenntnisse in React oder C# runden Dein Profil ab
Zudem vermittelst Du Wissen verständlich an unterschiedliche Zielgruppen, arbeitest agil und eigenmotiviert und bewegst Dich mündlich wie schriftlich mühelos in Deutsch und Englisch
Benefits
AI Platform Engineer (m/w/d)
Über
Rolle
GPU-Workloads stellen andere Anforderungen an eine Plattform als klassische Serverlandschaften. Als AI Platform Engineer baust Du skalierbare Infrastrukturservices, die genau darauf ausgelegt sind. Du betreibst Kubernetes-basierte Plattformen für Model Inference und hältst leistungsfähige HPC-Cluster stabil im Betrieb. Data-Science-Teams erhalten von Dir die Umgebungen, mit denen sie produktiv arbeiten. Technische Tiefe und Eigenverantwortung prägen diese Position.
Verantwortung
Du konzipierst skalierbare Infrastrukturdienste für KI-Workloads und entwickelst diese laufend weiter.
Du betreibst Enterprise-Plattformen für Model Inference auf Container-Orchestrierung inklusive Deployment-Automatisierung.
Des Weiteren verantwortest Du High-Performance-Computing-Cluster mit Bare-Metal- und virtualisierten GPU-Servern.
Du analysierst komplexe Störungen über den gesamten Stack hinweg, von Hardware bis Applikationsschicht.
Hinzu kommt das Provisioning von Umgebungen für Data-Science-Teams.
Zudem übernimmst Du kritische Infrastrukturarbeiten und beteiligst Dich an gelegentlichen Pikettdiensten.
Qualifikationen
Du bringst einen Hochschul- oder Fachhochschulabschluss in Informatik mit.
Mehrjährige Erfahrung in der Systemadministration zeichnet Dich aus, davon mind. 3 Jahre mit Fokus auf Linux (bevorzugt RHEL).
Du automatisierst sicher mit Python, Ansible und Shell-Skripting.
Fundiertes Wissen zu GPU-Topologien und Architekturen wie NVLink oder PCIe-Switching gehört zu Deinem Profil, ergänzt durch Terraform und GitOps-Deployments.
Des Weiteren hast Du erste praktische Erfahrung im Monitoring mit Prometheus und Grafana inklusive GPU-Metriken.
Zudem arbeitest Du nach ITIL-Prinzipien, priorisierst souverän und kommunizierst verhandlungssicher auf Englisch, Deutschkenntnisse sind ein Plus.
Benefits