Site Reliability Engineer KI-Plattform (m/w/d)
Über
Rolle
Modelle im Labor sind das eine, ein belastbarer Produktivbetrieb das andere. In dieser Position als Site Reliability Engineer KI-Plattform baust Du die technische Basis, auf der KI-Services zuverlässig laufen, von der Pipeline über das Deployment bis zum Monitoring. Automatisierung, Containerisierung und saubere Schnittstellen bestimmen Deinen Arbeitsalltag. Fachteams holen Dich, wenn aus einem Prototyp ein skalierbarer Service werden soll.
Verantwortung
Du überführst Modelle und KI-Anwendungen in den produktiven Betrieb einer zentralen Serviceplattform.
Automatisierte CI/CD- und MLOps-Pipelines baust Du auf, härtest sie ab und hältst sie aktuell.
Hinzu kommt die Verantwortung für Verfügbarkeit, Skalierung, Security und Kostenkontrolle der Plattform.
Du realisierst Integrationen über APIs und richtest Logging, Monitoring sowie Alerting ein.
Darüber hinaus begleitest Du Fachteams technisch bei Prototypen und Machbarkeitsabklärungen.
Zudem baust Du wiederverwendbare Module auf und hältst technische Vorgaben schriftlich fest.
Qualifikationen
Du hast Informatik studiert, eine vergleichbare Ausbildung abgeschlossen oder Dir das Wissen in der Praxis erarbeitet.
Mehrjährige Erfahrung im Betrieb komplexer Plattformen und im Deployment produktiver Workloads zeichnet Dich aus.
Du arbeitest sicher mit Kubernetes, Infrastructure as Code und Skripting, etwa in Python.
Architekturentscheide, Betriebsthemen und Schnittstellenfragen gehst Du strukturiert und pragmatisch an.
Technische Sachverhalte erklärst Du verständlich, auf Deutsch verhandlungssicher und auf Englisch souverän im Fachaustausch.
Zudem verfolgst Du Entwicklungen rund um KI und Cloud-Plattformen aus eigenem Antrieb.
Benefits