Senior Site Reliability Engineer (SRE) (m/w/d)
Über
Rolle
Du arbeitest in einer technisch anspruchsvollen Plattformlandschaft, in der Stabilität, Automatisierung und Observability eine zentrale Rolle spielen.
Du übernimmst Verantwortung für Systeme, die für einen zuverlässigen IT-Betrieb entscheidend sind, und bringst deine Erfahrung aktiv in deren Weiterentwicklung ein.
Dabei verbindest du Engineering, Automation und Troubleshooting und sorgst dafür, dass Plattformen nicht nur funktionieren, sondern kontinuierlich besser werden.
Verantwortung
Du verantwortest den Betrieb und die Weiterentwicklung von Splunk und Cribl als zentrale Plattformen für Logging und Analyse.
Du entwickelst die Monitoring- und Observability-Landschaft mit Zabbix, Grafana und Prometheus weiter und stellst deren zuverlässigen Betrieb sicher.
Du gestaltest moderne Kubernetes- und Container-Plattformen mit Rancher, Helm und ArgoCD aktiv mit.
Du arbeitest mit HAProxy und Traefik und entwickelst die entsprechenden Plattformkomponenten kontinuierlich weiter.
Du automatisierst wiederkehrende Abläufe mit Ansible und schaffst damit standardisierte und effiziente Betriebsprozesse.
Du unterstützt beim Betrieb und bei der Weiterentwicklung von PostgreSQL-, MariaDB- und/oder MySQL-Plattformen.
Du definierst technische Standards und wirkst bei Security-, Betriebs- und Automatisierungsrichtlinien mit.
Du übernimmst technische Verantwortung in Infrastruktur- und Plattformprojekten sowie bei Changes, Wartungen und Rollouts.
Du analysierst komplexe Störungen auf 3rd-Level-Niveau und entwickelst nachhaltige Lösungen.
Du stellst gemeinsam mit dem Team auch ausserhalb der regulären Arbeitszeiten die Verfügbarkeit der Plattformen im Rahmen des Pikettdienstes sicher.
Qualifikationen
Du hast eine Ausbildung, ein Studium oder eine vergleichbare Qualifikation im IT-Bereich abgeschlossen.
Du bringst mehrere Jahre Erfahrung im Engineering und Betrieb komplexer Linux-, Container- und Plattformumgebungen mit.
Du verfügst über fundierte Linux-Kenntnisse und setzt Ansible sicher in der Praxis ein.
Du hast fundierte Erfahrung mit Splunk und/oder Cribl und verstehst den Betrieb zentraler Logging- und Analyseplattformen.
Du kennst dich sehr gut mit Monitoring und Observability aus und hast praktische Erfahrung mit Zabbix, Grafana und/oder Prometheus.
Du hast bereits Kubernetes- und Container-Plattformen betrieben und weiterentwickelt.
Du kennst Technologien wie Rancher, Helm, ArgoCD, HAProxy und/oder Traefik.
Du verfügst über Grundkenntnisse in PostgreSQL, MariaDB und/oder MySQL.
Du bringst idealerweise Kenntnisse in Python oder Go mit.
Du hast Erfahrung in IT- und Infrastrukturprojekten und idealerweise bereits technische Teilverantwortung übernommen.
Du arbeitest eigenverantwortlich, strukturiert und lösungsorientiert.
Du hast einen hohen Qualitäts- und Serviceanspruch und arbeitest gerne mit unterschiedlichen Fachbereichen zusammen.
Du verfügst über sehr gute Deutsch- und gute Englischkenntnisse.
Benefits