jobportalschweiz.ch
← Alle Stellen

Site Reliability Engineer - Cloud Operations

Swissquote Bank SA

Anstellung
Vollzeit
Ort
Gland
Erstmals ausgeschrieben
Jetzt bewerben

Unternehmensbeschreibung ##

Bei Swissquote sind wir voll dabei.
Voll dabei, um Dinge aufzumischen. Voll dabei, die Bank zu bauen, die die Menschen tatsächlich nutzen wollen. Voll dabei, Finanzen weniger langweilig – und viel leistungsfähiger zu machen.

Wir sind die führende digitale Bank der Schweiz – über 1.400 Mitarbeitende in Europa, dem Nahen Osten und Asien, die echte Finanzlösungen für über eine Million Kunden weltweit entwickeln. Vom Handel und Investieren bis hin zum alltäglichen Banking decken wir das gesamte Spektrum ab. Wir bewegen uns schnell, aber wir bauen Dinge, auf die wir wirklich stolz sind. Werfen Sie einen Blick hinter die Kulissen, indem Sie Humans of Swissquote auf Instagram besuchen.

Schnelles Wachstum schafft Raum. Raum, um Dinge auszuprobieren, Verantwortung zu übernehmen und in einem Tempo zu wachsen, das die meisten anderen Orte nicht bieten können. Ob Sie das Rampenlicht mögen oder es vorziehen, sich einfach auf Ihre Arbeit zu konzentrieren – hier ist Platz für beides.

Wir haben den Dresscode abgeschafft – aber niemals die Chance zu feiern. Ob grosser oder kleiner Erfolg, wir lassen ihn zählen. Die Art von Ort, an dem sich die Atmosphäre von selbst ergibt.

Als Arbeitgeber, der Chancengleichheit fördert, begrüssen wir Kandidatinnen und Kandidaten aus allen Hintergründen, Erfahrungen und Perspektiven, um unser Team zu verstärken und zu unserem gemeinsamen Erfolg beizutragen.

Fühlen Sie es? Das ist ein guter Anfang. Bewerben Sie sich.

Team-Mission und Stakeholder

Brennen Sie für Kubernetes, verteilte Systeme und die Zuverlässigkeit von Produktionsplattformen in grossem Massstab?

Werden Sie Teil unseres Cloud Operations Teams und helfen Sie uns, Anwendungen zu migrieren und zu modernisieren, die im Kern von Swissquote laufen.

Wir suchen einen Site Reliability Engineer, der gerne nah an der Produktion arbeitet, Zuverlässigkeitsprobleme löst und die Art und Weise verbessert, wie Anwendungen bereitgestellt und betrieben werden.

Jobbeschreibung ##

In dieser Rolle werden Sie:

  • Produktionsanwendungen auf Kubernetes migrieren und modernisieren,
  • Drittanbieter-Software in unsere Produktionsplattformen integrieren und sie an unsere Betriebsstandards anpassen,
  • Zusammen mit Software- und IT-Engineers an der Verbesserung von Zuverlässigkeit, Performance und Betriebsbereitschaft arbeiten,
  • Anwendungen auf unserer Service Mesh Plattform entwerfen und betreiben,
  • Sichere Deployment-Muster wie Canary Releases und progressive Rollouts integrieren,
  • SLOs, SLIs und nützliche operative KPIs definieren und diese nutzen, um Verbesserungen voranzutreiben,
  • Die Observability über Metriken, Logs und Traces verbessern, damit Probleme leichter erkannt und verstanden werden können,
  • KI-Tools explorieren und integrieren, die bei der Fehlersuche, Incident-Analyse und Behebung helfen können,
  • Testen, wie sich Systeme unter Last, bei Ausfällen und beim Verschwinden von Abhängigkeiten verhalten,
  • Repetitive operative Aufgaben automatisieren, wann immer es sinnvoll ist,
  • Level-3-Support leisten und an der On-Call-Rotation teilnehmen.

Qualifikationen ##

  • Mindestens 3 Jahre Erfahrung in SRE, DevOps, Platform Engineering oder einer ähnlichen produktionsorientierten Rolle,
  • Fundierte praktische Erfahrung im Betrieb von Produktions-Workloads auf Kubernetes, OpenShift, EKS oder einer ähnlichen Kubernetes-Plattform,
  • Gute Kenntnisse von Helm und wie man Anwendungen damit paketiert, konfiguriert und wartet,
  • Erfahrung in der Arbeit mit Service-Mesh-Technologien wie Istio oder Linkerd, oder starke Erfahrung im Bereich Kubernetes-Networking,
  • Ein gutes Verständnis von Service-to-Service-Networking, Traffic Routing, mTLS und TLS,
  • Erfahrung mit GitOps und modernen Deployment-Strategien wie Canary oder Progressive Delivery,
  • Ein praktisches Verständnis von SRE-Konzepten wie SLIs, SLOs und Error Budgets,
  • Erfahrung mit Observability- und Tracing-Tools wie Prometheus, Grafana, Elastic Stack oder OpenTelemetry,
  • Starke Linux- und Netzwerk-Grundkenntnisse, einschliesslich TCP/IP, DNS und Load Balancing,
  • Sicher in der Fehlersuche bei JVM-basierten Anwendungen in der Produktion und in der Lage, Probleme im Zusammenhang mit Heap-Nutzung, Garbage Collection oder JVM-Konfiguration zu untersuchen,
  • Sicher in der Automatisierung mit Python, Go, Bash oder einer anderen Programmiersprache,
  • Erfahrung oder starkes Interesse an der Anwendung von KI auf Observability, Incident Response oder operative Automatisierung,
  • Erfahrung oder starkes Interesse am Betrieb von Anwendungen, die auf GPU-Ressourcen oder andere KI-Infrastruktur angewiesen sind,
  • Vertrautheit mit Infrastructure as Code Tools wie Terraform, Ansible oder Puppet.

Nice-to-Haves

  • Erfahrung mit Argo CD, Argo Rollouts oder Argo Workflows,
  • Tiefergehende Erfahrung mit Istio, Linkerd oder Envoy-basierten Service-Mesh-Plattformen,
  • Erfahrung im Entwurf oder Betrieb von Kubernetes-Plattformen in grossem Massstab,
  • Erfahrung im Betrieb von Java- oder Spring Boot-Anwendungen in der Produktion,
  • Praktische Erfahrung in der Optimierung von JVM-Anwendungen für Performance oder Low-Latency-Workloads,
  • Erfahrung in der Integration von Anwendungen mit selbst gehosteten KI-Plattformen wie vLLM,
  • Erfahrung in der Fehlersuche bei KI-Infrastruktur-Integrationen, einschliesslich Modellzugriff, GPU-Verfügbarkeit und NVIDIA MIG-Konfigurationen,
  • Kenntnisse von Cilium, eBPF oder anderen modernen Kubernetes-Networking-Technologien,
  • Erfahrung mit Public Cloud oder grossen Private-Cloud-Umgebungen,
  • CKAD, CKA, CKS oder gleichwertige praktische Kubernetes-Erfahrung,
  • Ein Homelab, selbst gehostete Dienste oder Nebenprojekte, bei denen Sie experimentieren, Dinge kaputt machen und wieder aufbauen können.

Wer Sie sind

  • Sie möchten verstehen, warum Systeme sich so verhalten, wie sie es tun, besonders wenn etwas schiefgeht,
  • Sie automatisieren repetitive Aufgaben, anstatt sie als Teil des Jobs zu akzeptieren,
  • Sie arbeiten gerne über

Automatisch aus dem Original übersetzt.

Ausgeschrieben vor 1 Woche

Ort

Auf Google Maps ansehen