jobportalschweiz.ch
← Toutes les offres

Site Reliability Engineer - Cloud Operations

Swissquote Bank SA

Type de contrat
Temps plein
Lieu
Gland
Première publication
Postuler

Description de l'entreprise ##

Chez Swissquote, nous sommes à fond.
À fond pour bousculer les choses. À fond pour construire la banque que les gens veulent vraiment utiliser. À fond pour rendre la finance moins ennuyeuse - et beaucoup plus puissante.

Nous sommes la principale banque digitale de Suisse - plus de 1 400 personnes à travers l'Europe, le Moyen-Orient et l'Asie, construisant de véritables solutions financières pour plus d'un million de clients dans le monde. Du trading et de l'investissement aux services bancaires quotidiens, nous couvrons tout l'éventail. Nous allons vite, mais nous construisons des choses dont nous sommes véritablement fiers. Jetez un coup d'œil dans les coulisses en consultant Humans of Swissquote sur Instagram.

Une croissance rapide crée de l'espace. De l'espace pour essayer des choses, s'approprier des projets et grandir à un rythme que la plupart des endroits ne peuvent pas offrir. Que vous aimiez être sous les projecteurs ou que vous préfériez simplement vous concentrer sur votre travail pour accomplir de grandes choses, il y a de la place pour les deux ici.

Nous avons abandonné le code vestimentaire - mais jamais la chance de célébrer. Grande victoire ou petite, nous lui donnons de l'importance. Le genre d'endroit où l'atmosphère se crée d'elle-même.

En tant qu'employeur garantissant l'égalité des chances, nous accueillons des candidats de tous horizons, expériences et perspectives pour rejoindre notre équipe et contribuer à notre succès commun.

Vous le ressentez ? C'est un bon début. Postulez.

Mission de l'équipe et parties prenantes

Êtes-vous passionné par Kubernetes, les systèmes distribués et le maintien de la fiabilité des plateformes de production à grande échelle ?

Rejoignez notre équipe Cloud Operations et aidez-nous à migrer et moderniser les applications qui fonctionnent au cœur de Swissquote.

Nous recherchons un Site Reliability Engineer qui aime travailler au plus près de la production, résoudre les problèmes de fiabilité et améliorer la façon dont les applications sont déployées et exploitées.

Description du poste ##

Dans ce rôle, vous devrez :

  • Migrer et moderniser les applications de production sur Kubernetes,
  • Intégrer des logiciels tiers dans nos plateformes de production et les adapter à nos standards opérationnels,
  • Travailler aux côtés des Software et IT Engineers pour améliorer la fiabilité, la performance et la préparation opérationnelle,
  • Concevoir et exploiter des applications sur notre plateforme de service mesh,
  • Intégrer des modèles de déploiement sûrs tels que les canary releases et les rollouts progressifs,
  • Définir les SLOs, les SLIs et des KPIs opérationnels utiles, puis les utiliser pour piloter les améliorations,
  • Améliorer l'observabilité à travers les métriques, les logs et les traces afin que les problèmes soient plus faciles à détecter et à comprendre,
  • Explorer et intégrer des outils d'IA qui peuvent aider au dépannage, à l'analyse d'incidents et à la remédiation,
  • Tester le comportement des systèmes sous charge, lors de pannes et lorsque des dépendances disparaissent,
  • Automatiser le travail opérationnel répétitif dès que cela fait sens,
  • Fournir un support de Niveau-3 et participer à la rotation d'astreinte.

Qualifications ##

  • Au moins 3 ans d'expérience en SRE, DevOps, Platform Engineering ou un rôle similaire axé sur la production,
  • Solide expérience pratique de l'exécution de charges de travail de production sur Kubernetes, OpenShift, EKS ou une plateforme Kubernetes similaire,
  • Bonne connaissance de Helm et de la manière de packager, configurer et maintenir des applications avec celui-ci,
  • Expérience de travail avec les technologies de service mesh telles qu'Istio ou Linkerd, ou une solide expérience en réseau Kubernetes,
  • Une bonne compréhension du réseautage de service à service, du routage du trafic, du mTLS et du TLS,
  • Expérience avec GitOps et les stratégies de déploiement modernes telles que le canary ou le progressive delivery,
  • Une compréhension pratique des concepts SRE tels que les SLIs, les SLOs et les error budgets,
  • Expérience avec les outils d'observabilité et de traçage tels que Prometheus, Grafana, Elastic Stack ou OpenTelemetry,
  • Solides bases en Linux et en réseau, y compris TCP/IP, DNS et load balancing,
  • À l'aise avec le dépannage d'applications basées sur la JVM en production et capable d'enquêter sur des problèmes liés à l'utilisation du heap, au garbage collection ou à la configuration de la JVM,
  • À l'aise avec l'automatisation via Python, Go, Bash ou un autre langage de programmation,
  • Expérience ou fort intérêt pour l'application de l'IA à l'observabilité, à la réponse aux incidents ou à l'automatisation opérationnelle,
  • Expérience ou fort intérêt pour l'exploitation d'applications qui dépendent de ressources GPU ou d'autres infrastructures d'IA,
  • Familiarité avec les outils Infrastructure as Code tels que Terraform, Ansible ou Puppet.

Les plus (Nice-to-Haves)

  • Expérience avec Argo CD, Argo Rollouts ou Argo Workflows,
  • Expérience plus approfondie avec les plateformes de service mesh basées sur Istio, Linkerd ou Envoy,
  • Expérience dans la conception ou l'exploitation de plateformes Kubernetes à grande échelle,
  • Expérience de l'exécution d'applications Java ou Spring Boot en production,
  • Expérience pratique de l'optimisation des applications JVM pour la performance ou les charges de travail à faible latence,
  • Expérience dans l'intégration d'applications avec des plateformes d'IA auto-hébergées telles que vLLM,
  • Expérience dans le dépannage des intégrations d'infrastructure d'IA, y compris l'accès aux modèles, la disponibilité des GPU et les configurations NVIDIA MIG,
  • Connaissance de Cilium, eBPF ou d'autres technologies de réseau Kubernetes modernes,
  • Expérience avec le cloud public ou les environnements de cloud privé de grande taille,
  • CKAD, CKA, CKS ou expérience pratique équivalente sur Kubernetes,
  • Un homelab, des services aut

Traduit automatiquement depuis l’original.

Publié il y a 1 semaine

Lieu

Voir sur Google Maps