jobportalschweiz.ch
← Tutte le offerte

Site Reliability Engineer - Cloud Operations

Swissquote Bank SA

Tipo di contratto
Tempo pieno
Luogo
Gland
Prima pubblicazione
Candidati ora

Descrizione dell'azienda ##

In Swissquote, ci giochiamo tutto.
Ci giochiamo tutto per scuotere le cose. Ci giochiamo tutto per costruire la banca che la gente vuole davvero usare. Ci giochiamo tutto per rendere la finanza meno noiosa – e molto più potente.

Siamo la principale banca digitale della Svizzera – oltre 1.400 persone in Europa, Medio Oriente e Asia, che costruiscono vere soluzioni finanziarie per oltre un milione di clienti in tutto il mondo. Dal trading e l'investimento al banking quotidiano, copriamo l'intero panorama. Ci muoviamo velocemente, ma costruiamo cose di cui siamo sinceramente orgogliosi. Dai un'occhiata dietro le quinte controllando Humans of Swissquote su Instagram.

Crescere velocemente crea spazio. Spazio per provare cose, possedere cose e crescere a un ritmo che la maggior parte dei posti non può offrire. Sia che ti piaccia stare sotto i riflettori o che preferisca semplicemente abbassare la testa e fare un ottimo lavoro, qui c'è spazio per entrambi.

Abbiamo abbandonato il dress code – ma mai la possibilità di festeggiare. Grande vittoria o piccola, la rendiamo importante. Il tipo di posto dove l'atmosfera si crea da sola.

In qualità di datore di lavoro che offre pari opportunità, accogliamo candidati di tutti i background, esperienze e prospettive per unirsi al nostro team e contribuire al nostro successo condiviso.

Ti ispira? È un buon inizio. Candidati.

Missione del team e stakeholder

Ti appassionano Kubernetes, i sistemi distribuiti e il mantenere le piattaforme di produzione affidabili su larga scala?

Unisciti al nostro team Cloud Operations e aiutaci a migrare e modernizzare le applicazioni che girano nel cuore di Swissquote.

Cerchiamo un Site Reliability Engineer che ami lavorare vicino alla produzione, risolvere problemi di affidabilità e migliorare il modo in cui le applicazioni vengono distribuite e gestite.

Descrizione del lavoro ##

In questo ruolo, dovrai:

  • Migrare e modernizzare le applicazioni di produzione su Kubernetes,
  • Integrare software di terze parti nelle nostre piattaforme di produzione e renderlo conforme ai nostri standard operativi,
  • Lavorare insieme agli Software e IT Engineers per migliorare l'affidabilità, le prestazioni e la prontezza operativa,
  • Progettare e gestire applicazioni sulla nostra piattaforma service mesh,
  • Integrare pattern di deployment sicuri come canary releases e progressive rollouts,
  • Definire SLO, SLI e utili KPI operativi, e poi usarli per guidare i miglioramenti,
  • Migliorare l'osservabilità attraverso metriche, log e tracce in modo che i problemi siano più facili da individuare e comprendere,
  • Esplorare e integrare strumenti di AI che possano aiutare con la risoluzione dei problemi, l'analisi degli incidenti e la rimedio,
  • Testare come i sistemi si comportano sotto carico, durante i guasti e quando le dipendenze scompaiono,
  • Automatizzare il lavoro operativo ripetitivo ogni volta che ha senso,
  • Fornire supporto di Livello-3 e partecipare alla rotazione on-call.

Qualifiche ##

  • Almeno 3 anni di esperienza in SRE, DevOps, Platform Engineering o un ruolo simile focalizzato sulla produzione,
  • Solida esperienza pratica nel gestire carichi di lavoro di produzione su Kubernetes, OpenShift, EKS o una piattaforma Kubernetes simile,
  • Buona conoscenza di Helm e di come impacchettare, configurare e mantenere le applicazioni con esso,
  • Esperienza di lavoro con tecnologie service mesh come Istio o Linkerd, o forte esperienza di networking Kubernetes,
  • Una buona comprensione del networking service-to-service, del routing del traffico, mTLS e TLS,
  • Esperienza con GitOps e moderne strategie di deployment come canary o progressive delivery,
  • Una comprensione pratica dei concetti SRE come SLI, SLO e error budgets,
  • Esperienza con strumenti di osservabilità e tracing come Prometheus, Grafana, Elastic Stack o OpenTelemetry,
  • Forti basi di Linux e networking, inclusi TCP/IP, DNS e load balancing,
  • Capacità di risolvere problemi (troubleshooting) di applicazioni basate su JVM in produzione e capacità di investigare problemi relativi all'uso dell'heap, garbage collection o configurazione JVM,
  • Capacità di automatizzare le cose con Python, Go, Bash o un altro linguaggio di programmazione,
  • Esperienza o forte interesse nell'applicare l'AI all'osservabilità, alla risposta agli incidenti o all'automazione operativa,
  • Esperienza o un forte interesse nel gestire applicazioni che dipendono da risorse GPU o altre infrastrutture AI,
  • Familiarità con strumenti di Infrastructure as Code come Terraform, Ansible o Puppet.

Nice-to-Haves

  • Esperienza con Argo CD, Argo Rollouts o Argo Workflows,
  • Esperienza più approfondita con piattaforme service mesh basate su Istio, Linkerd o Envoy,
  • Esperienza nella progettazione o gestione di piattaforme Kubernetes su larga scala,
  • Esperienza nel gestire applicazioni Java o Spring Boot in produzione,
  • Esperienza pratica nella sintonizzazione (tuning) di applicazioni JVM per prestazioni o carichi di lavoro a bassa latenza,
  • Esperienza nell'integrare applicazioni con piattaforme AI self-hosted come vLLM,
  • Esperienza nella risoluzione di problemi di integrazione di infrastrutture AI, inclusi l'accesso ai modelli, la disponibilità delle GPU e le configurazioni NVIDIA MIG,
  • Conoscenza di Cilium, eBPF o altre moderne tecnologie di networking Kubernetes,
  • Esperienza con cloud pubblici o grandi ambienti cloud privati,
  • CKAD, CKA, CKS o equivalente esperienza pratica di Kubernetes,
  • Un homelab, servizi self-hosted o progetti collaterali dove puoi sperimentare, rompere le cose e ricostruirle.

Chi sei

  • Ti piace capire perché i sistemi si comportano in un certo modo, specialmente quando qualcosa va storto,
  • Automatizzi il lavoro ripetitivo invece di accettarlo come parte del lavoro,
  • Sei a tuo agio nel lavorare tra i team di sviluppo, infrastruttura e operazioni,
  • Non ti dispiace approfondire software che non hai costruito tu stesso,
  • Sei curioso riguardo l'AI e dove

Tradotto automaticamente dall’originale.

Pubblicato 1 settimana fa

Luogo

Vedi su Google Maps