jobportalschweiz.ch
← Tutte le offerte

Sr. Staff Technical Program Manager - Reliability

Databricks

Tipo di contratto
Tempo pieno
Luogo
Bellevue
Prima pubblicazione
Candidati ora

P-1489

Informazioni su Databricks

In Databricks, siamo appassionati dell'idea di dare potere ai team di dati per affrontare le sfide più complesse del mondo — dal portare alla realtà la prossima modalità di trasporto all'accelerare lo sviluppo di scoperte mediche. Raggiungiamo questo obiettivo costruendo e gestendo la migliore piattaforma di infrastruttura dati e AI al mondo, consentendo ai nostri clienti di sfruttare approfonditi insight sui dati e migliorare il proprio business.

Il Ruolo

Cerchiamo un eccezionale Senior Staff Technical Program Manager (TPM) per la Reliability per guidare la strategia, l'esecuzione e il miglioramento continuo delle nostre iniziative di Reliability più critiche attraverso i team di infrastruttura e product engineering in Databricks. Mentre Databricks scala per supportare migliaia di clienti e i carichi di lavoro più intensivi di dati al mondo, la Reliability è fondamentale per la nostra missione. In questo ruolo, guiderai programmi interaziendali che migliorano significativamente la reliability, le prestazioni e l'eccellenza operativa della nostra infrastruttura multi-cloud.

Si tratta di un ruolo di leadership ad alta visibilità e alto impatto, in stretto partenariato con i nostri leader engineering più senior, inclusi gli sponsor esecutivi dei programmi di Reliability, i senior TL e gli Engineering Manager, per definire la strategia di Reliability, stabilire obiettivi a lungo termine ed eseguire programmi multi-quarter per costruire la piattaforma cloud più affidabile del pianeta su cui i nostri clienti possano eseguire i loro carichi di lavoro mission-critical.

Per avere successo, devi possedere una profonda comprensione dei sistemi distribuiti su larga scala, dell'infrastruttura cloud e dei principi di ingegneria che guidano l'eccellenza operativa. Sfrutterai il tuo background per anticipare i rischi, dare forma alla direzione tecnica e consegnare programmi complessi attraverso i team di prodotto, ingegneria, SRE e i partner cloud.

Avrai l'opportunità di:

Guidare la Strategia di Reliability + Roadmap Multi-Quarter

  • Collaborare con la senior engineering leadership per definire la roadmap di Reliability a lungo termine, influenzare la direzione tecnica e garantire l'allineamento tra i team.
  • Garantire chiarezza e allineamento sulle priorità tra i team di ingegneria, inclusi Platform Engineering, Compute Fleet Management, SRE, Security e Cloud Partnerships.

Guidare l'Esecuzione di Programmi di Reliability Critici

  • Gestire l'esecuzione del programma end-to-end: pianificazione, gestione dei rischi, mappatura delle dipendenze, decisioni di trade-off, reporting dello stato e consegna.
  • Identificare lacune nei processi o nell'architettura e lavorare con i TL per guidare proattivamente miglioramenti organizzativi o tecnici.

Collaborare Profondamente con l'Ingegneria e Influenzare la Direzione Tecnica

  • Utilizzare il tuo background in infrastruttura, sistemi distribuiti o SRE per aiutare i team a prendere decisioni solide in termini di design e prioritizzazione.
  • Facilitare l'allineamento tra team cross-funzionali per garantire che i programmi siano tecnicamente fondati e pronti per l'esecuzione.
  • Portare il pensiero sistemico per diagnosticare i colli di bottiglia della reliability e guidare miglioramenti alla scalabilità, alla tolleranza ai guasti, all'automazione e agli strumenti operativi.

Elevare la Cultura della Reliability in tutta l'Organizzazione

  • Guidare l'adozione delle migliori pratiche di reliability tra i team di ingegneria - inclusi error budget, incident review, pattern di design-for-resilience e operational readiness.
  • Definire e implementare la governance del programma, processi ripetibili, metriche e documentazione per scalare gli sforzi di reliability tra i team.
  • Evangelizzare le aspettative di reliability e i processi di empowerment degli ingegneri che riducano il carico operativo e migliorino la preparazione agli incidenti.

Cosa cerchiamo:

Esperienza e Qualifiche Richieste

  • 10+ anni di esperienza nella gestione e nella consegna di programmi tecnici su larga scala in ambienti di infrastruttura cloud, sistemi distribuiti, SRE o platform engineering.
  • Esperienza nello sviluppo di infrastrutture presso due o più hyperscale cloud provider (ad es. AWS, Azure, GCP), con conoscenza dei cloud primitives, architetture multi-AZ/region e pattern control plane/data plane.
  • Successo dimostrato nella guida di Reliability Programs su scala - inclusi availability, failover, eccellenza operativa, riduzione degli incidenti o hardening delle dipendenze.
  • Forte comprensione delle pratiche di infrastruttura, sistemi distribuiti o SRE; la precedente esperienza in ingegneria o SRE è fortemente preferita.
  • Esperienza nel collaborare direttamente con la senior engineering leadership per definire la strategia e guidare grandi iniziative multi-team.
  • Capacità di tradurre obiettivi ambigui in piani programmatici azionabili con milestone, KPI e metriche di successo chiari.
  • Capacità dimostrata di gestire complesse dipendenze cross-organizzative, rischi tecnici e tempistiche multi-quarter.
  • Esperienza nella consegna di programmi su più cloud e/o servizi cloud-native su larga scala.
  • Esperienza nella costruzione e scalabilità di processi di ingegneria, framework operativi e meccanismi di allineamento degli stakeholder.

Qualifiche Preferibili

  • Background in distributed systems engineering, SRE, platform infrastructure o cloud services.
  • Esperienza con grandi flotte di calcolo (compute fleets), orchestrazione di container, autoscaling o architettura del control-plane.
  • Familiarità con le metodologie di reliability come SLO, error budgets, chaos engineering, analisi delle modalità di guasto e framework di gestione degli incidenti.
  • Competenza nell'uso di Jira o strumenti equivalenti per il monitoraggio e l'esecuzione dei programmi.
  • Laurea in Computer Science, Ingegneria o campo tecnico correlato; preferibile un titolo di studio av

Tradotto automaticamente dall’originale.

Pubblicato 3 giorni fa

Luogo

Vedi su Google Maps