Sr. Staff Technical Program Manager - Reliability
- Tipo di contratto
- Tempo pieno
- Luogo
- Bellevue
- Prima pubblicazione
P-1489
Informazioni su Databricks
In Databricks, siamo appassionati dell'idea di dare potere ai team di dati per affrontare le sfide più complesse del mondo — dal portare alla realtà la prossima modalità di trasporto all'accelerare lo sviluppo di scoperte mediche. Raggiungiamo questo obiettivo costruendo e gestendo la migliore piattaforma di infrastruttura dati e AI al mondo, consentendo ai nostri clienti di sfruttare approfonditi insight sui dati e migliorare il proprio business.
Il Ruolo
Cerchiamo un eccezionale Senior Staff Technical Program Manager (TPM) per la Reliability per guidare la strategia, l'esecuzione e il miglioramento continuo delle nostre iniziative di Reliability più critiche attraverso i team di infrastruttura e product engineering in Databricks. Mentre Databricks scala per supportare migliaia di clienti e i carichi di lavoro più intensivi di dati al mondo, la Reliability è fondamentale per la nostra missione. In questo ruolo, guiderai programmi interaziendali che migliorano significativamente la reliability, le prestazioni e l'eccellenza operativa della nostra infrastruttura multi-cloud.
Si tratta di un ruolo di leadership ad alta visibilità e alto impatto, in stretto partenariato con i nostri leader engineering più senior, inclusi gli sponsor esecutivi dei programmi di Reliability, i senior TL e gli Engineering Manager, per definire la strategia di Reliability, stabilire obiettivi a lungo termine ed eseguire programmi multi-quarter per costruire la piattaforma cloud più affidabile del pianeta su cui i nostri clienti possano eseguire i loro carichi di lavoro mission-critical.
Per avere successo, devi possedere una profonda comprensione dei sistemi distribuiti su larga scala, dell'infrastruttura cloud e dei principi di ingegneria che guidano l'eccellenza operativa. Sfrutterai il tuo background per anticipare i rischi, dare forma alla direzione tecnica e consegnare programmi complessi attraverso i team di prodotto, ingegneria, SRE e i partner cloud.
Avrai l'opportunità di:
Guidare la Strategia di Reliability + Roadmap Multi-Quarter
- Collaborare con la senior engineering leadership per definire la roadmap di Reliability a lungo termine, influenzare la direzione tecnica e garantire l'allineamento tra i team.
- Garantire chiarezza e allineamento sulle priorità tra i team di ingegneria, inclusi Platform Engineering, Compute Fleet Management, SRE, Security e Cloud Partnerships.
Guidare l'Esecuzione di Programmi di Reliability Critici
- Gestire l'esecuzione del programma end-to-end: pianificazione, gestione dei rischi, mappatura delle dipendenze, decisioni di trade-off, reporting dello stato e consegna.
- Identificare lacune nei processi o nell'architettura e lavorare con i TL per guidare proattivamente miglioramenti organizzativi o tecnici.
Collaborare Profondamente con l'Ingegneria e Influenzare la Direzione Tecnica
- Utilizzare il tuo background in infrastruttura, sistemi distribuiti o SRE per aiutare i team a prendere decisioni solide in termini di design e prioritizzazione.
- Facilitare l'allineamento tra team cross-funzionali per garantire che i programmi siano tecnicamente fondati e pronti per l'esecuzione.
- Portare il pensiero sistemico per diagnosticare i colli di bottiglia della reliability e guidare miglioramenti alla scalabilità, alla tolleranza ai guasti, all'automazione e agli strumenti operativi.
Elevare la Cultura della Reliability in tutta l'Organizzazione
- Guidare l'adozione delle migliori pratiche di reliability tra i team di ingegneria - inclusi error budget, incident review, pattern di design-for-resilience e operational readiness.
- Definire e implementare la governance del programma, processi ripetibili, metriche e documentazione per scalare gli sforzi di reliability tra i team.
- Evangelizzare le aspettative di reliability e i processi di empowerment degli ingegneri che riducano il carico operativo e migliorino la preparazione agli incidenti.
Cosa cerchiamo:
Esperienza e Qualifiche Richieste
- 10+ anni di esperienza nella gestione e nella consegna di programmi tecnici su larga scala in ambienti di infrastruttura cloud, sistemi distribuiti, SRE o platform engineering.
- Esperienza nello sviluppo di infrastrutture presso due o più hyperscale cloud provider (ad es. AWS, Azure, GCP), con conoscenza dei cloud primitives, architetture multi-AZ/region e pattern control plane/data plane.
- Successo dimostrato nella guida di Reliability Programs su scala - inclusi availability, failover, eccellenza operativa, riduzione degli incidenti o hardening delle dipendenze.
- Forte comprensione delle pratiche di infrastruttura, sistemi distribuiti o SRE; la precedente esperienza in ingegneria o SRE è fortemente preferita.
- Esperienza nel collaborare direttamente con la senior engineering leadership per definire la strategia e guidare grandi iniziative multi-team.
- Capacità di tradurre obiettivi ambigui in piani programmatici azionabili con milestone, KPI e metriche di successo chiari.
- Capacità dimostrata di gestire complesse dipendenze cross-organizzative, rischi tecnici e tempistiche multi-quarter.
- Esperienza nella consegna di programmi su più cloud e/o servizi cloud-native su larga scala.
- Esperienza nella costruzione e scalabilità di processi di ingegneria, framework operativi e meccanismi di allineamento degli stakeholder.
Qualifiche Preferibili
- Background in distributed systems engineering, SRE, platform infrastructure o cloud services.
- Esperienza con grandi flotte di calcolo (compute fleets), orchestrazione di container, autoscaling o architettura del control-plane.
- Familiarità con le metodologie di reliability come SLO, error budgets, chaos engineering, analisi delle modalità di guasto e framework di gestione degli incidenti.
- Competenza nell'uso di Jira o strumenti equivalenti per il monitoraggio e l'esecuzione dei programmi.
- Laurea in Computer Science, Ingegneria o campo tecnico correlato; preferibile un titolo di studio av
Tradotto automaticamente dall’originale.
Pubblicato 3 giorni fa