jobportalschweiz.ch
← Toutes les offres

Sr. Staff Technical Program Manager - Reliability

Databricks

Type de contrat
Temps plein
Lieu
Bellevue
Première publication
Postuler

P-1489

A propos de Databricks

Chez Databricks, nous sommes passionnés par l'autonomisation des équipes de données pour relever les défis les plus complexes au monde — de la concrétisation du prochain mode de transport à l'accélération du développement de percées médicales. Nous y parvenons en construisant et en exploitant la meilleure plateforme d'infrastructure de données et d'IA au monde, permettant à nos clients de tirer parti d'analyses de données approfondies et de renforcer leur activité.

Le Rôle

Nous recherchons un Senior Staff Technical Program Manager (TPM) exceptionnel pour la Reliability afin de diriger la stratégie, l'exécution et l'amélioration continue de nos initiatives de Reliability les plus critiques à travers les équipes d'infrastructure et d'ingénierie produit chez Databricks. À mesure que Databricks change d'échelle pour prendre en charge des milliers de clients et les charges de travail les plus gourmandes en données au monde, la Reliability est fondamentale pour notre mission. Dans ce rôle, vous dirigerez des programmes inter-entreprises qui améliorent considérablement la fiabilité, la performance et l'excellence opérationnelle de notre infrastructure multi-cloud.

Il s'agit d'un rôle de leadership à haute visibilité et à fort impact, en partenariat étroit avec nos dirigeants techniques les plus expérimentés, y compris les sponsors exécutifs des programmes de Reliability, les TL seniors et les Engineering Managers, afin de définir la stratégie de Reliability, de fixer des objectifs à long terme et d'exécuter des programmes multi-trimestriels pour construire la plateforme cloud la plus fiable de la planète sur laquelle nos clients pourront exécuter leurs charges de travail critiques.

Pour réussir, vous devez posséder une compréhension approfondie des systèmes distribués à grande échelle, de l'infrastructure cloud et des principes d'ingénierie qui favorisent l'excellence opérationnelle. Vous utiliserez votre expérience pour anticiper les risques, façonner la direction technique et livrer des programmes complexes à travers les équipes produit, ingénierie, SRE et les partenaires cloud.

Vous aurez l'opportunité de :

Diriger la Stratégie de Reliability + Roadmaps Multi-Trimestriels

  • Collaborer avec la direction technique senior pour définir la roadmap de Reliability à long terme, influencer la direction technique et assurer l'alignement entre les équipes.
  • Assurer la clarté et l'alignement des priorités entre les équipes d'ingénierie, y compris Platform Engineering, Compute Fleet Management, SRE, Security et Cloud Partnerships.

Piloter l'Exécution des Programmes de Reliability Critiques

  • Assumer l'exécution du programme de bout en bout : planification, gestion des risques, cartographie des dépendances, décisions de compromis, reporting de statut et livraison.
  • Identifier les lacunes dans les processus ou l'architecture et travailler avec les TL pour piloter de manière proactive des améliorations organisationnelles ou techniques.

Partenariat Approfondi avec l'Ingénierie & Influence de la Direction Technique

  • Utiliser votre expérience en infrastructure, systèmes distribués ou SRE pour aider les équipes à prendre des décisions de conception et de priorisation judicieuses.
  • Faciliter l'alignement entre les équipes interfonctionnelles pour s'assurer que les programmes sont techniquement fondés et prêts pour l'exécution.
  • Apporter une pensée systémique pour diagnostiquer les goulots d'étranglement de la fiabilité et piloter les améliorations de la scalabilité, de la tolérance aux pannes, de l'automatisation et des outils opérationnels.

Élever la Culture de la Reliability à travers l'Organisation

  • Piloter l'adoption des meilleures pratiques de fiabilité à travers les équipes d'ingénierie - y compris les budgets d'erreur, les revues d'incidents, les modèles de conception pour la résilience et la préparation opérationnelle.
  • Définir et mettre en œuvre la gouvernance des programmes, les processus répétables, les métriques et la documentation pour mettre à l'échelle les efforts de fiabilité à travers les équipes.
  • Prêcher les attentes en matière de fiabilité et les processus d'autonomisation des ingénieurs qui réduisent la charge opérationnelle et améliorent la préparation aux incidents.

Ce que nous recherchons :

Expérience Requise & Qualifications

  • Plus de 10 ans d'expérience dans la gestion et la livraison de programmes techniques à grande échelle dans des environnements d'infrastructure cloud, de systèmes distribués, de SRE ou d'ingénierie de plateforme.
  • Expérience dans le développement d'infrastructure chez deux ou plusieurs fournisseurs de cloud hyperscale (ex. AWS, Azure, GCP), avec des connaissances des primitives cloud, de l'architecture multi-AZ/région et des modèles de control plane/data plane.
  • Succès démontré dans la direction de programmes de Reliability à grande échelle - incluant la disponibilité, le failover, l'excellence opérationnelle, la réduction des incidents ou le renforcement des dépendances.
  • Compréhension approfondie de l'infrastructure, des systèmes distribués ou des pratiques SRE ; une expérience préalable en ingénierie ou en SRE est fortement préférée.
  • Expérience de partenariat direct avec la direction technique senior pour définir la stratégie et piloter de grandes initiatives multi-équipes.
  • Capacité à traduire des objectifs ambigus en plans de programme exploitables avec des jalons clairs, des KPIs et des mesures de succès.
  • Capacité démontrée à gérer des dépendances inter-organisationnelles complexes, des risques techniques et des calendriers multi-trimestriels.
  • Expérience dans la livraison de programmes à travers plusieurs clouds et/ou des services cloud-native à grande échelle.
  • Expérience dans la construction et la mise à l'échelle de processus d'ingénierie, de cadres opérationnels et de mécanismes d'alignement des parties prenantes.

Qualifications Préférées

  • Expérience en ingénierie de systèmes distribués

Traduit automatiquement depuis l’original.

Publié il y a 3 jours

Lieu

Voir sur Google Maps