jobportalschweiz.ch
← Toutes les offres

Senior Storage & Data Engineer

Jobup

Type de contrat
Contrat
Lieu
Zürich
Première publication
Postuler
• 23 juillet 2026 • 80 - 100% • Durée indéterminée • Rämistrasse 101, 8006 Zürich • Se connecter pour voir l-estimation de salaire de jobup.ch Senior Storage & Data Engineer # Le Swiss National Supercomputing Centre (CSCS) développe et exploite une infrastructure de calcul haute performance et de recherche de données qui soutient la science de classe mondiale en Suisse. Son laboratoire d'utilisateurs est accessible aux chercheurs nationaux et internationaux du milieu académique, de l'industrie et du secteur des affaires. Le centre est exploité par l'ETH Zurich et possède des bureaux à son centre de données à Lugano et à Zurich. Pour ce poste, le lieu de travail est soit Lugano, soit Zürich. Le contrat est de deux ans. Contexte du projet ## Stocker des pétaoctets est la partie facile. Le plus difficile est tout ce qui se passe entre le moment où les données arrivent sur le disque et le moment où un chercheur - ou un travail d'entraînement - peut réellement leur faire confiance, les trouver et les utiliser. Nos systèmes de fichiers parallèles et nos stockages objets déplacent déjà les données rapidement. Ce qu'ils ne font pas d'eux-mêmes, c'est dire à un scientifique d'où vient un ensemble de données, quelles transformations l'ont produite, s'il s'agit de la version qui a appuyé le résultat publié au dernier trimestre, ou comment l'injecter dans un DataLoader sans saturer le sous-système d'E/S. Ce fossé - entre les octets bruts et les données utilisables, traçables et reproductibles - est l'endroit où ce rôle s'inscrit. Vous travaillerez aux deux extrémités : la couche de stockage (débit, intégrité, hiérarchisation à l'échelle de plusieurs pétaoctets) et la couche de données au-dessus (lignage, provenance, découvrabilité, modèles d'accès). Si vous avez déjà été agacé par le fait que *"les données sont sur le cluster"* soit traité comme la fin du travail plutôt que comme le début, continuez votre lecture. Description du poste ## • Faire le pont entre l'ingestion et l'utilisation. Concevoir les pipelines et les métadonnées qui transforment les données ingérées en quelque chose de trouvable et de consommable - catalogues, schémas et couches d'accès qui correspondent à la façon dont les travaux d'entraînement et les simulations lisent réellement, et pas seulement là où les octets se trouvent. • Rendre les données traçables. Construire le lignage et la provenance afin que tout ensemble de données, checkpoint ou résultat puisse être retracé jusqu'à ses entrées et ses transformations. La reproductibilité est ici une exigence de premier ordre, pas un ajout ultérieur. • Régler pour la charge de travail. Optimiser les systèmes de fichiers parallèles (Lustre, GPFS) et le stockage objet pour la concurrence, les petits fichiers et les modèles de grands checkpoints de l'entraînement distribué sur GPU et de la simulation HPC. • Opérer à grande échelle, en toute sécurité. Concevoir et exploiter un stockage multi-pétaoctets avec l'intégrité et la disponibilité dont dépend le travail scientifique - erasure coding, redondance, hiérarchisation du chaud vers l'archivage. • Tout automatiser. Déployer et mettre à l'échelle les services de stockage et de données en tant que code. L'infrastructure Snowflake ne survit pas à cette échelle. • Rendre l'ensemble observable. Instrumenter la santé du stockage, les tendances de capacité et les performances des pipelines afin que les problèmes apparaissent avant que les utilisateurs ne les ressentent. • Traduire. Transformer les modèles d'accès réels des scientifiques de domaine et des ingénieurs ML en exigences techniques - et s'opposer lorsque une demande risquerait de briser silencieusement quelque chose en aval. Pour un projet dans le domaine de la météo et du climat, visant à comprendre et à atténuer l'impact du changement climatique, un poste de deux ans est disponible.  Le contrat initial de deux ans pourrait potentiellement être prolongé ou même devenir permanent. Profil ## • Un diplôme technique (informatique, ingénierie) ou une expérience équivalente démontrant la même profondeur. • Solides bases en stockage : systèmes de fichiers (bloc et objet), optimisation des performances, redondance (RAID, erasure coding). • Python, et aisance dans l'automatisation de l'infrastructure (Ansible, Terraform ou similaire). • Une compréhension pratique de la manière dont le ML et les charges de travail scientifiques consomment les données - des milliards de petits fichiers, de grands checkpoints, le sharding - et pourquoi les configurations naïves échouent. • Un point de vue sur le lignage des données, la provenance ou la reproductibilité - et idéalement des outils que vous avez utilisés pour l'appliquer. Ce qui vous aidera à vous démarquer • Expérience pratique des systèmes de fichiers parallèles (Lustre, Spectrum Scale/GPFS) ou du stockage distribué (Ceph, VAST). • Formats de données scientifiques - HDF5, Zarr, Parquet - et des avis sur la place de chacun. • Stockage objet (S3) interfacé avec des frameworks ML (PyTorch, TensorFlow). • Orchestration (Kubernetes, Argo) et outils de mouvement de données. • Versionnage / catalogage de données (par exemple DVC, lakeFS, un catalogue de métadonnées) et connaissance des principes de données FAIR. • CI/CD et provisionnement : GitLab CI, HashiCorp Vault, MAAS. Nous ne nous attendons pas à ce que toutes les cases soient cochées. La profondeur en ingénierie du stockage *ou* des données, plus la curiosité de se développer vers l'autre, importe plus qu'une liste de contrôle complète. Ce que vous obtenez • Du matériel et une échelle que vous ne trouverez pas dans l'informatique d'entreprise - et des problèmes sans manuel constructeur. • Un travail qui permet directement la science publiée et l'entraînement de modèles à l'échelle de la frontière technologique. • La possibilité de façonner la manière dont les données sont *gérées*, et pas seulement maintenues, dans un environnement qui prend cela au sérieux. Nos

Traduit automatiquement depuis l’original.

Publié il y a 3 semaines

Lieu

Voir sur Google Maps