jobportalschweiz.ch
← Alle Stellen

Senior Storage & Data Engineer

Jobup

Anstellung
Vertrag
Ort
Zürich
Erstmals ausgeschrieben
Jetzt bewerben
• 23 juillet 2026 • 80 - 100% • Durée indéterminée • Rämistrasse 101, 8006 Zürich • Se connecter pour voir l-estimation de salaire de jobup.ch Senior Storage & Data Engineer # Das Swiss National Supercomputing Centre (CSCS) entwickelt und betreibt eine High-Performance-Computing- und Datenforschungs-Infrastruktur, die erstklassige Wissenschaft in der Schweiz unterstützt. Sein Benutzerlabor steht Forschern aus dem In- und Ausland in der Wissenschaft, der Industrie und dem Wirtschaftssektor zur Verfügung. Das Zentrum wird von der ETH Zurich betrieben und hat Standorte in seinem Rechenzentrum in Lugano und in Zürich. Für diese Position ist der Arbeitsort entweder Lugano oder Zürich. Der Vertrag ist auf zwei Jahre befristet. Projektgrundlagen ## Petabytes zu speichern ist der einfache Teil. Der schwierige Teil ist alles zwischen dem Moment, in dem Daten auf der Festplatte landen, und dem Moment, in dem ein Forscher – oder ein Trainingsjob – ihnen tatsächlich vertrauen, sie finden und nutzen kann. Unsere parallelen Dateisysteme und Object Stores bewegen Daten bereits schnell. Was sie jedoch nicht von allein tun, ist einem Wissenschaftler zu sagen, woher ein Datensatz stammt, welche Transformationen ihn erzeugt haben, ob es die Version ist, die das Ergebnis des letzten Quartals gestützt hat, oder wie man ihn einem DataLoader zuführt, ohne das I/O-Subsystem zu sättigen. Diese Lücke – zwischen rohen Bytes und nutzbaren, rückverfolgbaren, reproduzierbaren Daten – ist der Bereich, in dem diese Rolle angesiedelt ist. Sie werden an beiden Enden arbeiten: der Storage-Schicht (Durchsatz, Integrität, Tiering im Multi-Petabyte-Bereich) und der darüber liegenden Data-Schicht (Lineage, Provenance, Auffindbarkeit, Zugriffsmuster). Wenn Sie es jemals ärgerlich fanden, dass "die Daten sind auf dem Cluster" als Ende der Arbeit und nicht als deren Anfang behandelt wird, lesen Sie weiter. Jobbeschreibung ## • Die Brücke zwischen Ingestion und Nutzung schlagen. Entwerfen Sie die Pipelines und Metadaten, die ingestierte Daten in etwas Auffindbares und Konsumierbares verwandeln – Kataloge, Schemata und Zugriffsschichten, die dazu passen, wie Trainingsjobs und Simulationen tatsächlich lesen, und nicht nur, wo Bytes liegen. • Daten rückverfolgbar machen. Bauen Sie Lineage und Provenance auf, damit jeder Datensatz, Checkpoint oder jedes Ergebnis auf seine Eingaben und Transformationen zurückgeführt werden kann. Reproduzierbarkeit ist hier eine erstklassige Anforderung, kein nachträgliches Add-on. • Auf die Workload optimieren. Optimieren Sie parallele Dateisysteme (Lustre, GPFS) und Object Storage für die Nebenläufigkeit, Small-File- und Large-Checkpoint-Muster von verteiltem GPU-Training und HPC-Simulationen. • In großem Maßstab sicher betreiben. Entwerfen und betreiben Sie Multi-Petabyte-Storage mit der Integrität und Verfügbarkeit, auf die wissenschaftliche Arbeit angewiesen ist – Erasure Coding, Redundanz, Hot-to-Archival Tiering. • Alles automatisieren. Implementieren und skalieren Sie Storage- und Datendienste als Code. Snowflake-Infrastruktur überlebt in dieser Größenordnung nicht. • Beobachtbarkeit schaffen. Instrumentieren Sie die Storage-Gesundheit, Kapazitätstrends und die Pipeline-Performance, damit Probleme auftreten, bevor Benutzer sie bemerken. • Übersetzen. Wandeln Sie reale Zugriffsmuster von Domänenwissenschaftlern und ML-Ingenieuren in technische Anforderungen um – und wehren Sie sich, wenn eine Anfrage im Nachgang stillschweigend etwas beschädigen würde. Für ein Projekt im Bereich Wetter und Klima, das darauf abzielt, die Auswirkungen des Klimawandels zu verstehen und zu mildern, ist eine Stelle für zwei Jahre verfügbar. Der anfängliche Zwei-Jahres-Vertrag könnte potenziell verlängert werden oder sogar unbefristet werden. Profil ## • Ein technischer Abschluss (Informatik, Ingenieurwesen) oder gleichwertige Erfahrung, die dieselbe Tiefe nachweist. • Fundierte Storage-Grundlagen: Dateisysteme (Block und Object), Performance-Tuning, Redundanz (RAID, Erasure Coding). • Python und Erfahrung in der Automatisierung von Infrastrukturen (Ansible, Terraform oder Ähnliches). • Ein praktisches Verständnis dafür, wie ML- und wissenschaftliche Workloads Daten konsumieren – Milliarden kleiner Dateien, große Checkpoints, Sharding – und warum naive Layouts scheitern. • Eine klare Sicht auf Data Lineage, Provenance oder Reproduzierbarkeit – und idealerweise Tools, die Sie zur Durchsetzung genutzt haben. Was Ihnen hilft, sich abzuheben • Hands-on-Erfahrung mit parallelen Dateisystemen (Lustre, Spectrum Scale/GPFS) oder verteiltem Storage (Ceph, VAST). • Wissenschaftliche Datenformate – HDF5, Zarr, Parquet – und eine Meinung dazu, wann welches seinen Platz verdient. • Object Storage (S3) in Verbindung mit ML-Frameworks (PyTorch, TensorFlow). • Orchestrierung (Kubernetes, Argo) und Tools zur Datenbewegung. • Datenversionierung / Katalogisierung (z. B. DVC, lakeFS, ein Metadatenkatalog) und Vertrautheit mit FAIR-Datenprinzipien. • CI/CD und Provisionierung: GitLab CI, HashiCorp Vault, MAAS. Wir erwarten nicht, dass jedes Kästchen angekreuzt wird. Tiefe in der Storage- *oder* Data Engineering-Disziplin, gepaart mit der Neugier, in die andere hineinzuwachsen, ist wichtiger als eine vollständige Checkliste. Was Sie bekommen • Hardware und Skalierung, die Sie in der Enterprise-IT nicht finden werden – und Probleme, für die es kein Vendor-Playbook gibt. • Arbeit, die direkt veröffentlichte Wissenschaft und Modelltraining im Grenzbereich ermöglicht. • Raum, um mitzugestalten, wie Daten *verwaltet* und nicht nur instand gehalten werden, in einem Umfeld, das dies ernst nimmt. Unsere Kernwerte als Leitprinzipien: • Neugier: Sie genießen es, Systeme tiefgehend zu lernen und zu verstehen • Offenheit: Sie arbeiten effektiv zusammen und schätzen unterschiedliche Perspektiven • Mut: Sie sind bereit, schwierige oder unbekannte Probleme anzugehen • Unterstützung: Sie helfen Kollegen und Benutzern beim Erfolg • Integritä

Automatisch aus dem Original übersetzt.

Ausgeschrieben vor 3 Wochen

Ort

Auf Google Maps ansehen