jobportalschweiz.ch
← Alle Stellen

Senior HPC and AI Network Software Architect

NVIDIA Switzerland AG

Anstellung
Vollzeit
Ort
Zürich
Unternehmen
NVIDIA Switzerland AG, Europaallee 39, 8004 Zürich
Erstmals ausgeschrieben
Jetzt bewerben

NVIDIA transformiert seit mehr als 25 Jahren Computergrafik, PC-Gaming und beschleunigtes Computing. Es ist ein einzigartiges Erbe der Innovation, das durch großartige Technologie – und erstaunliche Menschen – angetrieben wird. Heute nutzen wir das unbegrenzte Potenzial von KI, um die nächste Ära des Computing zu definieren. Eine Ära, in der unsere GPU als Gehirn von Computern, Robotern und selbstfahrenden Autos fungiert, die die Welt verstehen können. Das zu tun, was noch nie zuvor getan wurde, erfordert Vision, Innovation und die weltweit besten Talente. Als NVIDIAN werden Sie in ein vielfältiges, unterstützendes Umfeld eintauchen, in dem jeder dazu inspiriert wird, seine beste Arbeit zu leisten. Kommen Sie in das Team und sehen Sie, wie Sie einen bleibenden Eindruck auf der Welt hinterlassen können.

Wir suchen einen Senior HPC and AI Network Software Architect, um beim Aufbau der nächsten Generation skalierbarer KI-Infrastruktur zu helfen. Die Rolle legt den Schwerpunkt auf verteiltes Training, Echtzeit-Inferenz und Kommunikationseffizienz über große Systeme hinweg. Sie werden neue Software- und Hardwareansätze entwickeln, die Plattformentwicklung durch praxisnahe Innovation gestalten und dazu beitragen, Systeme zu entwerfen, die die schnellsten KI-Workloads weltweit antreiben. Arbeiten Sie mit unserem herausragenden Team aus Forschern und Ingenieuren zusammen, die Software und Hardware für KI in einem außerordentlichen Maßstab entwickeln.

Was Sie tun werden:

  • Aufbau und Weiterentwicklung der Architektur skalierbarer Softwaresysteme für verteiltes KI-Training und Inferenz, mit Fokus auf Durchsatz, Latenz, Resilienz und Speichereffizienz bei Cluster-weiten Bereitstellungen.
  • Entwicklung und Evaluierung von Kommunikations- und Runtime-Fähigkeiten der nächsten Generation in Bibliotheken wie NCCL, UCX und UCC, die auf die sich entwickelnden Anforderungen von Frontier-KI-Workloads zugeschnitten sind.
  • Partnerschaft mit KI-Framework-Teams (z. B. TensorFlow, PyTorch, JAX) und internen Plattformteams, um Integrationen aufzubauen, neue Ansätze zu untersuchen und die End-to-End-Leistung und Zuverlässigkeit zu verbessern.
  • Zusammenarbeit an Hardware- und Systemebenen-Funktionen über GPUs, DPUs und Interconnects hinweg, um die Datenbewegung zu beschleunigen und neue Funktionen für Training, Inferenz und Model Serving in großem Maßstab zu ermöglichen.
  • Vorantreiben von Innovationen in Runtime-Systemen, Kommunikationsbibliotheken und KI-spezifischen Protokollschichten, um dabei zu helfen, neue Ideen in praktische Funktionen und robuste Implementierungen umzusetzen.

Was wir sehen müssen:

  • Ph.D. oder gleichwertige Branchenerfahrung in Informatik, Computer Engineering oder einem eng verwandten Bereich.
  • 5+ Jahre Erfahrung in der Systemprogrammierung, parallelem oder verteiltem Computing, High-Performance-Networking oder groß angelegter Datenbewegung, einschließlich Erfahrung im Entwurf und Aufbau komplexer Systeme.
  • Starker Programmierhintergrund in C++, Python und idealerweise CUDA oder anderen GPU-Programmiermodellen, mit einer Erfolgsbilanz beim Aufbau produktionsreifer, leistungskritischer Software.
  • Umfangreiche praktische Erfahrung mit KI-Frameworks (z. B. PyTorch, TensorFlow, JAX) und ein solides Verständnis dafür, wie Kommunikationsbibliotheken und Runtime-Systeme groß angelegtes Training und Inferenz erleichtern.
  • Nachgewiesener Erfolg bei der Entwicklung und Verfeinerung von Systemen mit hohem Durchsatz und geringer Latenz, einschließlich der Fähigkeit, über Software-Stacks, Hardware-Fähigkeiten und Systemengpässe zu argumentieren.
  • Starke Kollaborationsfähigkeiten in einem multinationalen, interdisziplinären Umfeld, mit der Fähigkeit, Ideen einzubringen, Dynamik aufzubauen und effektiv mit erfahrenen Ingenieuren, Forschern und Partnerteams zusammenzuarbeiten.

Wege, um sich von der Masse abzuheben:

  • Tiefe Expertise mit NCCL, UCX, UCC oder ähnlichen Kommunikationsbibliotheken, die in groß angelegten KI- und HPC-Workloads verwendet werden.
  • Starker Hintergrund in Netzwerk- und Kommunikationsprotokollen, RDMA, Collective Communications, Congestion-aware Transport oder Accelerator-aware Networking.
  • Umfassendes Wissen über das Training großer Modelle und das Inferenz-Serving in großem Maßstab, einschließlich Kommunikationsengpässen, Scheduling-Herausforderungen und Systemebenen-Tradeoffs über Compute, Memory und Fabric hinweg.
  • Erfahrung im Hardware-Software-Co-Design für verteilte KI-Systeme, einschließlich Beiträgen, die GPU-, DPU-, Interconnect- oder Runtime-Fähigkeiten vorangebracht haben.
  • Vertrautheit mit der Infrastruktur für die Bereitstellung von LLMs oder Transformer-basierten Modellen, einschließlich Sharding, Pipelining, Expert Parallelism oder Hybrid Parallelism.

Bei NVIDIA arbeiten Sie neben Menschen, die sich der kontinuierlichen Weiterbildung und kreativen Problemlösung in der Branche widmen und die Grenzen dessen verschieben, was in der KI und im High-Performance Computing möglich ist. Wenn Sie leidenschaftlich daran interessiert sind, verteilte Systeme zu entwerfen, die KI-Infrastruktur voranzutreiben und Probleme in großem Maßstab zu lösen, wollen wir von Ihnen hören!

NVIDIA gilt weithin als einer der begehrtesten Arbeitgeber der Technologiewelt und bietet hochkompetitive Gehälter und ein umfassendes Benefit-Paket. Während Sie Ihre Zukunft planen, sehen Sie, was wir Ihnen und Ihrer Familie bieten können: www.nvidiabenefits.com/

Automatisch aus dem Original übersetzt.

Ausgeschrieben heute

Ort

Auf Google Maps ansehen