jobportalschweiz.ch
← Tutte le offerte

Senior HPC and AI Network Software Architect

NVIDIA Switzerland AG

Tipo di contratto
Tempo pieno
Luogo
Zürich
Azienda
NVIDIA Switzerland AG, Europaallee 39, 8004 Zürich
Prima pubblicazione
Candidati ora

NVIDIA sta trasformando la computer graphics, il PC gaming e l'accelerated computing da più di 25 anni. È un'eredità unica di innovazione alimentata da una grande tecnologia e da persone incredibili. Oggi, stiamo sfruttando il potenziale illimitato dell'AI per definire la prossima era dell'informatica. Un'era in cui la nostra GPU agisce come il cervello di computer, robot e auto a guida autonoma in grado di comprendere il mondo. Fare ciò che non è mai stato fatto prima richiede visione, innovazione e il miglior talento del mondo. Come NVIDIAN, sarai immerso in un ambiente diversificato e di supporto dove tutti sono ispirati a dare il meglio del proprio lavoro. Vieni a unirti al team e scopri come puoi avere un impatto duraturo sul mondo.

Cerchiamo un Senior HPC and AI Network Software Architect per aiutare a costruire la prossima generazione di infrastrutture AI scalabili. Il ruolo pone l'accento sull'addestramento distribuito, l'inferenza in tempo reale e l'efficienza della comunicazione attraverso grandi sistemi. Svilupperai nuovi approcci software e hardware, plasmerai l'evoluzione della piattaforma attraverso l'innovazione pratica e contribuirai alla progettazione di sistemi che alimentano i carichi di lavoro AI più veloci a livello globale. Collaborerai con il nostro distinto team di ricercatori e ingegneri che costruiscono software e hardware per l'AI a una scala straordinaria.

Cosa farai:

  • Costruire e far evolvere l'architettura di sistemi software scalabili per l'addestramento e l'inferenza AI distribuita, concentrandoti su throughput, latenza, resilienza ed efficienza della memoria in deployment su scala cluster.
  • Sviluppare e valutare le capacità di comunicazione e runtime di prossima generazione in librerie come NCCL, UCX e UCC, adattate alle esigenze in evoluzione dei carichi di lavoro AI di frontiera.
  • Collaborare con i team dei framework AI (ad es. TensorFlow, PyTorch, JAX) e i team interni della piattaforma per costruire integrazioni, esplorare nuovi approcci e migliorare le prestazioni e l'affidabilità end-to-end.
  • Collaborare su funzionalità hardware e a livello di sistema su GPU, DPU e interconnessioni per accelerare il movimento dei dati e abilitare nuove capacità per l'addestramento, l'inferenza e il serving di modelli su scala.
  • Guidare l'innovazione attraverso sistemi runtime, librerie di comunicazione e livelli di protocollo specifici per l'AI, aiutando a trasformare nuove idee in capacità pratiche e implementazioni robuste.

Cosa dobbiamo vedere:

  • Ph.D., o equivalente esperienza nel settore, in informatica, ingegneria informatica o un campo strettamente correlato.
  • 5+ anni di esperienza nella programmazione di sistemi, calcolo parallelo o distribuito, networking ad alte prestazioni o movimento di dati su larga scala, inclusa l'esperienza nella progettazione e costruzione di sistemi complessi.
  • Solida base di programmazione in C++, Python e idealmente CUDA o altri modelli di programmazione GPU, con un track record nella costruzione di software critico per le prestazioni di qualità produzione.
  • Ampia esperienza pratica con i framework AI (ad es. PyTorch, TensorFlow, JAX) e una solida comprensione di come le librerie di comunicazione e i sistemi runtime facilitino l'addestramento e l'inferenza su larga scala.
  • Successo dimostrato nello sviluppo e nel perfezionamento di sistemi ad alto throughput e bassa latenza, inclusa la capacità di ragionare attraverso stack software, capacità hardware e colli di bottiglia del sistema.
  • Forti capacità di collaborazione in un contesto multinazionale e interdisciplinare, con la capacità di contribuire con idee, creare slancio e lavorare efficacemente con ingegneri senior, ricercatori e team partner.

Modi per distinguersi dalla massa:

  • Profonda competenza con NCCL, UCX, UCC o librerie di comunicazione simili utilizzate in carichi di lavoro AI e HPC su larga scala.
  • Solida esperienza in protocolli di rete e comunicazione, RDMA, comunicazioni collettive, trasporto consapevole della congestione o networking consapevole dell'acceleratore.
  • Conoscenza completa dell'addestramento di modelli di grandi dimensioni e del serving dell'inferenza su scala, inclusi colli di bottiglia della comunicazione, sfide di scheduling e compromessi a livello di sistema tra calcolo, memoria e fabric.
  • Esperienza nella creazione di co-design hardware-software per sistemi AI distribuiti, incluse contribuzioni che hanno fatto progredire le capacità di GPU, DPU, interconnessione o runtime.
  • Familiarità con l'infrastruttura per il deployment di LLM o modelli basati su transformer, inclusi sharding, pipelining, expert parallelism o hybrid parallelism.

In NVIDIA, lavorerai accanto a individui dedicati all'apprendimento continuo e alla risoluzione creativa dei problemi nel settore, spingendo i confini di ciò che è possibile nell'AI e nell'high-performance computing. Se ti appassiona l'architettura di sistemi distribuiti, l'avanzamento delle infrastrutture AI e la risoluzione di problemi su scala, vogliamo sentirti!

Ampiamente considerato uno dei datori di lavoro più desiderabili del mondo tecnologico, NVIDIA offre stipendi altamente competitivi e un pacchetto completo di benefit. Mentre pianifichi il tuo futuro, scopri cosa possiamo offrire a te e alla tua famiglia www.nvidiabenefits.com/

Tradotto automaticamente dall’originale.

Pubblicato oggi

Luogo

Vedi su Google Maps