Senior HPC and AI Network Software Architect
- Tipo di contratto
- Tempo pieno
- Luogo
- Zürich
- Azienda
- NVIDIA Switzerland AG, Europaallee 39, 8004 Zürich
- Prima pubblicazione
NVIDIA sta trasformando la computer graphics, il PC gaming e l'accelerated computing da più di 25 anni. È un'eredità unica di innovazione alimentata da una grande tecnologia e da persone incredibili. Oggi, stiamo sfruttando il potenziale illimitato dell'AI per definire la prossima era dell'informatica. Un'era in cui la nostra GPU agisce come il cervello di computer, robot e auto a guida autonoma in grado di comprendere il mondo. Fare ciò che non è mai stato fatto prima richiede visione, innovazione e il miglior talento del mondo. Come NVIDIAN, sarai immerso in un ambiente diversificato e di supporto dove tutti sono ispirati a dare il meglio del proprio lavoro. Vieni a unirti al team e scopri come puoi avere un impatto duraturo sul mondo.
Cerchiamo un Senior HPC and AI Network Software Architect per aiutare a costruire la prossima generazione di infrastrutture AI scalabili. Il ruolo pone l'accento sull'addestramento distribuito, l'inferenza in tempo reale e l'efficienza della comunicazione attraverso grandi sistemi. Svilupperai nuovi approcci software e hardware, plasmerai l'evoluzione della piattaforma attraverso l'innovazione pratica e contribuirai alla progettazione di sistemi che alimentano i carichi di lavoro AI più veloci a livello globale. Collaborerai con il nostro distinto team di ricercatori e ingegneri che costruiscono software e hardware per l'AI a una scala straordinaria.
Cosa farai:
- Costruire e far evolvere l'architettura di sistemi software scalabili per l'addestramento e l'inferenza AI distribuita, concentrandoti su throughput, latenza, resilienza ed efficienza della memoria in deployment su scala cluster.
- Sviluppare e valutare le capacità di comunicazione e runtime di prossima generazione in librerie come NCCL, UCX e UCC, adattate alle esigenze in evoluzione dei carichi di lavoro AI di frontiera.
- Collaborare con i team dei framework AI (ad es. TensorFlow, PyTorch, JAX) e i team interni della piattaforma per costruire integrazioni, esplorare nuovi approcci e migliorare le prestazioni e l'affidabilità end-to-end.
- Collaborare su funzionalità hardware e a livello di sistema su GPU, DPU e interconnessioni per accelerare il movimento dei dati e abilitare nuove capacità per l'addestramento, l'inferenza e il serving di modelli su scala.
- Guidare l'innovazione attraverso sistemi runtime, librerie di comunicazione e livelli di protocollo specifici per l'AI, aiutando a trasformare nuove idee in capacità pratiche e implementazioni robuste.
Cosa dobbiamo vedere:
- Ph.D., o equivalente esperienza nel settore, in informatica, ingegneria informatica o un campo strettamente correlato.
- 5+ anni di esperienza nella programmazione di sistemi, calcolo parallelo o distribuito, networking ad alte prestazioni o movimento di dati su larga scala, inclusa l'esperienza nella progettazione e costruzione di sistemi complessi.
- Solida base di programmazione in C++, Python e idealmente CUDA o altri modelli di programmazione GPU, con un track record nella costruzione di software critico per le prestazioni di qualità produzione.
- Ampia esperienza pratica con i framework AI (ad es. PyTorch, TensorFlow, JAX) e una solida comprensione di come le librerie di comunicazione e i sistemi runtime facilitino l'addestramento e l'inferenza su larga scala.
- Successo dimostrato nello sviluppo e nel perfezionamento di sistemi ad alto throughput e bassa latenza, inclusa la capacità di ragionare attraverso stack software, capacità hardware e colli di bottiglia del sistema.
- Forti capacità di collaborazione in un contesto multinazionale e interdisciplinare, con la capacità di contribuire con idee, creare slancio e lavorare efficacemente con ingegneri senior, ricercatori e team partner.
Modi per distinguersi dalla massa:
- Profonda competenza con NCCL, UCX, UCC o librerie di comunicazione simili utilizzate in carichi di lavoro AI e HPC su larga scala.
- Solida esperienza in protocolli di rete e comunicazione, RDMA, comunicazioni collettive, trasporto consapevole della congestione o networking consapevole dell'acceleratore.
- Conoscenza completa dell'addestramento di modelli di grandi dimensioni e del serving dell'inferenza su scala, inclusi colli di bottiglia della comunicazione, sfide di scheduling e compromessi a livello di sistema tra calcolo, memoria e fabric.
- Esperienza nella creazione di co-design hardware-software per sistemi AI distribuiti, incluse contribuzioni che hanno fatto progredire le capacità di GPU, DPU, interconnessione o runtime.
- Familiarità con l'infrastruttura per il deployment di LLM o modelli basati su transformer, inclusi sharding, pipelining, expert parallelism o hybrid parallelism.
In NVIDIA, lavorerai accanto a individui dedicati all'apprendimento continuo e alla risoluzione creativa dei problemi nel settore, spingendo i confini di ciò che è possibile nell'AI e nell'high-performance computing. Se ti appassiona l'architettura di sistemi distribuiti, l'avanzamento delle infrastrutture AI e la risoluzione di problemi su scala, vogliamo sentirti!
Ampiamente considerato uno dei datori di lavoro più desiderabili del mondo tecnologico, NVIDIA offre stipendi altamente competitivi e un pacchetto completo di benefit. Mentre pianifichi il tuo futuro, scopri cosa possiamo offrire a te e alla tua famiglia www.nvidiabenefits.com/
Tradotto automaticamente dall’originale.
Pubblicato oggi