Senior HPC and AI Network Software Architect
- Type de contrat
- Temps plein
- Lieu
- Zürich
- Entreprise
- NVIDIA Switzerland AG, Europaallee 39, 8004 Zürich
- Première publication
NVIDIA transforme les graphismes informatiques, le jeu PC et le calcul accéléré depuis plus de 25 ans. C'est un héritage unique d'innovation alimenté par une technologie incroyable — et des personnes extraordinaires. Aujourd'hui, nous exploitons le potentiel illimité de l'IA pour définir la prochaine ère de l'informatique. Une ère dans laquelle notre GPU agit comme le cerveau des ordinateurs, des robots et des voitures autonomes capables de comprendre le monde. Faire ce qui n'a jamais été fait auparavant demande de la vision, de l'innovation et les meilleurs talents au monde. En tant que NVIDIAN, vous serez immergé dans un environnement diversifié et solidaire où chacun est inspiré pour donner le meilleur de lui-même. Rejoignez l'équipe et voyez comment vous pouvez avoir un impact durable sur le monde.
Nous recherchons un Senior HPC and AI Network Software Architect pour aider à construire la prochaine génération d'infrastructures d'IA évolutives. Le rôle met l'accent sur l'entraînement distribué, l'inférence en temps réel et l'efficacité de la communication à travers de grands systèmes. Vous développerez de nouvelles approches logicielles et matérielles, façonnerez l'évolution de la plateforme grâce à l'innovation pratique, et contribuerez à la conception de systèmes alimentant les charges de travail d'IA les plus rapides au monde. Collaborez avec notre équipe distinguée de chercheurs et d'ingénieurs qui construisent des logiciels et du matériel pour l'IA à une échelle exceptionnelle.
Ce que vous ferez :
- Construire et faire évoluer l'architecture de systèmes logiciels évolutifs pour l'entraînement et l'inférence d'IA distribués, en se concentrant sur le débit, la latence, la résilience et l'efficacité de la mémoire à travers des déploiements à l'échelle de clusters.
- Développer et évaluer les capacités de communication et d'exécution de nouvelle génération dans des bibliothèques telles que NCCL, UCX et UCC, adaptées aux demandes évolutives des charges de travail d'IA de pointe.
- Collaborer avec les équipes de frameworks d'IA (par exemple, TensorFlow, PyTorch, JAX) et les équipes de plateformes internes pour construire des intégrations, explorer de nouvelles approches et améliorer les performances et la fiabilité de bout en bout.
- Collaborer sur les fonctionnalités matérielles et au niveau système à travers les GPU, les DPU et les interconnexions pour accélérer le mouvement des données et permettre de nouvelles capacités pour l'entraînement, l'inférence et le service de modèles à grande échelle.
- Piloter l'innovation à travers les systèmes d'exécution, les bibliothèques de communication et les couches de protocoles spécifiques à l'IA, aidant à transformer de nouvelles idées en capacités pratiques et en implémentations robustes.
Ce que nous devons voir :
- Ph.D., ou expérience équivalente dans l'industrie, en informatique, en génie informatique ou dans un domaine étroitement lié.
- Plus de 5 ans d'expérience en programmation système, calcul parallèle ou distribué, réseaux haute performance ou mouvement de données à grande échelle, y compris l'expérience de la conception et de la construction de systèmes complexes.
- Solide expérience de la programmation en C++, Python, et idéalement CUDA ou d'autres modèles de programmation GPU, avec une expérience avérée dans la construction de logiciels critiques pour la performance de qualité production.
- Expérience pratique approfondie avec les frameworks d'IA (par exemple, PyTorch, TensorFlow, JAX) et une compréhension solide de la manière dont les bibliothèques de communication et les systèmes d'exécution facilitent l'entraînement et l'inférence à grande échelle.
- Succès démontré dans le développement et le perfectionnement de systèmes à haut débit et faible latence, y compris la capacité de raisonner à travers les couches logicielles, les capacités matérielles et les goulots d'étranglement du système.
- Fortes compétences en collaboration dans un cadre multinational et interdisciplinaire, avec la capacité de contribuer par des idées, de créer une dynamique et de travailler efficacement avec des ingénieurs seniors, des chercheurs et des équipes partenaires.
Façons de vous démarquer :
- Expertise approfondie avec NCCL, UCX, UCC ou des bibliothèques de communication similaires utilisées dans les charges de travail d'IA et HPC à grande échelle.
- Solide expérience des protocoles de réseau et de communication, RDMA, communications collectives, transport sensible à la congestion ou réseau sensible aux accélérateurs.
- Connaissance complète de l'entraînement des grands modèles et du service d'inférence à grande échelle, y compris les goulots d'étranglement de communication, les défis de planification et les compromis au niveau système entre calcul, mémoire et fabric.
- Expérience dans la conception conjointe matériel-logiciel (hardware-software co-design) pour les systèmes d'IA distribués, y compris des contributions ayant fait progresser les capacités GPU, DPU, interconnexion ou d'exécution.
- Familiarité avec l'infrastructure pour le déploiement de LLMs ou de modèles basés sur les transformers, y compris le sharding, le pipelining, le parallélisme d'experts ou le parallélisme hybride.
Chez NVIDIA, vous travaillerez aux côtés de personnes dévouées à l'apprentissage continu et à la résolution créative de problèmes dans l'industrie, repoussant les limites du possible en IA et en calcul haute performance. Si vous êtes passionné par l'architecture de systèmes distribués, l'avancement de l'infrastructure d'IA et la résolution de problèmes à grande échelle, nous voulons vous entendre !
Largement considéré comme l'un des employeurs les plus désirables du monde technologique, NVIDIA offre des salaires hautement compétitifs et un programme d'avantages sociaux complet. Alors que vous planifiez votre avenir, voyez ce que nous pouvons vous offrir, à vous et à votre famille www.nvidiabenefits.com/
Traduit automatiquement depuis l’original.
Publié aujourd'hui