jobportalschweiz.ch
← Toutes les offres

Data Engineer (Detect & Track Distillation)

Harmattan AI

Type de contrat
Temps plein
Lieu
Lausanne
Première publication
Postuler
À PROPOS DE NOUS Harmattan AI est un leader de la défense de nouvelle génération qui construit des systèmes de défense autonomes et évolutifs. Suite à la clôture d'une série B de $200M, valorisant l'entreprise à $1.4 billion, nous élargissons nos équipes et nos capacités pour fournir des systèmes critiques aux forces alliées. Notre travail est guidé par des valeurs claires : construire des technologies avec un impact réel, rechercher l'excellence dans tout ce que nous faisons, fixer des objectifs ambitieux et relever les défis techniques les plus difficiles. Nous opérons dans un environnement exigeant où la rigueur, la responsabilité et l'exécution sont attendues. À PROPOS DU RÔLE Nos équipes ML entraînent des modèles sur des ensembles de données dérivés de volumes importants de données brutes et non structurées. La qualité du modèle dépend directement de la qualité des données, et aujourd'hui, ces données sont largement traitées à la main. En tant que Data Engineer, opérant depuis Paris, Lausanne ou Zurich, vous serez responsable de la couche de données qui alimente les modèles de l'équipe, depuis les journaux de terrain bruts ou les ensembles de données publics jusqu'aux ensembles de données organisés, versionnés et prêts pour l'entraînement. Vous gérerez des téraoctets de données brutes et non structurées et les transformerez en ensembles de données propres, documentés et versionnés, afin que les modélisateurs passent leur temps à concevoir et entraîner des modèles, et non à attendre des chargeurs de données ou à lutter contre des fichiers corrompus. Vous rejoignez l'entreprise à un stade précoce avec une influence réelle sur la manière dont les données de terrain et publiques sont traitées pour les pipelines de deep-learning. RESPONSABILITÉS - Pipeline d'ingestion : Ingestions, décodage et stockage des données de terrain brutes et non structurées (vidéo et autres flux de capteurs) à partir des journaux de terrain dans des formats efficaces et contrôlés. - Alignement multimodal : Aligner plusieurs flux de données de manière temporelle et spatiale afin que les données appariées soient utilisables pour l'entraînement. - Curation : Transformer à la fois les données ingérées et les ensembles de données publics en données de haute valeur, incluant l'analyse, le filtrage, la déduplication et la révision. - Exigences de données et d'étiquetage : Définir quelles données collecter et quoi et comment les étiqueter, et être responsable du flux de travail de construction de l'ensemble de données et des outils d'étiquetage. Coordonner avec les équipes responsables de la collecte et de l'étiquetage des données. - Construction d'ensembles de données : Construire des ensembles de données spécifiques aux tâches pour les besoins d'entraînement et d'évaluation de l'équipe, en collaboration avec les équipes d'acquisition, d'annotation et de produit. - Versionnage et lignage : Versionner les ensembles de données et maintenir le lignage afin que les cycles d'entraînement restent reproductibles. - Stockage et formats : Stocker les données dans des formats efficaces et prêts pour l'entraînement (tels que des formats colonnaires ou fragmentés/sharded) et gérer la hiérarchisation du stockage pour équilibrer le coût et la latence à mesure que les ensembles de données augmentent. - Livraison efficace : Livrer des ensembles de données propres et documentés ainsi que les outils de chargement correspondants pour éviter que l'entraînement ne soit limité par les E/S (I/O), en façonnant leur structure avec les modélisateurs. EXIGENCES POUR LE CANDIDAT - Formation : Un diplôme dans un domaine STEM, ou une expérience pratique équivalente. L'expérience pratique en ingénierie des données importe plus que le diplôme spécifique. - Pipelines de données à grande échelle : Avoir construit et maintenu des pipelines pour des données non structurées à grande échelle (vidéo, images ou données de capteurs), couvrant l'ingestion, le décodage, le stockage, la curation et le versionnage. - Ingénierie : Solides compétences en Python et en ingénierie des données, et aisance dans l'optimisation des chargeurs de données pour les frameworks d'entraînement courants (par exemple PyTorch). - Bonus : Données de capteurs multimodales, étiquetage ou construction d'ensembles de données pour le ML, outils de versionnage d'ensembles de données et outils de traitement de données distribuées. - Attributs : Systématique, soucieux de la qualité, pragmatique et orienté service pour permettre aux modélisateurs de travailler, avec un talent pour dompter les données désordonnées via l'automatisation. - Engagement : Dévouement à 100 % à la mission d'Harmattan AI consistant à fournir un avantage défensif aux nations alliées grâce à une technologie éthique et à fort impact. Nous avons hâte de découvrir comment vous pouvez aider à façonner l'avenir des systèmes de défense autonomes chez Harmattan AI.

Traduit automatiquement depuis l’original.

Publié il y a 1 semaine

Lieu

Voir sur Google Maps