jobportalschweiz.ch
← Tutte le offerte

Data Engineer (Detect & Track Distillation)

Harmattan AI

Tipo di contratto
Tempo pieno
Luogo
Lausanne
Prima pubblicazione
Candidati ora
CHI SIAMO Harmattan AI è un contractor della difesa di prossima generazione che costruisce sistemi di difesa autonomi e scalabili. Dopo la chiusura di un Series B da $200M, che valuta l'azienda $1.4 billion, stiamo espandendo i nostri team e le nostre capacità per fornire sistemi mission-critical alle forze alleate. Il nostro lavoro è guidato da valori chiari: costruire tecnologie con un impatto nel mondo reale, perseguire l'eccellenza in tutto ciò che facciamo, fissare obiettivi ambiziosi e affrontare le sfide tecniche più difficili. Operiamo in un ambiente esigente dove sono richiesti rigore, ownership ed esecuzione. IL RUOLO I nostri team ML addestrano modelli su dataset derivati da grandi volumi di dati grezzi e non strutturati. La qualità del modello dipende direttamente dalla qualità dei dati e, oggi, tali dati sono gestiti in gran parte manualmente. In qualità di Data Engineer, operando da Paris, Lausanne o Zurich, sarai responsabile dello strato di dati che alimenta i modelli del team, dai log grezzi sul campo o dataset pubblici fino a dataset curati, versionati e pronti per l'addestramento. Gestirai terabyte di dati grezzi e non strutturati e li trasformerai in dataset puliti, documentati e versionati, affinché i modeler possano dedicare il proprio tempo alla progettazione e all'addestramento dei modelli, invece di attendere i data loader o gestire file corrotti. Entrerai in una fase iniziale con una reale influenza su come i dati sul campo e pubblici vengono elaborati per le pipeline di deep-learning. RESPONSABILITÀ - Ingestion Pipeline: Ingerire, decodificare e memorizzare dati grezzi e non strutturati dal campo (video e altri flussi di sensori) dai log di campo in formati efficienti e controllati. - Multimodal Alignment: Allineare più flussi di dati temporalmente e spazialmente affinché i dati accoppiati siano utilizzabili per l'addestramento. - Curation: Trasformare sia i dati ingeriti che i dataset pubblici in dati di alto valore, includendo parsing, filtraggio, de-duplicazione e revisione. - Data & Labeling Requirements: Definire quali dati raccogliere e cosa e come etichettarli, e gestire il workflow di costruzione dei dataset e gli strumenti di labeling. Coordinarsi con i team responsabili della raccolta e dell'etichettatura dei dati. - Dataset Construction: Costruire dataset specifici per le attività necessarie all'addestramento e alla valutazione del team, in collaborazione con i team di acquisizione, annotazione e prodotto. - Versioning & Lineage: Versionare i dataset e mantenere la lineage affinché le sessioni di addestramento rimangano riproducibili. - Storage & Formats: Memorizzare i dati in formati efficienti e pronti per l'addestramento (come formati columnar o sharded) e gestire il tiering dello storage per bilanciare costo e latenza con la crescita dei dataset. - Efficient Delivery: Fornire dataset puliti e documentati e i corrispondenti strumenti per il caricamento per evitare che l'addestramento sia limitato dalle I/O, definendone la struttura insieme ai modeler. REQUISITI DEL CANDIDATO - Background Educativo: Una laurea in un campo STEM o equivalente esperienza pratica. L'esperienza pratica nell'ingegneria dei dati conta più della laurea specifica. - Data Pipelines at Scale: Aver costruito e mantenuto pipeline per dati non strutturati su larga scala (video, immagini o dati di sensori), coprendo ingestion, decodifica, storage, curation e versionamento. - Engineering: Competenza in Python e data engineering, e dimestichezza nell'ottimizzare i data loader per i comuni framework di addestramento (ad esempio PyTorch). - Bonus: Dati da sensori multimodali, labeling o costruzione di dataset per ML, strumenti di versionamento dei dataset e strumenti di elaborazione dati distribuita. - Attributi: Sistematico, orientato alla qualità, pragmatico e orientato al servizio per abilitare i modeler, con una predisposizione a domare dati disordinati tramite l'automazione. - Impegno: Dedizione al 100% alla missione di Harmattan AI di fornire un vantaggio difensivo alle nazioni alleate attraverso una tecnologia etica e ad alto impatto. Non vediamo l'ora di scoprire come potrai contribuire a dare forma al futuro dei sistemi di difesa autonomi presso Harmattan AI.

Tradotto automaticamente dall’originale.

Pubblicato 1 settimana fa

Luogo

Vedi su Google Maps