Data Engineer (Detect & Track Distillation)
- Anstellung
- Vollzeit
- Ort
- Lausanne
- Erstmals ausgeschrieben
ÜBER UNS
Harmattan AI ist ein Verteidigungsunternehmen der nächsten Generation, das autonome und skalierbare Verteidigungssysteme entwickelt. Nach dem Abschluss einer Series B über 200M $, die das Unternehmen mit 1,4 Milliarden $ bewertet, erweitern wir unsere Teams und Kapazitäten, um missionskritische Systeme für verbündete Streitkräfte bereitzustellen.
Unsere Arbeit wird von klaren Werten geleitet: Technologien mit realen Auswirkungen zu entwickeln, Exzellenz in allem, was wir tun, anzustreben, ehrgeizige Ziele zu setzen und die schwierigsten technischen Herausforderungen anzunehmen. Wir arbeiten in einem anspruchsvollen Umfeld, in dem Sorgfalt, Eigenverantwortung und Umsetzung erwartet werden.
ÜBER DIE ROLLE
Unsere ML-Teams trainieren Modelle auf Datensätzen, die aus großen Mengen unstrukturierter Rohdaten abgeleitet werden. Die Modellqualität hängt direkt von der Datenqualität ab, und heute werden diese Daten weitgehend manuell bearbeitet.
Als Data Engineer mit Sitz in Paris, Lausanne oder Zurich werden Sie die Datenschicht verantworten, die die Modelle des Teams speist – von rohen Feldprotokollen oder öffentlichen Datensätzen bis hin zu kuratierten, versionierten und trainingsbereiten Datensätzen. Sie werden Terabytes an unstrukturierten Rohdaten verwalten und diese in saubere, dokumentierte, versionierte Datensätze umwandeln, damit die Modellierer ihre Zeit mit dem Entwurf und Training von Modellen verbringen und nicht mit dem Warten auf Datenladeprozesse oder dem Bereinigen beschädigter Dateien. Sie treten in einer frühen Phase mit echtem Einfluss darauf bei, wie Feld- und öffentliche Daten für Deep-Learning-Pipelines verarbeitet werden.
VERANTWORTLICHKEITEN
- Ingestion Pipeline: Aufnahme, Dekodierung und Speicherung von unstrukturierten Rohfelddaten (Video und andere Sensorströme) aus Feldprotokollen in effiziente, kontrollierte Formate.
- Multimodale Ausrichtung: Zeitliche und räumliche Ausrichtung mehrerer Datenströme, damit die gepaarten Daten für das Training nutzbar sind.
- Kuratierung: Überführung sowohl der aufgenommenen Daten als auch der öffentlichen Datensätze in hochwertige Daten, einschließlich Parsing, Filterung, Deduplizierung und Revision.
- Daten- & Labeling-Anforderungen: Definieren, welche Daten gesammelt werden sollen und was sowie wie sie zu labeln sind; Verantwortung für den Workflow der Datensatzkonstruktion und die Labeling-Werkzeuge. Koordination mit den Teams, die für die Datenerhebung und das Labeling verantwortlich sind.
- Datensatzkonstruktion: Aufbau aufgabenspezifischer Datensätze für die Trainings- und Evaluierungsbedürfnisse des Teams in Zusammenarbeit mit den Akquisitions-, Annotations- und Produktteams.
- Versionierung & Lineage: Versionierung von Datensätzen und Aufrechterhaltung der Lineage, damit Trainingsläufe reproduzierbar bleiben.
- Speicherung & Formate: Speicherung von Daten in effizienten, trainingsbereiten Formaten (wie Spalten- oder Sharding-Formate) und Verwaltung des Storage Tiering, um Kosten und Latenz bei wachsenden Datensätzen auszubalancieren.
- Effiziente Bereitstellung: Bereitstellung sauberer, dokumentierter Datensätze und der entsprechenden Tools zum Laden, damit das Training nicht I/O-gebunden ist, wobei die Struktur gemeinsam mit den Modellierern gestaltet wird.
ANFORDERUNGEN AN DEN KANDIDATEN
- Bildungshintergrund: Ein Abschluss in einem MINT-Fach oder gleichwertige praktische Erfahrung. Praktische Erfahrung im Data Engineering ist wichtiger als der spezifische Abschluss.
- Datenpipelines in großem Maßstab: Aufbau und Wartung von Pipelines für unstrukturierte Daten in großem Maßstab (Video, Bilder oder Sensordaten), einschließlich Aufnahme, Dekodierung, Speicherung, Kuratierung und Versionierung.
- Engineering: Stark in Python und Data Engineering sowie versiert in der Optimierung von Datenladern für gängige Trainings-Frameworks (zum Beispiel PyTorch).
- Bonus: Multimodale Sensordaten, Labeling oder Datensatzkonstruktion für ML, Werkzeuge zur Datensatzversionierung und Werkzeuge zur verteilten Datenverarbeitung.
- Eigenschaften: Systematisch, qualitätsbewusst, pragmatisch und serviceorientiert, um die Modellierer zu unterstützen, mit einem Talent dafür, unordentliche Daten durch Automatisierung zu bändigen.
- Engagement: 100 % Einsatz für die Mission von Harmattan AI, verbündeten Nationen durch ethische, hochwirksame Technologie einen Verteidigungsvorteil zu verschaffen.
Wir freuen uns darauf zu hören, wie Sie helfen können, die Zukunft autonomer Verteidigungssysteme bei Harmattan AI zu gestalten.
Automatisch aus dem Original übersetzt.
Ausgeschrieben vor 1 Woche