jobportalschweiz.ch
← Alle Stellen

Site Reliability Engineer

Adaptyv

Anstellung
Vollzeit
Ort
Lausanne
Erstmals ausgeschrieben
Jetzt bewerben
Adaptyv baut ein automatisiertes Labor auf, das es AI Agents ermöglicht, Biologie-Experimente durchzuführen. Wir treten in die Ära der agentischen Wissenschaft ein, in der KI-Modelle nun in der Lage sind, neuartige Proteine zu entwerfen, Hypothesen vorzuschlagen und an experimentellen Ergebnissen zu iterieren. Aber sie können die Experimente nicht selbst durchführen – das ist immer noch ein manueller, monatelanger Prozess. Wir bauen die Infrastruktur, die AI Agents Zugang zur physischen Welt verschafft. Wir sind eines der am schnellsten wachsenden Biotech-Unternehmen, dem führende Biopharmas, wegweisende AI Labs und die Techbio-Unternehmen, die das Feld vorantreiben, vertrauen. Dies ist eine seltene Chance, einen Beitrag zu einigen der wichtigsten Arbeiten zu leisten, die heute in der Biotechnologie stattfinden. Unser automatisiertes Labor wird durch einen tiefen Software- + Hardware-Stack angetrieben: Labormessgeräte im Wert von Millionen USD, die mittels Reverse-Engineering in API-steuerbare Hardware umgewandelt wurden, Dutzende von Geräten, die durch komplexe Workflows orchestriert werden, vollständige Observability über alles, was im Labor passiert, Processing-Pipelines für unstrukturierte Daten aus der physischen Welt und KI-Systeme, die Produktionsergebnisse troubleshooten und die Assay-Entwicklung beschleunigen. Wir wachsen schnell und stellen talentierte Menschen ein, um die massive Nachfrage nach KI-gesteuerter Wet-Lab-Experimentierung zu skalieren und zu unterstützen. Adaptyv betreibt ein physisches Labor durch Software. Wenn unsere Systeme ausfallen, ist es nicht eine Seite, die nicht lädt – es ist ein Liquid Handler, der mitten im Lauf stoppt, ein Instrument, das seine Buchung verliert, oder ein Experiment eines Kunden, das zum Stillstand kommt, während das Protein bereits in einer Platte ist. Zuverlässigkeit hat hier Auswirkungen auf die physische Welt, und wir brauchen jemanden, der die Verantwortung dafür übernimmt. Sie werden für die Gesundheit des gesamten Stacks verantwortlich sein, der LabOS und unsere kundenorientierte Plattform am Laufen hält: die APIs, Edge Functions, Datenbanken, Processing-Pipelines, Job Queues und die Integrationen, die unsere Software mit Lab hardware im Wert von Millionen von Dollar verbinden. Sie werden die Observability, das Alerting und die Automatisierung aufbauen, die es einem kleinen Team ermöglichen, ein 24/7 automatisiertes Labor zu betreiben, ohne ständig im „Firefighting-Modus“ zu leben – und wenn doch etwas kaputt geht, sind Sie die Person, die sicherstellt, dass es frühzeitig erkannt, schnell behoben wird und nicht zweimal auf die gleiche Weise passiert. In einer typischen Woche könnte das bedeuten: - Aufbau von Observability über den gesamten Stack – Metriken, Logs, Traces und Dashboards (Grafana), die den Zustand des Labors und der Plattform auf einen Blick lesbar machen. - Definition von SLOs für die relevanten Services, deren Instrumentierung und Einrichtung eines Alertings, das bei echten Problemen alarmiert und ansonsten ruhig bleibt. - Absicherung unserer Daten- und Processing-Pipelines, damit unstrukturierte Daten aus der physischen Welt nicht stillschweigend Ergebnisse korrumpieren oder Experimente stoppen. - Übernahme der Incident Response: Triage, Mitigation und blameless Postmortems, die jeden Ausfall in eine permanente Lösung verwandeln. - Verbesserung der Deployment-Sicherheit und Rollbacks über unsere Services hinweg (Vercel, Supabase, Modal, Edge Functions), damit schnelles Ausrollen nicht instabiles Ausrollen bedeutet. - Automatisierung von Toil – die manuellen Wiederherstellungsschritte, das „Babysitting“, die „einfach neu starten“-Runbooks – damit das Labor so weit wie möglich von selbst läuft. - Partnerschaft mit den Software- und Laborautomatisierungs-Teams, um Zuverlässigkeit als eine Eigenschaft des Systems zu etablieren, statt als nachträglichen Gedanken. WAS WIR SUCHEN - Starke Kenntnisse in Systems und Software Engineering. Sie schreiben Produktionscode (Python und/oder TypeScript) und fühlen sich sicher darin, Infrastruktur zu besitzen, nicht sie nur zu konfigurieren. - Echte SRE / Production Ownership Erfahrung. Sie haben Services betrieben, auf die Menschen angewiesen sind, haben einen Pager getragen und die Observability und Automatisierung aufgebaut, die den On-Call-Dienst überlebbar gemacht haben. - Versiertheit in Observability. Metriken, Logging, Tracing, Dashboards, Alerting – Sie wissen, wie man ein komplexes verteiltes System lesbar macht, und haben Tools wie Grafana / Prometheus / Loki (oder Äquivalente) im produktiven Einsatz genutzt. - Incident-Instinkt. Sie bleiben ruhig, wenn Dinge kaputtgehen, finden schnell die Ursache (Root Cause) und sind allergisch dagegen, dass derselbe Incident zweimal auftritt. - Automation-First-Mentalität. Sie geben es vor, einen Tag damit zu verbringen, eine wiederkehrende 10-minütige Aufgabe zu automatisieren, anstatt sie ewig manuell zu erledigen – und Sie arbeiten standardmäßig mit Coding Agents wie Claude Code. - Pragmatismus in Bezug auf Zuverlässigkeit. Sie kennen den Unterschied zwischen dem, was „five nines“ benötigt und was nicht, und setzen Ihre Bemühungen dort ein, wo es wirklich zählt. - Bonus: Wo Software auf die physische Welt trifft. Hardware / Lab / IoT, Queues und Pipelines oder Cloud-Infrastruktur im großen Maßstab – alles, was weiterlaufen muss, wenn am anderen Ende etwas Reales steht. - Neugier auf Biologie. Kein Hintergrund erforderlich, aber Sie sollten es wirklich interessant finden, dass das, was Sie am Laufen halten, ein Labor ist, in dem KI echte Experimente durchführt. Bewerbungsfrist Wir prüfen Bewerbungen fortlaufend.

Automatisch aus dem Original übersetzt.

Ausgeschrieben vor 7 Wochen

Ort

Auf Google Maps ansehen