Alle Stellen
KI-Ingenieur/in
Bring die Modelle und Pipelines hinter den Insights an den Start.
Stuttgart, Deutschland — hybrid (2–3 Tage/Woche im Büro)Vollzeit / WerkstudentEngineering
Die Analyse-Engine — Sentiment, Beziehungs-Scoring, Erkennung von Meilensteinen, die KI-geschriebenen Insights — ist das Herz des Produkts. Du übernimmst, wie wir LLMs und klassische Modelle einsetzen: die Prompts, das Chunking, die Evaluation, Kosten und Latenz. Datenschutz ist eine harte Bedingung: Chat-Inhalte werden nur flüchtig verarbeitet und nie gespeichert.
Deine Aufgaben
- Übernimm die LLM-Pipeline (aktuell OpenAI + Gemini über eine Provider-Abstraktion) — Prompts, Chunking, strukturierte Output-Schemas, Retries und Kostenkontrolle.
- Baue das Evaluationsgerüst, damit eine Prompt- oder Modelländerung eine messbare Verbesserung ist, kein Bauchgefühl.
- Verbessere die Nicht-LLM-Analytics — Antwortzeitmodellierung, Gesprächssegmentierung, Stimmungstrends — bei Genauigkeit und Geschwindigkeit.
- Halte Inferenz günstig und schnell genug für Consumer-Skala; profile und senke die Token-Kosten.
- Setze das Datenschutzmodell um: flüchtige Verarbeitung, nur aggregierte Telemetrie, kein Chat-Inhalt verlässt den Request.
Was wir suchen
- 3+ Jahre Erfahrung im Bau von Produktivsoftware, mit echter Erfahrung im Ausliefern von LLM- oder ML-gestützten Features (nicht nur einmal eine API aufgerufen).
- Starkes TypeScript/Node.js (unser Stack) oder die Fähigkeit, das von einer anderen typisierten Sprache aus schnell zu erreichen.
- Du hast schon Prompt-/Response-Pipelines mit strukturierten Outputs gebaut und weißt, wie sie scheitern können.
- Sicher im Umgang mit Evaluation: Datensätze bauen, Metriken definieren, Regressionen erkennen.
- Englisch auf C1-Niveau oder höher.
Von Vorteil
- NLP-Hintergrund — Embeddings, Klassifikation, Sentiment.
- Erfahrung mit Kosten-/Latenz-Optimierung für LLM-Anwendungen (Caching, Batching, Model-Routing).
- Interesse an On-Device-/In-Browser-Inferenz.
- Deutsch.
Sprachen
Englisch auf C1-Niveau oder höher ist erforderlich. Deutsch ist von großem Vorteil.
Werkstudent/in
Als Werkstudent/in: ca. 16–20 Std./Woche, im Tandem mit einer Senior-Entwicklerin/einem Senior-Entwickler, mit Verantwortung für einen abgegrenzten Teil der Pipeline (z. B. das Eval-Gerüst oder ein Analysemodul).