Gelernt an Systemen, die wirklich laufen.
Notizen ohne Verfallsdatum, kein Blog mit Datumsstempel. Jeder Text kommt aus einem System, das ich gebaut habe und das läuft, und verweist auf die passende Fallstudie als Beispiel. Der rote Faden: Produktive KI braucht dieselbe Sorgfalt, die in sicherheitskritischer Entwicklung selbstverständlich ist.
Wie ich KI-Systeme bewerte
Der Benchmark eines Modells sagt wenig über seinen Wert. Entscheidend ist, ob seine Ausgabe den Kontakt mit dem restlichen System übersteht: die Struktur, die Kosten und die Nacharbeit, die eine falsche Antwort später erzwingt.
Wo man das Modell nicht aufruft
Mit einem echten Budget ist die wirkungsvollste Entscheidung in einem KI-System oft, das Modell gar nicht erst aufzurufen. Die Kosten wachsen mit der Arbeit, die man ihm zuleitet. Also leiten Sie nur zu, was es wirklich braucht.
Sicherheitskritische Sorgfalt in produktiver KI
Was ein reguliertes System sicher hält: Entscheidungen trifft Code, jede Grenze validiert, im Fehlerfall hält das System an, und alles Unumkehrbare bekommt eine Freigabe durch einen Menschen. Genau das fehlt den meisten produktiven Systemen mit Sprachmodellen.
Agentische Workflows debuggbar halten
Wenn ein Sprachmodell Aktionen ausführen kann, ist nicht mehr die Fähigkeit das Schwierige, sondern Beobachtbarkeit und begrenzte Autonomie. (In Vorbereitung.)