Zum Inhalt springen

Notizen

Wo man das Modell nicht aufruft

Mit einem echten Budget ist die wirkungsvollste Entscheidung in einem KI-System oft, das Modell gar nicht erst aufzurufen. Die Kosten wachsen mit der Arbeit, die man ihm zuleitet. Also leiten Sie nur zu, was es wirklich braucht.

Der günstigste Aufruf ist der, den man nie macht

Das meiste, was über KI-Kosten geschrieben wird, dreht sich um ein günstigeres Modell oder kürzere Prompts. In den Systemen, die ich gebaut habe, kam die größere Ersparnis von woanders: aus der Entscheidung vor jedem Aufruf, ob das Modell überhaupt laufen muss.

Die Kosten wachsen mit der Arbeit, die man dem Modell zuleitet. Die wirkungsvollste Komponente ist deshalb oft ein günstiges, deterministisches Gate, das den Großteil der Arbeit von ihm fernhält. Das ist keine verfrühte Optimierung, sondern der Unterschied zwischen einem Bastelskript und etwas, das täglich laufen kann, ohne dass die Rechnung zum Grund wird, es abzuschalten.

Zwei Gates aus echten Systemen

Pixelvergleich vor der Vision-OCR. In einer Handschrift-Pipeline muss ein Vision-Modell die beschriebenen Tablet-Seiten zurücklesen, und das ist der teure Schritt. An einem gegebenen Tag sind aber nur ein oder zwei Seiten eines zwölfseitigen Dokuments tatsächlich beschrieben. Bevor also etwas das Modell erreicht, vergleicht das System die saubere und die beschriebene PDF Pixel für Pixel und schickt nur die geänderten Seiten, typischerweise eine bis drei von zwölf. Die Kosten folgen den Änderungen und nicht der Dokumentgröße.

Ein kostenbewusster Stufen-Router. In einer Extraktions-Pipeline verarbeitet ein kostenloser lokaler Parser (pdfplumber) jedes text-lesbare PDF. Nur die Scans, an denen er scheitert, gehen weiter an ein bezahltes dokumenten-natives Modell. Eine dritte Stufe hält einmalig migrierte Altdaten. Jedes Dokument geht an das günstigste Werkzeug, das es lesen kann, und das bezahlte Modell sieht immer nur die Dokumente, die es wirklich brauchen.

Der größte Teil von KI-Entwicklung mit Budget besteht darin zu wissen, wo man das Modell nicht aufruft.

Der Haken: das Gate muss günstig und richtig sein

Ein Router spart nur dann, wenn das Gate selbst günstig und verlässlich ist. Stimmt der Test darauf, ob der günstige Pfad reicht, nicht, hat man es auf eine von zwei Arten schlimmer gemacht: Man eskaliert Dokumente, die es nicht nötig hatten, und zahlt zu viel, oder man schickt dem Modell Müll, den der günstige Pfad hätte abweisen sollen.

Beide Gates oben funktionieren genau deshalb, weil sie günstig und deterministisch sind: ein Pixelvergleich und eine Prüfung auf Textlesbarkeit. Kein weiteres Modell, das beurteilt, ob das erste Modell aufgerufen werden soll.

Die ehrliche Grenze: Diese Schwellen sind auf die Dokumente abgestimmt, mit denen ich zu tun hatte, und nicht auf etwas Allgemeingültiges. Das Prinzip überträgt sich sauber, nämlich das günstige, verlässliche Signal zu finden, das sagt, dass der teure Pfad hier unnötig ist. Das konkrete Gate muss man für jedes Problem neu bauen. Meist ist das ein Nachmittag Arbeit, der sich im ersten Betriebsmonat bezahlt macht.