"You are a helpful assistant"
Jedes Unternehmen läuft heute mit KI-Antworten, die niemand prüft. Ich entwerfe, baue und messe die Systeme, die Ihnen sagen, wann Ihre KI richtig liegt, wann sie falsch liegt und was sie kostet. Gemessen — nicht versprochen.
Unternehmen setzen Modelle über Ozeane ungeprüfter Ergebnisse ein: veraltete Fakten, stille Fehler, laufende Zähler. Ich verwandle dieses Chaos in gesteuerte, gemessene, entscheidungstaugliche KI — Systeme, in denen jede Antwort ihre Belege trägt, jeder Lauf seine Kosten und jede Behauptung einer Prüfung standhält. Die meisten KI-Anbieter liefern eine Momentaufnahme. Ich liefere ein lebendes System: Wenn sich Ihre Daten ändern, wird die Änderung erkannt, die Auswirkung gemessen, die Antworten neu zertifiziert.
cat 01_the_system.md
Fünf Stufen, eine Regel: Das Modell schlägt vor, das System verfügt. Tippen Sie eine Stufe an, um sie zu prüfen.
Rohe Antworten, Dokumente und Datenströme werden so eingefroren, wie sie gesehen wurden. Noch ist nichts vertrauenswürdig, alles lässt sich Byte für Byte wiederholen.
Fakten werden deterministisch berechnet, außerhalb des Modells. Das LLM schreibt Prosa — es darf nie eine Zahl erfinden.
Genauigkeit, Aktualität, Kosten pro Lauf — gegen Protokolle, die vor jedem Aufruf fixiert wurden, auf Testsets, die nie zum Tuning verwendet wurden. Unbekannte Kosten gelten als Fehler.
Signierte menschliche Freigaben, harte Budgetdeckel, Prompt-Injection-Resistenz als getestete Anforderung. Guardrails leben im Code — niemals in Prompts.
Jedes Projekt endet mit Zahlen, die Sie unverändert veröffentlichen könnten — einschließlich Grenzen, Konfidenz und dessen, was nicht verifiziert werden konnte.
ls ./02_capabilities
Projekte mit festem Umfang und messbaren Ergebnissen. Sie wissen immer, was Sie bekommen, wann — und wie wir beide erkennen, dass es funktioniert.
/ 01
Ein Tag, mit Ihren echten Daten. Ich messe, wo Ihre KI falsch liegt, veraltet oder zu teuer ist — gegen eine Ground Truth, die für Ihr Geschäft gebaut wurde. Sie gehen mit einem Zahlenbericht und einer klaren Antwort: API oder eigenes Modell, und was es genau kosten sollte.
1.900 $ — vollständig auf Ihre Umsetzung angerechnet.
/ 02
Ihre KI, eingesetzt und gemessen. Die richtige Engine für jede Aufgabe — Frontier-APIs, wo sie gebraucht werden, Ihr eigenes kleines Modell, wo Datenschutz, Kosten oder Stabilität gewinnen. Zuverlässigkeit wird gegen Ihre Ground Truth vor der Übergabe gemessen, nicht nachdem Ihre Kunden es merken. Und sie funktioniert auch nach der Übergabe weiter: Datenänderungen werden erkannt, die Auswirkung gemessen, die Antworten neu zertifiziert.
Benchmarks werden vor dem Training schriftlich vereinbart — oder Sie zahlen nicht.
6.000–12.000 $ — Festpreis, im Voraus vereinbart.
/ 03
Ihre KI bleibt messbar scharf. Kontinuierliches Monitoring gegen Ihre Ground Truth, Modell-Updates und Nachtraining, während sich Ihre Daten entwickeln, ein Zahlenbericht jeden Monat, direkter Support.
999 $/Monat — jederzeit kündbar.
./03_proof --numbers
Ich wende auf meine eigene Arbeit exakt das an, was ich verkaufe: alles messen, die Ergebnisse veröffentlichen — auch die, die mir nicht schmeicheln.
0
veraltete Antworten ausgeliefert
Ein von mir gebautes Reparatursystem für Datenänderungen: 100 % Invalidierungs-Recall, wo die indexbasierte Baseline ~57 % erfasste und 11 von 40 veraltete Antworten lieferte.
1.147
automatisierte Tests
Auf einem produktionsreifen KI-SaaS, gebaut in 20 Tagen — mit 19 Architecture Decision Records und einer vollständig reproduzierbaren Pipeline.
18.448
menschliche Juroren, 43 Länder
Echte menschliche Daten zur Kalibrierung und Validierung synthetischer Nutzerforschung — mit zurückgehaltenen Sets, die nie zum Tuning verwendet wurden.
0,05 $
gemessene Kosten pro Lauf
Jede Pipeline, die ich baue, meldet ihre echten Token-Kosten pro Lauf. Unbekannte Kosten gelten als Fehler, nicht als Schätzung.
Ich veröffentliche auch negative Ergebnisse: Benchmarks, in denen mein eigener Ansatz auf Zufallsniveau lag, invalidierte Scorer, gescheiterte Hypothesen. Das ist, was „gemessen“ bedeutet.
Beginnen Sie per E-Mail — sagen Sie mir, was Ihre KI tut, und Sie erhalten innerhalb von 48 Stunden eine erste gemessene Einschätzung. Ich arbeite nur per E-Mail und WhatsApp: keine Anrufe, kein Video. Keine Einschränkung — eine Methode. Jede Zusage, jede Zahl, jede Entscheidung bleibt dokumentiert, und Sie können mich daran festhalten. Jedes Projekt beginnt gleich: schriftlicher Umfang, Festpreis, Vertrag und Rechnung von Nwbrains LLC — vor jeder Zahlung.