"You are a helpful assistant"

Intelligenz braucht Beweise.

Jedes Unternehmen läuft heute mit KI-Antworten, die niemand prüft. Ich entwerfe, baue und messe die Systeme, die Ihnen sagen, wann Ihre KI richtig liegt, wann sie falsch liegt und was sie kostet. Gemessen — nicht versprochen.

Ihre KI spricht.
Ich mache sie rechenschaftspflichtig.

Unternehmen setzen Modelle über Ozeane ungeprüfter Ergebnisse ein: veraltete Fakten, stille Fehler, laufende Zähler. Ich verwandle dieses Chaos in gesteuerte, gemessene, entscheidungstaugliche KI — Systeme, in denen jede Antwort ihre Belege trägt, jeder Lauf seine Kosten und jede Behauptung einer Prüfung standhält. Die meisten KI-Anbieter liefern eine Momentaufnahme. Ich liefere ein lebendes System: Wenn sich Ihre Daten ändern, wird die Änderung erkannt, die Auswirkung gemessen, die Antworten neu zertifiziert.

cat 01_the_system.md

Der Verifikationskern.

Fünf Stufen, eine Regel: Das Modell schlägt vor, das System verfügt. Tippen Sie eine Stufe an, um sie zu prüfen.

01

Erfassung

reproduzierbar · gehasht

Rohe Antworten, Dokumente und Datenströme werden so eingefroren, wie sie gesehen wurden. Noch ist nichts vertrauenswürdig, alles lässt sich Byte für Byte wiederholen.

02

Ground Truth

exakte Berechnung

Fakten werden deterministisch berechnet, außerhalb des Modells. Das LLM schreibt Prosa — es darf nie eine Zahl erfinden.

03

Messung

eingefrorenes Protokoll · zurückgehaltene Sets

Genauigkeit, Aktualität, Kosten pro Lauf — gegen Protokolle, die vor jedem Aufruf fixiert wurden, auf Testsets, die nie zum Tuning verwendet wurden. Unbekannte Kosten gelten als Fehler.

04

Verifikation

Guardrails im Code

Signierte menschliche Freigaben, harte Budgetdeckel, Prompt-Injection-Resistenz als getestete Anforderung. Guardrails leben im Code — niemals in Prompts.

05

Bericht

verdict.json

Jedes Projekt endet mit Zahlen, die Sie unverändert veröffentlichen könnten — einschließlich Grenzen, Konfidenz und dessen, was nicht verifiziert werden konnte.

ls ./02_capabilities

Gebaut für Zuverlässigkeit.

Projekte mit festem Umfang und messbaren Ergebnissen. Sie wissen immer, was Sie bekommen, wann — und wie wir beide erkennen, dass es funktioniert.

/ 01

1-Tages-KI-Audit

Ein Tag, mit Ihren echten Daten. Ich messe, wo Ihre KI falsch liegt, veraltet oder zu teuer ist — gegen eine Ground Truth, die für Ihr Geschäft gebaut wurde. Sie gehen mit einem Zahlenbericht und einer klaren Antwort: API oder eigenes Modell, und was es genau kosten sollte.

1.900 $ — vollständig auf Ihre Umsetzung angerechnet.

/ 02

Gemessene KI-Systeme

Ihre KI, eingesetzt und gemessen. Die richtige Engine für jede Aufgabe — Frontier-APIs, wo sie gebraucht werden, Ihr eigenes kleines Modell, wo Datenschutz, Kosten oder Stabilität gewinnen. Zuverlässigkeit wird gegen Ihre Ground Truth vor der Übergabe gemessen, nicht nachdem Ihre Kunden es merken. Und sie funktioniert auch nach der Übergabe weiter: Datenänderungen werden erkannt, die Auswirkung gemessen, die Antworten neu zertifiziert.

Benchmarks werden vor dem Training schriftlich vereinbart — oder Sie zahlen nicht.

6.000–12.000 $ — Festpreis, im Voraus vereinbart.

/ 03

Care Plan

Ihre KI bleibt messbar scharf. Kontinuierliches Monitoring gegen Ihre Ground Truth, Modell-Updates und Nachtraining, während sich Ihre Daten entwickeln, ein Zahlenbericht jeden Monat, direkter Support.

999 $/Monat — jederzeit kündbar.

./03_proof --numbers

Zahlen aus Systemen, die ich gebaut habe.

Ich wende auf meine eigene Arbeit exakt das an, was ich verkaufe: alles messen, die Ergebnisse veröffentlichen — auch die, die mir nicht schmeicheln.

0

veraltete Antworten ausgeliefert

Ein von mir gebautes Reparatursystem für Datenänderungen: 100 % Invalidierungs-Recall, wo die indexbasierte Baseline ~57 % erfasste und 11 von 40 veraltete Antworten lieferte.

1.147

automatisierte Tests

Auf einem produktionsreifen KI-SaaS, gebaut in 20 Tagen — mit 19 Architecture Decision Records und einer vollständig reproduzierbaren Pipeline.

18.448

menschliche Juroren, 43 Länder

Echte menschliche Daten zur Kalibrierung und Validierung synthetischer Nutzerforschung — mit zurückgehaltenen Sets, die nie zum Tuning verwendet wurden.

0,05 $

gemessene Kosten pro Lauf

Jede Pipeline, die ich baue, meldet ihre echten Token-Kosten pro Lauf. Unbekannte Kosten gelten als Fehler, nicht als Schätzung.

Ich veröffentliche auch negative Ergebnisse: Benchmarks, in denen mein eigener Ansatz auf Zufallsniveau lag, invalidierte Scorer, gescheiterte Hypothesen. Das ist, was „gemessen“ bedeutet.

ssh [email protected]

Keine Anrufe. Keine Meetings.
Alles schriftlich.

Beginnen Sie per E-Mail — sagen Sie mir, was Ihre KI tut, und Sie erhalten innerhalb von 48 Stunden eine erste gemessene Einschätzung. Ich arbeite nur per E-Mail und WhatsApp: keine Anrufe, kein Video. Keine Einschränkung — eine Methode. Jede Zusage, jede Zahl, jede Entscheidung bleibt dokumentiert, und Sie können mich daran festhalten. Jedes Projekt beginnt gleich: schriftlicher Umfang, Festpreis, Vertrag und Rechnung von Nwbrains LLC — vor jeder Zahlung.

[email protected]