Kosten-Leitstand und Sicherungsautomat für KI-Agenten

Die Sicherung für Ihre KI-Agenten.

Sehen, was jeder Agent kostet. Erkennen, wenn einer entgleist. Abschalten, bevor die Rechnung kommt. Eine Zeile Konfiguration, und jeder Aufruf ist einem Agenten, einem Lauf und einem Endkunden zugeordnet.

Betrieb in DeutschlandKein Prompt-Inhalt gespeichertSchlüssel wird nur durchgereichtPrüfprotokoll und AVV
6benannte Befunde mit Euro-Betrag und Vorschlag
4Eingriffsstufen: beobachten, warnen, drosseln, stoppen
4Anbieter im Proxy: Anthropic, OpenAI, Gemini, Bedrock
0gespeicherte Prompts. Nur Zähler, Fingerabdrücke, Metadaten.
Das Problem

Agenten sind in Tagen gebaut. Ihre Rechnung kommt am Monatsende.

Wer mit Claude Code, n8n, Cursor oder eigenen Frameworks Agenten betreibt, sieht Token als Summe auf der Anbieterrechnung. Welcher Agent, welcher Lauf, welcher Kunde: unbekannt. Eine Schleife, die nachts 200 Mal dieselbe Suche stellt, fällt niemandem auf.

Vollständige Zuordnung

Jeder Token gehört zu einem Agenten, einem Lauf, einem Projekt, einem Endkunden. Kein „Sonstiges“.

Diagnose statt Rohdaten

Sechs benannte Befunde mit Betrag und konkretem Vorschlag statt Token-Tabellen.

Wirksamer Eingriff

Vier Stufen je Agent, Regel und Tageszeit, mit sauberer Ablehnung, damit der Agent geordnet endet.

Anbindung

Eine Zeile. Dann sehen Sie alles.

Basis-URL des Anbieters gegen Tokenwacht tauschen, Kopfzeile setzen, fertig. Ihr Anbieterschlüssel bleibt Ihr Schlüssel und wird nur durchgereicht. Für alles, was nicht über HTTP geht, gibt es SDKs, einen n8n-Baustein, einen Claude-Code-Hook und eine Ingest-Schnittstelle.

Schlüssel holen

Kostenlos registrieren, im Cockpit unter „Anbindung“ einen Schlüssel erzeugen.

Basis-URL tauschen

Anthropic, OpenAI, Gemini oder Bedrock: eine Zeile im Client, mehr nicht.

Ersten Aufruf sehen

Das Cockpit meldet den ersten Aufruf live. Danach Regeln einschalten, erst im Schatten, dann scharf.

Schnellstart in 5 Minuten
# Python · Anthropic SDK — nur base_url und Kopfzeilen ändern
from anthropic import Anthropic
client = Anthropic(
    base_url="https://tokenwacht.de/anthropic",
    api_key=os.environ["ANTHROPIC_API_KEY"],          # bleibt Ihr Schlüssel
    default_headers={"X-TW-Key": "tw_live_…", "X-TW-Agent": "nils-icp-research"},
)
# Python · OpenAI SDK (Chat Completions und Responses)
from openai import OpenAI
client = OpenAI(
    base_url="https://tokenwacht.de/openai/v1",
    default_headers={"X-TW-Key": "tw_live_…", "X-TW-Agent": "erik-closer"},
)
// Node · Anthropic SDK mit dem Tokenwacht-SDK (Lauf-Klammer, Budgetausnahme)
const { Wacht } = require("tokenwacht-sdk");
const wacht = new Wacht({ schluessel: "tw_live_…", agent: "liv-connector" });
const client = new Anthropic({ baseURL: wacht.anthropicUrl(), fetch: wacht.fetch });
# curl · derselbe Aufruf wie an Anthropic, nur die Adresse und eine Kopfzeile mehr
curl https://tokenwacht.de/anthropic/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" -H "anthropic-version: 2023-06-01" \
  -H "X-TW-Key: tw_live_…" -H "X-TW-Agent: probe" \
  -d '{"model":"claude-sonnet-5","max_tokens":50,"messages":[{"role":"user","content":"Hallo"}]}'

Auch für Gemini, Bedrock, n8n, Claude Code, die Chrome-Erweiterung und eigene Zahlen per Ingest. Welcher Weg passt zu mir?

Diagnose

Sechs Befunde. Jeder mit Betrag und Vorschlag.

Zwei Detektoren arbeiten im Strom und greifen sofort ein, vier prüfen alle fünf Minuten im Stapel. Jeder Befund sagt, was er kostet und was zu tun ist.

D1 · im Strom

Leerschleife

Ein Agent stellt dieselbe Anfrage mit demselben Werkzeug wieder und wieder. Erkannt am Fingerabdruck, gestoppt nach Ihrer Leiter.

Stopp nach 3 Wiederholungen
D2 · im Stapel

Kontextwucherung

Der Kontext wächst je Schritt, ohne dass der Agent vorankommt. Vorschlag: Kürzung, geschätzte Ersparnis je Monat.

z. B. 11,86 €/Monat
D3 · im Stapel

Cache-Blindheit

Gleicher Systemprompt, gleiche Werkzeuge, kein Cache-Treffer. Prompt-Caching einschalten, Ersparnis vorgerechnet.

z. B. 4,72 €/Monat
D4 · im Stapel

Modell-Fehlwahl

Kurze Antworten ohne Werkzeuge auf dem teuersten Modell. Das kleinere reicht, der Betrag steht daneben.

z. B. 31,05 €/Monat
D5 · im Strom

Fehlersturm

Fehler auf Fehler, jeder kostet Eingabe-Token. Der Agent wird gedrosselt oder gestoppt, bevor die Nacht durchläuft.

Verbranntes Geld sichtbar
D6 · im Stapel

Ausreißer

Ein Lauf kostet ein Vielfaches seiner Normallinie aus 15 Tagen. Gemeldet mit Betrag, bevor es Muster wird.

Normallinie je Agent
Eingriff

Andere zeigen, was passiert ist. Tokenwacht verhindert, was gerade passiert.

Regeln für Lauf-Budget, Tagesbudget je Agent, Monatsbudget, Ratenbegrenzung, Modellsperre mit Zeitfenster und Schutzregeln je Detektor. Jede Regel startet im Schattenbetrieb: gemessen, nicht wirksam. Erst wenn Sie sie scharf schalten, greift sie.

Fällt Tokenwacht selbst aus, ist der Proxy durchlässig. Ihre Agenten laufen weiter, nur ungezählt.

beobachten
Nur zählen und melden.
Standard für jeden neuen Agenten. Nichts stoppt, bis Sie es entscheiden.
warnen
Befund und Alarm.
E-Mail, Slack, Teams, ntfy auf dem Telefon, JSON-Webhook. Gebündelt je Agent, mit Ruhezeiten.
drosseln
Pause vor dem nächsten Aufruf.
Bis zehn Sekunden je Aufruf. Der Agent bremst, statt zu explodieren.
stoppen
HTTP 402 mit maschinenlesbarem Grund.
Regel, Grenze, Verbrauch, Lauf-Kennung, Hinweis. Der Agent beendet den Lauf geordnet statt mit einer Exception um drei Uhr nachts.
Digitaler Zwilling

Jeden Monat rechnet Tokenwacht sich selbst gegen.

Verhinderte Kosten aus abgewiesenen und gedrosselten Aufrufen, im Schattenbetrieb erkannte Beträge, vorgeschlagene Ersparnis aus den Befunden, dagegen der Paketpreis. Die Zahl steht im Wochenbericht, als HTML und PDF, auf Wunsch im Erscheinungsbild Ihres Unternehmens.

Garantie

Wenn Tokenwacht Ihnen in 60 Tagen nicht mehr einspart, als es kostet, zahlen Sie nichts. Der Zwilling liefert die Zahl, nicht wir.

Sicherheit und Compliance

Gebaut wie ein Finanzsystem, nicht wie ein Dashboard.

Wer Ihre KI-Ausgaben überwacht, sitzt an einer sensiblen Stelle. Deshalb sieht Tokenwacht so wenig wie möglich und protokolliert alles, was es tut.

Kein Inhalt

Prompt und Antwort werden weder gespeichert noch protokolliert. Nur Zähler, Fingerabdrücke, Metadaten.

Schlüssel-Durchreichung

Ihr Anbieterschlüssel wird durchgereicht und nie gespeichert. Tokenwacht-Schlüssel mit Geltungsbereich je Einsatz.

Betrieb in Deutschland

Verarbeitung ausschließlich in der EU. AVV, Verarbeitungsverzeichnis und Löschkonzept liegen vor.

Prüfprotokoll

Jede Handlung im Cockpit mit Zeit, Benutzer und Ziel. Export als CSV, Aufbewahrung 24 Monate.

Zwei-Faktor und SSO

Authenticator-App für jeden Benutzer, Anmeldung über Entra ID, Okta, Authentik oder Keycloak.

Monatlicher Abgleich

Die eigene Zählung wird gegen die Anbieterrechnung gestellt. Abweichungen über zwei Prozent werden gemeldet.

Datenexport und Löschung

Alle Daten Ihres Mandanten als ZIP. Kündigung im Cockpit, endgültige Löschung nach 30 Tagen.

Selbstbetrieb

Dieselben Container per Docker Compose oder Kubernetes in Ihrer Umgebung, mit Lizenzschlüssel.

Für wen

Vom Einzelbauer bis zur Agentur.

Bezahlt wird nach Agenten und Aufrufen, nie nach Token. Tokenwacht darf an Ihrer Verschwendung nichts verdienen.

Pakete und Preise

Solo-Bauer

Claude Code, n8n, Cursor: endlich sehen, was die eigene Arbeit kostet. Frei bis drei Agenten, Chrome-Erweiterung inklusive.

Teams

Unbegrenzte Regeln, Drosseln und Stoppen, 90 Tage Historie, API für Fremdsysteme, Kostenprognose je Agent.

Agenturen

Endkunden-Sicht, Weiterbelastung als CSV, DATEV-Buchungsstapel und Monatsabrechnung je Kunde als PDF im eigenen Design.

Enterprise

SSO über Ihr Verzeichnis, Prüfprotokoll, Selbstbetrieb mit Lizenzschlüssel, Kubernetes, AVV, Reaktionszusage.

In fünf Minuten sehen Sie Ihren ersten Aufruf.

Kostenlos, ohne Kreditkarte, ohne Vertrag. Der Demo-Zugang zeigt das Cockpit mit einem synthetischen Arbeitstag, bevor Sie irgendetwas anbinden.