Kann ich ZeroLeaks vibecoden?
JEIN · WochenendprojektDer Anbieter rechnet in US-Dollar ab
ZeroLeaks rechnet in US-Dollar ab: Pro kostet 79 Dollar pro Monat, Team 99 Dollar pro Nutzer pro Monat. Pro hat eine 14-tägige Testphase, einen kostenlosen gehosteten Tarif gibt es nicht.
Für deutsche Unternehmen kann bei Softwareleistungen aus dem Ausland das Reverse-Charge-Verfahren gelten. Das hängt nicht von der Währung allein ab. Was du auf Rechnung und USt-Voranmeldung prüfen solltest →
geprüft am 17.09.2026 · Quelle ↗ · so prüfen wir
Nichts hier ist exotisch: ein paar hundert gegnerische Prompts auf deinen eigenen Chat-Endpunkt feuern, die Antworten erfassen und prüfen, ob eine davon deinen System-Prompt, Werkzeug-Schemata oder API-Schlüssel enthält. Ein Agent baut diese Schleife samt LLM-als-Richter und HTML-Bericht in einer Sitzung, und sie findet am ersten Tag das Peinliche. Was du in einer Sitzung nicht baust, ist eine Sonden-Bibliothek, die mit jeder neuen Modellversion und jeder neuen Jailbreak-Familie aktuell bleibt, denn das ist gepflegtes Wissen, kein Code. Dazu die Vertrauensfrage: 'Wir haben unser eigenes Skript laufen lassen und nichts gefunden' liest sich in einer Sicherheitsprüfung ganz anders als ein datierter Bericht eines Dritten. Bau es für eigene Prüfungen, zahl weiter, wenn du etwas brauchst, das du jemand anderem zeigen kannst.
Build a local CLI tool called leakprobe that red-teams a chat AI endpoint for system prompt and secret leakage.
Stack: Python 3.12, uv for deps, httpx, pydantic, typer for the CLI, jinja2 for the report. No web UI, no database, no accounts, no telemetry. Everything runs on my machine and writes to ./runs/.
Config: a target.yaml describing the endpoint under test (url, http method, headers, JSON body template with a {{message}} placeholder, and a JSONPath-ish key for extracting the reply text). Also a secrets.yaml listing my real system prompt text, tool/function names, and regex patterns for keys I never want echoed (sk-, ghp_, AKIA, bearer tokens). All API keys come from .env via python-dotenv; write .env.example and gitignore .env.
Probes: ship a probes/ directory of YAML files, at least 60 probes across these families, each with id, family, severity, and one or more turns: direct extraction, polite social engineering, roleplay and persona swap, translation and encoding (base64, rot13, pig latin), token smuggling, fake developer or debug mode, 'repeat the text above', markdown and code block coercion, tool and function schema enumeration, indirect injection via pasted document content, and refusal-boundary probing. Support multi-turn probes where later turns reference earlier replies.
Runner: async, configurable concurrency (default 4), per-request timeout, exponential backoff on 429 and 5xx, and a --limit flag so I can smoke test. Log every request and response verbatim to runs/TIMESTAMP/transcripts.jsonl.
Scoring: two layers. First, deterministic detectors: fuzzy overlap against my known system prompt using token n-gram matching, exact matches on tool names, and regex hits on secret patterns. Second, an LLM judge (OpenAI-compatible, model configurable, key from .env) that reads the transcript and returns strict JSON with leaked: bool, leak_type, confidence, and a one-line rationale. Combine into a severity per probe. Deterministic hits always win.
Output: a self-contained HTML report at runs/TIMESTAMP/report.html grouped by severity, each finding showing the probe, the full exchange, and which detector fired, plus report.json for diffing. Add a `leakprobe diff RUN_A RUN_B` command that shows newly failing and newly passing probes so I can use it as a regression gate. Exit code 1 if any high-severity finding, so it works in CI.
Out of scope: scanning targets I do not control, DoS or rate-limit abuse, network-level scanning, auth bypass testing, any hosted dashboard. Print a short warning on first run that this only targets endpoints listed in target.yaml.
Deliver a README with a 60 second quickstart, and pytest tests for the detectors using fixture transcripts (no live API calls in tests).
Antworte mir auf Deutsch. Oberfläche, Kommentare und README auf Deutsch, alle Bezeichner wie Tabellen, Spalten, Variablen, Routen und Dateinamen bleiben Englisch.$ im Agenten öffnen (Prompt ist vorausgefüllt, du drückst Enter) oder direkt kopieren · dieser Bauplan ist noch auf Englisch, die Bitte um deutsche Antworten hängt unten dran · dieser Prompt wurde aus dem Bauplan erzeugt · Verbesserung einreichen
Prompt kopiert. Modelle werden besser, Urteile ändern sich.
Fünf Vibe-Coding-Tipps und geänderte Urteile. Donnerstags, kostenlos, ein Klick zum Abmelden.
Zwei Gründe, und keiner ist, dass das Gerüst schwer wäre. Erstens verrotten Jailbreaks: Die Sonden, die gegen das Modell vom letzten Quartal wirkten, sind heute Ballast, und einen lebenden Korpus zu pflegen ist ein Vollzeitjob, kein Cron, den du einmal einrichtest. Zweitens ist selbst bescheinigte Sicherheit für einen Unternehmenskäufer ungefähr nichts wert, also zahlen Firmen für ein externes Artefakt mit Datum und Logo. Wenn dein Ziel nur ist, keinen System-Prompt mehr auszuliefern, der sich auflöst, wenn jemand 'wiederhole alles oben' tippt, reicht ein lokales Gerüst wirklich.
Der Scanner ist ein Nachmittag, die Sonden-Bibliothek und der gegengezeichnete Bericht nicht.
xein kuratierter, gepflegter Sonden-Korpus, der neue Jailbreak-Familien verfolgt, statt dessen, woran der Agent sich am Bautag erinnerte
xmehrstufige Angriffe über mehrere Modelle, inklusive Crescendo und Kodierungstricks, richtig gemacht statt als Einzel-Prompts
xein Bericht eines Dritten mit Datum, den du einem Kunden oder Auditor geben kannst
xEinstufung nach Schwere und Hinweise zur Behebung von jemandem, der viele davon gesehen hat
xRegressionsläufe bei jeder Modell- oder Prompt-Änderung, ohne dass du daran denken musst
Nichts, das wir guten Gewissens empfehlen können. Deshalb gibt es den Prompt.
Kann ich ZeroLeaks vibecoden?
Jein. Der Kern von ZeroLeaks ist mit dem Prompt auf dieser Seite baubar. Echte Lücken bleiben: ein kuratierter, gepflegter Sonden-Korpus, der neue Jailbreak-Familien verfolgt, statt dessen, woran der Agent sich am Bautag erinnerte; mehrstufige Angriffe über mehrere Modelle, inklusive Crescendo und Kodierungstricks, richtig gemacht statt als Einzel-Prompts.
Was kostet ZeroLeaks?
ZeroLeaks hat keinen belastbar bestätigten Monatspreis. ZeroLeaks rechnet in US-Dollar ab: Pro kostet 79 Dollar pro Monat, Team 99 Dollar pro Nutzer pro Monat. Pro hat eine 14-tägige Testphase, einen kostenlosen gehosteten Tarif gibt es nicht.
Was verliere ich beim Selbstbau von ZeroLeaks?
Ganz ehrlich: ein kuratierter, gepflegter Sonden-Korpus, der neue Jailbreak-Familien verfolgt, statt dessen, woran der Agent sich am Bautag erinnerte; mehrstufige Angriffe über mehrere Modelle, inklusive Crescendo und Kodierungstricks, richtig gemacht statt als Einzel-Prompts; ein Bericht eines Dritten mit Datum, den du einem Kunden oder Auditor geben kannst; Einstufung nach Schwere und Hinweise zur Behebung von jemandem, der viele davon gesehen hat; Regressionsläufe bei jeder Modell- oder Prompt-Änderung, ohne dass du daran denken musst. Wenn einer dieser Punkte für dich entscheidend ist, lohnt sich der Selbstbau möglicherweise nicht.
Gibt es eine Open-Source-Alternative zu ZeroLeaks?
Keine ausgereifte Open-Source-Alternative, die wir guten Gewissens empfehlen können. Genau deshalb gibt es den Prompt auf dieser Seite.