Richtlinie und Moderation
Die Richtlinie stellen Sie im Dashboard ein (Abschnitt Moderationsrichtlinie). Sie gilt für /v1/moderate (Bilder), /v1/moderate-text (Text) und das Widget. Sie besteht aus einem Modus (wie stark modwall eingreift) und Schwellenwerten (wo die Grenzen verlaufen). Modi und Schwellenwerte funktionieren für Bilder und Text identisch — beim Text bezieht sich der Schwellenwert auf den Gesamt-Score „unsafe” (das Maximum über die Toxizitätskategorien).
Betriebsmodi: monitor / review / enforce
Der Modus bestimmt, wie die rohe Empfehlung des Modells (recommended_action) auf decision abgebildet wird — also auf die Aktion, die wir Ihnen zurückgeben:
| Modus | Was modwall tut | Für wen |
|---|---|---|
monitor | Beobachtet und protokolliert nur. Blockiert nichts — decision ist immer allow, während recommended_action zeigt, was es tun würde. Audit-Log und der Webhook moderation.flagged funktionieren wie gewohnt. |
Gefahrloses Anbinden, ein Blick darauf, „was wir markieren würden”, ohne Risiko für die Plattform (Shadow Mode). |
review | Hält den Grenzbereich bis zur Entscheidung eines Menschen zurück (HITL-Warteschlange). | NSFW, mehrdeutige Inhalte. |
enforce | Blockiert auch den Grenzbereich automatisch — ohne Wartezeit. | Bilderspam, eindeutige Pornografie, wiederkehrende Verstöße. |
Empfohlener Weg: Beginnen Sie im Modus monitor, sehen Sie im Dashboard und im Audit-Log, wie viel und wie treffsicher modwall auf Ihrem echten Traffic markiert, und schalten Sie um auf review oder enforce, sobald Sie den Zahlen vertrauen.
Entscheidung: allow / review / block
Aus dem rohen nsfw-Wert berechnen wir anhand zweier Schwellenwerte eine Empfehlung (recommended_action), die der Modus anschließend auf decision abbildet:
| Bedingung | recommended_action |
|---|---|
nsfw ≥ Sperrschwelle | block |
Prüfschwelle ≤ nsfw < Sperrschwelle | review |
| darunter | allow |
Eine Prüfschwelle von 0 deaktiviert den Bereich — dann ist die Empfehlung hart (allow/block). Im Modus monitor ist decision unabhängig von der Empfehlung immer allow; im Modus enforce wird aus der Empfehlung review ein block.
Human-in-the-Loop-Warteschlange (HITL)
Inhalte mit der Entscheidung review landen in der Warteschlange im Dashboard, wo Sie sie manuell annehmen oder ablehnen. Das Bild speichern wir nicht — geben Sie in /v1/moderate eine reference (Ihre Inhalts-ID) und/oder eine image_url (Vorschau in Ihrer Infrastruktur) an, damit der Moderator den Inhalt erkennt.
Den Status der Entscheidung lesen Sie über GET /v1/review/{id}.
Reaktive Ebene (Meldungen)
Unabhängig von der Prüfung beim Upload können Nutzer Inhalte melden. Rufen Sie POST /v1/report mit einer reference auf; wird die in der Richtlinie festgelegte Meldeschwelle überschritten, geht der Inhalt automatisch in die HITL-Warteschlange.
Schwellenwert für eine einzelne Anfrage
/v1/moderate?threshold=0.6 überschreibt die Sperrschwelle nur für diese eine Anfrage (der review-Bereich wird dabei übersprungen).
Tarife und Limits
| Tarif | Kontingent / Mon. | Preis |
|---|---|---|
| Free | 1 000 | 0 € |
| Starter | 50 000 | 29 € |
| Growth | 250 000 | 79 € |
| Scale | 2 000 000 | 229 € |
| Self-host | — | Jahresvertrag |
Ist das Limit erschöpft, antworten wir mit 402. Der Zähler wird monatlich zurückgesetzt. Den Tarif wechseln Sie sofort im Dashboard.
Datenschutz und Zuverlässigkeit
- Keine Speicherung von Bildern — wir verarbeiten im Arbeitsspeicher und protokollieren nur Metadaten (Zeit, Score, Größe).
- Fail-open — fällt die Engine aus, antworten wir mit
503; die Ausweichentscheidung treffen Sie (empfohlen: zur manuellen Moderation). - Self-Hosting — in der On-Premise-Variante verlässt das Bild Ihre Infrastruktur nicht.