Richtlinie und Moderation

Die Richtlinie stellen Sie im Dashboard ein (Abschnitt Moderationsrichtlinie). Sie gilt für /v1/moderate (Bilder), /v1/moderate-text (Text) und das Widget. Sie besteht aus einem Modus (wie stark modwall eingreift) und Schwellenwerten (wo die Grenzen verlaufen). Modi und Schwellenwerte funktionieren für Bilder und Text identisch — beim Text bezieht sich der Schwellenwert auf den Gesamt-Score „unsafe” (das Maximum über die Toxizitätskategorien).

Betriebsmodi: monitor / review / enforce

Der Modus bestimmt, wie die rohe Empfehlung des Modells (recommended_action) auf decision abgebildet wird — also auf die Aktion, die wir Ihnen zurückgeben:

ModusWas modwall tutFür wen
monitorBeobachtet und protokolliert nur. Blockiert nichtsdecision ist immer allow, während recommended_action zeigt, was es tun würde. Audit-Log und der Webhook moderation.flagged funktionieren wie gewohnt. Gefahrloses Anbinden, ein Blick darauf, „was wir markieren würden”, ohne Risiko für die Plattform (Shadow Mode).
reviewHält den Grenzbereich bis zur Entscheidung eines Menschen zurück (HITL-Warteschlange). NSFW, mehrdeutige Inhalte.
enforceBlockiert auch den Grenzbereich automatisch — ohne Wartezeit. Bilderspam, eindeutige Pornografie, wiederkehrende Verstöße.

Empfohlener Weg: Beginnen Sie im Modus monitor, sehen Sie im Dashboard und im Audit-Log, wie viel und wie treffsicher modwall auf Ihrem echten Traffic markiert, und schalten Sie um auf review oder enforce, sobald Sie den Zahlen vertrauen.

Entscheidung: allow / review / block

Aus dem rohen nsfw-Wert berechnen wir anhand zweier Schwellenwerte eine Empfehlung (recommended_action), die der Modus anschließend auf decision abbildet:

Bedingungrecommended_action
nsfw ≥ Sperrschwelleblock
Prüfschwelle ≤ nsfw < Sperrschwellereview
darunterallow

Eine Prüfschwelle von 0 deaktiviert den Bereich — dann ist die Empfehlung hart (allow/block). Im Modus monitor ist decision unabhängig von der Empfehlung immer allow; im Modus enforce wird aus der Empfehlung review ein block.

Human-in-the-Loop-Warteschlange (HITL)

Inhalte mit der Entscheidung review landen in der Warteschlange im Dashboard, wo Sie sie manuell annehmen oder ablehnen. Das Bild speichern wir nicht — geben Sie in /v1/moderate eine reference (Ihre Inhalts-ID) und/oder eine image_url (Vorschau in Ihrer Infrastruktur) an, damit der Moderator den Inhalt erkennt. Den Status der Entscheidung lesen Sie über GET /v1/review/{id}.

Reaktive Ebene (Meldungen)

Unabhängig von der Prüfung beim Upload können Nutzer Inhalte melden. Rufen Sie POST /v1/report mit einer reference auf; wird die in der Richtlinie festgelegte Meldeschwelle überschritten, geht der Inhalt automatisch in die HITL-Warteschlange.

Schwellenwert für eine einzelne Anfrage

/v1/moderate?threshold=0.6 überschreibt die Sperrschwelle nur für diese eine Anfrage (der review-Bereich wird dabei übersprungen).

Tarife und Limits

TarifKontingent / Mon.Preis
Free1 0000 €
Starter50 00029 €
Growth250 00079 €
Scale2 000 000229 €
Self-hostJahresvertrag

Ist das Limit erschöpft, antworten wir mit 402. Der Zähler wird monatlich zurückgesetzt. Den Tarif wechseln Sie sofort im Dashboard.

Datenschutz und Zuverlässigkeit

  • Keine Speicherung von Bildern — wir verarbeiten im Arbeitsspeicher und protokollieren nur Metadaten (Zeit, Score, Größe).
  • Fail-open — fällt die Engine aus, antworten wir mit 503; die Ausweichentscheidung treffen Sie (empfohlen: zur manuellen Moderation).
  • Self-Hosting — in der On-Premise-Variante verlässt das Bild Ihre Infrastruktur nicht.