← Blog

Waffen und Gewalt auf Fotos — neue Moderationskategorien, im Tarif enthalten

Ab heute bewertet modwall Bilder in drei Kategorien: Nacktheit/NSFW (wie bisher), Waffen und Gewalt/Gore (Beta). Alles im Tarif enthalten — eine Anfrage, ein Limit, kein Zählen von „Operationen” je Modell.

Zahlen statt Versprechen

Die Kategorie Waffen (Pistolen, Gewehre, in der Hand gehaltene Messer) wurde auf über 15.000 Bildern trainiert und evaluiert, darunter „knifflige” Negativbeispiele — Smartphones, Geldbörsen und Geldscheine, die wie eine Waffe in der Hand gehalten werden. Ergebnisse auf dem Validierungsset:

  • AUC 0,99 — Klassentrennung auf dem Niveau spezialisierter Detektoren;
  • beim voreingestellten Sperrschwellenwert von 0,8: 99 % Precision — etwa 7 Fehlalarme auf 1000 gewöhnliche Fotos — bei einem Recall von 79 %;
  • mit einem Prüfbereich von 0,5–0,8 steigt der Recall auf rund 98 % — Grenzfälle gehen in Ihre Human-in-the-Loop-Warteschlange statt auf die Plattform.

Gewalt/Gore läuft derzeit im Zero-Shot-Modus (Beta) — das Signal ist brauchbar, kalibrieren Sie die Schwellenwerte aber an Ihrem eigenen Traffic, bevor Sie automatisches Blockieren aktivieren.

Was ein Problem ist, entscheiden Sie — je Dienst

Eine Waffe auf einem Foto bedeutet auf einem Kleinanzeigenportal etwas anderes als in einer Gaming-Community und wieder etwas anderes auf einer Plattform für Schulen. Deshalb aktivieren Sie Kategorien in Moderations- profilen: Sie heften ein Profil an einen API-Schlüssel oder ein Widget, und jeder Ihrer Dienste bekommt seinen eigenen Satz an Kategorien, Schwellenwerten und Betriebsmodus. Ein Musikdienst kann Waffen abschalten (Rapper…), ein Dienst für Kinder alles auf Maximum drehen.

So aktivieren Sie es (2 Minuten)

  1. Dashboard → Richtlinie → Profil wählen (oder ein neues je Dienst anlegen).
  2. Kategorie Waffen und/oder Gewalt aktivieren, Schwellenwerte setzen.
  3. Beginnen Sie im Modus monitor — Sie sehen im Dashboard, was markiert würde, ohne Änderungen für Ihre Nutzer. Sehen die Zahlen gut aus, schalten Sie auf review oder enforce um.

Die API-Antwort hat die Felder categories, blocked_by und profile bekommen — Details in der API-Referenz. Nacktheit/NSFW funktioniert wie bisher, Sie müssen nichts ändern.

Warum im Tarif enthalten?

Bei manchen Anbietern ist jede Kategorie ein eigenes Modell, und jedes Modell frisst Operationen aus dem bezahlten Kontingent — ein Bild über drei Kategorien zu moderieren kostet drei Operationen. Unsere Kategorien laufen auf derselben CPU-Infrastruktur wie der Rest, und wir sehen keinen Grund, Sie zwischen Sicherheit und Budget wählen zu lassen. Eine Anfrage = alle aktivierten Kategorien.

Legen Sie ein Konto an (1000 Anfragen/Monat kostenlos) oder testen Sie es auf der Startseite an Ihrem eigenen Foto — die Demo zeigt jetzt alle drei Kategorien.

Binden Sie die Moderation an, bevor das Problem auf Ihrer Plattform landet

1000 kostenlose Anfragen pro Monat, ohne Karte. Der Monitor-Modus zeigt Ergebnisse auf Ihrem echten Traffic — ohne etwas zu blockieren.

Kostenloses Konto erstellen Preise