Richtlinie und Moderation

Politykę ustawiasz w panelu (sekcja Polityka moderacji). Obowiązuje dla /v1/moderate (obrazy), /v1/moderate-text (tekst) i widgetu. Składa się z trybu (jak mocno modwall ingeruje) oraz progów (gdzie przebiegają granice). Tryby i progi działają identycznie dla obrazów i tekstu — dla tekstu próg dotyczy łącznego score „unsafe” (maksimum z kategorii toksyczności).

Tryby działania: monitor / review / enforce

Tryb decyduje, jak surowa rekomendacja modelu (recommended_action) przekłada się na decision, czyli akcję, którą zwracamy Tobie:

TrybCo robi modwallDla kogo
monitorTylko obserwuje i loguje. Nic nie blokujedecision zawsze allow, a recommended_action pokazuje, co by zrobił. Audyt i webhook moderation.flagged działają normalnie. Bezpieczne wpięcie, podgląd „co oflagowalibyśmy” bez ryzyka dla platformy (shadow mode).
reviewPasmo graniczne wstrzymuje do decyzji człowieka (kolejka HITL). NSFW, treści niejednoznaczne.
enforcePasmo graniczne też blokuje automatycznie — bez czekania. Spam obrazkowy, oczywista pornografia, powtarzalne nadużycia.

Zalecana ścieżka: zacznij w monitor, zobacz w panelu/audycie ile i jak celnie modwall flaguje na Twoim realnym ruchu, a gdy zaufasz liczbom — przełącz na review lub enforce.

Decyzja: allow / review / block

Z surowego nsfw liczymy rekomendację (recommended_action) wg dwóch progów, a następnie tryb mapuje ją na decision:

Warunekrecommended_action
nsfw ≥ próg blokadyblock
próg przeglądu ≤ nsfw < próg blokadyreview
poniżejallow

Próg przeglądu = 0 wyłącza pasmo — wtedy rekomendacja jest twarda (allow/block). W trybie monitor decision jest zawsze allow niezależnie od rekomendacji; w enforce rekomendacja review staje się block.

Kolejka human-in-the-loop (HITL)

Treść z decyzją review trafia do kolejki w panelu, gdzie ręcznie ją akceptujesz lub odrzucasz. Obrazu nie przechowujemy — w /v1/moderate podaj reference (Twoje ID treści) i/lub image_url (podgląd na Twojej infrze), żeby moderator rozpoznał treść. Status decyzji odczytasz przez GET /v1/review/{id}.

Warstwa reaktywna (zgłoszenia)

Niezależnie od skanu przy uploadzie, użytkownicy mogą zgłaszać treść. Wołaj POST /v1/report z reference; po przekroczeniu progu zgłoszeń (z polityki) treść automatycznie trafia do kolejki HITL.

Próg na pojedyncze żądanie

/v1/moderate?threshold=0.6 nadpisuje próg blokady tylko dla tego żądania (pasmo review jest wtedy pomijane).

Plany i limity

TarifKontingent / Mon.Cena
Free1 0000 €
Starter50 00029 €
Growth250 00079 €
Scale2 000 000229 €
Self-hostkontrakt roczny

Po wyczerpaniu limitu zwracamy 402. Licznik resetuje się co miesiąc. Plan zmienisz od ręki w panelu.

Prywatność i niezawodność

  • Brak zapisu obrazów — przetwarzamy w pamięci, logujemy tylko metadane (czas, score, rozmiar).
  • Fail-open — przy awarii silnika zwracamy 503; decyzję zapasową podejmujesz Ty (zalecane: do ręcznej moderacji).
  • Self-host — w wariancie on-premise obraz nie opuszcza Twojej infrastruktury.