Richtlinie und Moderation
Politykę ustawiasz w panelu (sekcja Polityka moderacji). Obowiązuje dla /v1/moderate (obrazy), /v1/moderate-text (tekst) i widgetu. Składa się z trybu (jak mocno modwall ingeruje) oraz progów (gdzie przebiegają granice). Tryby i progi działają identycznie dla obrazów i tekstu — dla tekstu próg dotyczy łącznego score „unsafe” (maksimum z kategorii toksyczności).
Tryby działania: monitor / review / enforce
Tryb decyduje, jak surowa rekomendacja modelu (recommended_action) przekłada się na decision, czyli akcję, którą zwracamy Tobie:
| Tryb | Co robi modwall | Dla kogo |
|---|---|---|
monitor | Tylko obserwuje i loguje. Nic nie blokuje — decision zawsze allow, a recommended_action pokazuje, co by zrobił. Audyt i webhook moderation.flagged działają normalnie. |
Bezpieczne wpięcie, podgląd „co oflagowalibyśmy” bez ryzyka dla platformy (shadow mode). |
review | Pasmo graniczne wstrzymuje do decyzji człowieka (kolejka HITL). | NSFW, treści niejednoznaczne. |
enforce | Pasmo graniczne też blokuje automatycznie — bez czekania. | Spam obrazkowy, oczywista pornografia, powtarzalne nadużycia. |
Zalecana ścieżka: zacznij w monitor, zobacz w panelu/audycie ile i jak celnie modwall flaguje na Twoim realnym ruchu, a gdy zaufasz liczbom — przełącz na review lub enforce.
Decyzja: allow / review / block
Z surowego nsfw liczymy rekomendację (recommended_action) wg dwóch progów, a następnie tryb mapuje ją na decision:
| Warunek | recommended_action |
|---|---|
nsfw ≥ próg blokady | block |
próg przeglądu ≤ nsfw < próg blokady | review |
| poniżej | allow |
Próg przeglądu = 0 wyłącza pasmo — wtedy rekomendacja jest twarda (allow/block). W trybie monitor decision jest zawsze allow niezależnie od rekomendacji; w enforce rekomendacja review staje się block.
Kolejka human-in-the-loop (HITL)
Treść z decyzją review trafia do kolejki w panelu, gdzie ręcznie ją akceptujesz lub odrzucasz. Obrazu nie przechowujemy — w /v1/moderate podaj reference (Twoje ID treści) i/lub image_url (podgląd na Twojej infrze), żeby moderator rozpoznał treść.
Status decyzji odczytasz przez GET /v1/review/{id}.
Warstwa reaktywna (zgłoszenia)
Niezależnie od skanu przy uploadzie, użytkownicy mogą zgłaszać treść. Wołaj POST /v1/report z reference; po przekroczeniu progu zgłoszeń (z polityki) treść automatycznie trafia do kolejki HITL.
Próg na pojedyncze żądanie
/v1/moderate?threshold=0.6 nadpisuje próg blokady tylko dla tego żądania (pasmo review jest wtedy pomijane).
Plany i limity
| Tarif | Kontingent / Mon. | Cena |
|---|---|---|
| Free | 1 000 | 0 € |
| Starter | 50 000 | 29 € |
| Growth | 250 000 | 79 € |
| Scale | 2 000 000 | 229 € |
| Self-host | — | kontrakt roczny |
Po wyczerpaniu limitu zwracamy 402. Licznik resetuje się co miesiąc. Plan zmienisz od ręki w panelu.
Prywatność i niezawodność
- Brak zapisu obrazów — przetwarzamy w pamięci, logujemy tylko metadane (czas, score, rozmiar).
- Fail-open — przy awarii silnika zwracamy
503; decyzję zapasową podejmujesz Ty (zalecane: do ręcznej moderacji). - Self-host — w wariancie on-premise obraz nie opuszcza Twojej infrastruktury.