Metoda · wersja v1
Test dwoch proporcji (z) + przedzial Wilsona 95% nad adnotacjami
Ta strona opisuje jedną wersję jednej metody. Materiał, który się do niej odwołuje, został policzony dokładnie tak, jak tu napisano — także wtedy, gdy metoda zdążyła się od tego czasu zmienić.
Czym liczymy
- Potok, który to liczy
- detect_debate_outlier
- Wersja metody
- v1
- Próg
- |delta| >= 20 pp oraz |z| > 2,576 (p < 0,01), polowa CI <= 5 pp
- Poziom ufności
- 95 %
- Dane wejściowe
- statement_annotation, sitting_statement, dataset_coverage
- Kod, który to liczy
- backend/pipelines/sql/debate_substance_deviation.sql
- Odcisk metody
3e483e63220f7044d127d8cd14bea5988b616ac610e36086052a868b0e4003a7Suma kontrolna zapytania, parametrów, progu i wymogów. Zmiana któregokolwiek z nich bez podbicia wersji zatrzymuje wdrożenie.
Jak to liczymy
Porownujemy udzial wypowiedzi posla oznaczonych jako merytoryczne w oknie 90 dni z jego wlasnym oknem bazowym. Etykiete „merytoryczna" stawia model jezykowy, wiec to jest ocena, a nie fakt ze zrodla — liczymy nad nia tylko udzial, przedzial Wilsona i test dwoch proporcji. Pomijamy wypowiedzi z urzedu (marszalek, sprawozdawca). Okna sa ROZLACZNE, sprawdza to krok assert.
Czego ta metoda nie rozstrzyga
- Etykieta 'merytoryczna' pochodzi z modelu jezykowego i zmienia sie razem z wersja promptu
- Zmiana wersji promptu przesuwa cala serie — porownanie okien zaklada te sama wersje adnotacji
- Krotka wypowiedz proceduralna liczy sie tak samo jak dluga polemika: wazymy liczba, nie czasem
- Brak korekty na wielokrotne testowanie
- Podajemy statystyke z i prog krytyczny, nie p-value: baza nie ma funkcji rozkladu normalnego