Jak mierzymy jakość komunikacji posłów. Każda ocena to analiza AI stenogramu (subiektywna, z zapisaną wersją promptu), oparta na recenzowanej literaturze. Tu opisujemy każdą cechę, wzór i cytowania - żeby każdą liczbę dało się obronić.
Co to jest. Czytamy stenogramy debat sejmowych i komentujemy każdą wypowiedź „a la code-review”: czy uzasadniona, czy na temat, czy są ataki personalne / błędy logiczne / techniki manipulacji. Z tych adnotacji budujemy profil komunikacyjny posła (10 niezależnych cech) i ranking merytoryczności.
Oceny generuje model językowy - są subiektywne. Przy każdej zapisujemy model i wersję promptu (odtwarzalność), a manipulację/błędy flagujemy wyłącznie z dosłownym cytatem i uzasadnieniem. Merytorykę promujemy, nikogo nie obwiniamy.
Każda metryka wyrasta z recenzowanej literatury. Poniżej pełne omówienie pięciu domen: konstrukty, jak akademicy je kodują (skale, rubryki), kontrolowane listy kategorii i cytowania.
Oceniamy wypowiedź posła (nie zdanie, nie całą debatę). Debata i profil posła to AGREGATY wypowiedzi. Zgodnie z DQI („speech”) i AQuA („comment”).
DQI empirycznie: wymiary jakości nie korelują (śr. r ≈ 0,12). Dlatego pokazujemy WEKTOR osobnych cech (paski), nigdy jednej „oceny jakości”. To wymóg naukowy, nie estetyczny.
LLM-y przeszacowują propagandę i błędy logiczne. Stosujemy wysoki próg, regułę „przy niepewności klasyfikuj jako BRAK”, a każda flaga musi wskazać fragment (cytat) + uzasadnienie. Do tego golden set + meta-eval Opus.
Każda cecha jest liczona osobno z adnotacji wypowiedzi, a następnie normalizowana do percentyla względem innych posłów. Wyższy pasek = lepiej (poza „stylem populistycznym”, który jest neutralnym opisem).
Czy poseł uzasadnia tezy (powód ↔ konkluzja, najlepiej ≥2 uzasadnienia) i wnosi treść (propozycja, krytyka merytoryczna, fakt). Rdzeń jakości deliberacji.
Wzór: 0,6 × (średni poziom uzasadnienia ÷ 4) + 0,4 × (udział wypowiedzi merytorycznych)
Źródło: DQI - justification (Steenbergen 2003, kody Bächtiger); AQuA Rationality (Behrendt 2024).
Czy poseł mówi o procedowanym projekcie, czy ucieka w dygresje / kampanię.
Wzór: udział wypowiedzi o trafności ≥ 1 (luźno lub wprost o procedowanym druku)
Źródło: AQuA Relevance; „Measuring Quality of Answers… LLMs” (2024) - relewancja semantyczna.
Czy poseł proponuje rozwiązania (polityka konstruktywna), czy tylko krytykuje.
Wzór: udział wypowiedzi z konkretną propozycją rozwiązania
Źródło: AQuA Solution Proposals; DQI constructive politics.
Czy poseł powołuje się na sprawdzalne fakty/dane (to także hak do przyszłego fact-checkingu). Mierzymy przywołanie, nie prawdziwość.
Wzór: udział wypowiedzi przywołujących sprawdzalne twierdzenie / dane
Źródło: AQuA Fact.
Odwrotność ataków na osobę zamiast na argument (name-calling, insynuacja, oskarżenie o kłamstwo, wulgaryzm, poniżanie). Wyższy = kulturalniej.
Wzór: 1 − udział wypowiedzi z atakiem personalnym, sarkazmem lub niekulturalnością
Źródło: Coe, Kenski & Rains 2014 (5 kategorii incivility); DQI respect; pragma-dialektyka (reguła 1).
Odwrotność gęstości błędów (chochoł, równia pochyła, fałszywa alternatywa, ad hominem, whataboutism…). Flaga tylko gdy błąd ZASTĘPUJE argument - wymaga cytatu + uzasadnienia.
Wzór: 1 − min(średnia liczba błędów logicznych na wypowiedź, 1)
Źródło: MAFALDA (Helwe 2024); Goffredo 2022/23 (debaty polityczne); van Eemeren & Grootendorst.
Odwrotność gęstości technik propagandy (loaded language, apel do strachu, slogany, czarno-białe ramy…). Próg konserwatywny - LLM przeszacowuje manipulację, więc „przy niepewności: brak”.
Wzór: 1 − min(średnia liczba technik perswazji ÷ 2, 1)
Źródło: Da San Martino 2019 (18 technik); SemEval-2023 Task 3 (23 techniki, polski w korpusie).
Odwrotność uników, ogólników bez treści i przerzucania winy. Wyższy = konkretniej.
Wzór: 1 − udział wypowiedzi z pustosłowiem lub przerzucaniem odpowiedzialności
Źródło: Bull & Mayer 1993; Thomakos 2024 (clarity/evasion); Weaver 1986 (8 strategii blame avoidance).
Czy poseł prowadzi realną wymianę (reaguje na cudze argumenty), czy mówi „obok”.
Wzór: udział wypowiedzi odnoszących się do innych lub mierzących się z kontrargumentem
Źródło: DQI-2 interactivity; AQuA Reciprocity; DQI respect-toward-counterarguments.
Stopień dyskursu „lud vs skorumpowane elity” (people-centrism + anti-elitism + podział manichejski). To OPIS stylu, NIE ocena „gorszy/lepszy” - dlatego neutralny kolor.
Wzór: średni poziom populizmu (0–2) ÷ 2
Źródło: Hawkins 2009 (holistic grading); Global Populism codebook; Rooduijn & Pauwels 2011; Mudde 2004.
Surowa wartość każdej cechy (0–1) jest przeliczana na percentyl rangowy wśród posłów z dostatecznie dużą liczbą zaadnotowanych wypowiedzi. Percentyl 100 = najwyżej w tej grupie, 0 = najniżej. Używamy percentyla (nie wartości bezwzględnej), bo jest odporny na skośność rozkładu i mówi „gdzie poseł stoi na tle innych”. Przy każdej cesze raportujemy też wartość surową, liczbę wypowiedzi (n) i przedział ufności (mała próba → szeroki przedział → etykieta „wstępne”).
Wymiary się nie sumują - nie ma jednej „oceny posła”. Oceny błędów, manipulacji i populizmu są subiektywne i celowo konserwatywne; ironia lub cytat cudzego argumentu mogą zmylić model. Profil to opis wzorca komunikacji, nie ocena wartości człowieka ani jego poglądów. Wszędzie etykieta „AI-subjective” i klikalne uzasadnienie.
Pełna synteza pięciu domen literatury (z operacjonalizacją i pułapkami) jest w repozytorium projektu: docs/to-be/03_obszary/DEBATE_INTEL_LITERATURE.md. Zobacz też ranking merytoryczności.