A magyar korrupciós sajtó hálózatai

A K-Monitor korrupciós hírarchívumának adatvezérelt elemzése — szavak, szókincs, szereplők és korrupciótípusok magyar parlamenti ciklusokra bontva.

Áttekintés

A korpusz alapadatai: hány cikk, hány lap, hány szereplő. A cikkek időbeli eloszlása évenként és magyar parlamenti ciklusonként, a legaktívabb lapok, a K-Monitor tartalmi kategóriái, a felcímkézett entitások típusai és a szöveg teljessége.

Cikkek évenként

Cikkek politikai ciklusonként

Legaktívabb lapok

Kategóriák

Címketípusok

Szövegteljesség

A cikkek mekkora részénél áll rendelkezésre a teljes szöveg, és mennyi vár még letöltésre (kiegészítésre).

Gyakori és jellemző szavak

Válassz politikai ciklust a legördülő menüből. Bal oldalon az adott ciklus leggyakoribb tartalmas szavai láthatók (szófelhő vagy rangsorolt lista), jobb oldalon a legjellemzőbb, megkülönböztető szavak. Egy szót akkor tekintünk megkülönböztetőnek, ha a többi ciklushoz képest felülreprezentált.

Két ciklus szóhasználatának összevetése

Az allotaxonográf két korszak szóhasználatát veti össze. A bal oldali rombuszon a szavak a két ciklusbeli gyakorisági rangsoruk szerint helyezkednek el; a szélek felé azok kerülnek, amelyek az egyik ciklusban sokkal jellemzőbbek. A jobb oldali lista a legnagyobb eltolódást mutató szavakat sorolja fel (rangfordulat-divergencia). Válassz két ciklust!

Szókincs gazdagsága

A MATTR (mozgóablakos type–token arány) azt méri, mennyire változatos a szókincs: minél magasabb az érték, annál kevésbé ismétlődnek a szavak. Balra politikai ciklusonként, jobbra a legváltozatosabb szókincsű lapok.

Politikai ciklusonként

Laponként (legváltozatosabb)

Szereplői hálózat

A projekt központi ábrája: a szereplők (személyek és intézmények) együttes-előfordulási hálózata. Két szereplő akkor kapcsolódik, ha ugyanabban a cikkben szerepelnek a K-Monitor kézi címkéi szerint. A csomópont mérete a PageRankot, színe a közösséget kódolja. Az ábra mozgatható és nagyítható, a keresőmezővel egy szereplő köre kiemelhető.

Egó-hálózat

Válassz egy szereplőt: a középső csomópont a kiválasztott szereplő, körülötte a leggyakrabban vele együtt említett szereplők. Az él vastagsága a kapcsolat erősségét jelzi.

Legközpontibb szereplők

A legtöbb súlyozott kapcsolat (fokszám).

Hidak

A legmagasabb köztiség — elkülönülő csoportokat kötnek össze.

Heterogén hálózat

Agresszív egyenlőtlenség-szűrővel (disparity filter) képzett háttérváz a személyek, intézmények és helyek közös együttes-előfordulási hálózatán. A térkép a PageRank szerinti 160 legfontosabb csúcsot mutatja; a csomópont színe az entitás típusát (személy, intézmény, hely), mérete a PageRankot kódolja. Több centralitási mérték is látható (fokszám, közöttiség, PageRank, sajátvektor). A teljes háttérváz mérete rétegenként külön olvasható.

Fokszám

Közöttiség

PageRank

Sajátvektor

Földrajz

A korrupciós hírek földrajza — a K-Monitor helyek címkéi H3 hatszögrácsra vetítve. Válassz politikai ciklust; a hasábok magassága és színe az adott cellában említett magyar helyek gyakoriságát kódolja. Vidd az egeret egy hasáb fölé a leggyakoribb helynevekért.

Leggyakrabban említett helyek

Külföld és régiók

A magyar korrupciós hírekben említett külföldi országok, régiók és kontinensek.

Korrupciótípusok

A K-Monitor „egyéb” (others) címkéiből kigyűjtött korrupciótípusok (pl. közbeszerzés, klientúra, vesztegetés, hűtlen kezelés, csalás). Végigkövethető egy-egy típus előfordulása a politikai ciklusokban, és megnézhető, mely személyekhez, intézményekhez és lapokhoz kötődnek leginkább.

A leggyakoribb korrupciótípusok

Korrupciótípusok politikai ciklusonként

A leggyakoribb típusok cikkszáma ciklusról ciklusra. A jelmagyarázatra kattintva ki-be kapcsolhatók a görbék.

Típus ↔ személy

Típus ↔ intézmény

Hangsúlyok laponként

Mely korrupciótípusokra fókuszálnak leginkább az egyes lapok.

Témák

Korrupciós témák a BERTopic + huBERT modellből, politikai ciklusonként. A témák nevét kézzel adtuk meg a kulcsszavak alapján. A jelmagyarázatra kattintva ki-be kapcsolhatók a görbék.

Témák politikai ciklusonként

A témák és kulcsszavaik

Minden téma a hozzá tartozó cikkek számával és legjellemzőbb kulcsszavaival, méret szerint csökkenő sorrendben.

Témák és korrupciótípusok

Hogyan viszonyulnak a K-Monitor korrupciótípus-címkéi a BERTopic témákhoz és a szereplőkhöz? A hőtérkép azt mutatja, hány cikkben esik egybe egy-egy korrupciótípus (sor) és téma (oszlop); alább témánként a meghatározó személyek és intézmények.

Címke × téma hőtérkép

Téma szerinti szereplők

Meghatározó személyek

Meghatározó intézmények

Médiapolitika

Minden cikket a megjelenése idején érvényes lapbesorolás szerint címkézünk: az adott lap kormányközeli, független vagy bulvár jellege abban az időpontban számít. Több lap az Orbán-korszakban „átállt" — az Index 2020 júliusában független→kormányközeli irányba, az Origo 2015 körül —, és az így számolt idővonal ezt a váltást is tükrözi.

Lefedettség idővonalon

A cikkek száma politikai ciklusonként, a lap besorolása szerint. A jelmagyarázatra kattintva ki-be kapcsolhatók a görbék.

Kik szerepelnek? — Meghatározó szereplők

Kormányközeli sajtó

Független sajtó

Miről írnak? — Témák megoszlása

A témák soronként normalizált megoszlása a kormányközeli és a független sajtóban, így a két oldal közvetlenül összevethető.

Korrupciótípusok megoszlása

Nyelvi különbségek — Megkülönböztető szavak

Kormányközeli sajtóra jellemző

Független sajtóra jellemző

Esettanulmány: laptulajdonos-váltás

A váltás előtt

A váltás után

A projektről

Ez az interaktív elemzés a K-Monitor korrupciós hírarchívumát (K-Monitor/kmdb_base) dolgozza fel: mintegy 64 800 magyar nyelvű, (állítólagos) korrupcióról szóló újságcikket, amelyeket a K-Monitor antikorrupciós civil szervezet gyűjtött és címkézett. A módszertan a Crow Intelligence magyar dalszöveg-elemzését követi, más tárgykörre alkalmazva.

A cikkek szövegét ott, ahol a tárolt szöveg hiányzott vagy csonka volt, az eredeti forrásból vagy archív (Wayback Machine) pillanatképből egészítettük ki. A nyelvi feldolgozást — tokenizálás, szótövezés (lemmatizálás), szófaji címkézés — az emtsv (emMorph) rendszerrel végeztük. A tartalmi szavak (fő- és melléknevek, igék, határozók) lemmáiból építkezik a gyakorisági, kulcsszó- és szókincs-gazdagsági elemzés.

Az időbeli bontás magyar parlamenti ciklusok szerint történik (2002–2006, 2006–2010, 2010–2014, 2014–2018, 2018–2022, 2022–), mert ez a korpusz szempontjából értelmesebb, mint az évtizedek.

A központi ábra a szereplők együttes-előfordulási hálózata: két személy vagy intézmény akkor kapcsolódik, ha ugyanabban a cikkben szerepel a K-Monitor kézi címkéi szerint. A hálózat gerincét (backbone) diszparitás-szűrővel emeltük ki. A „korrupciótípusok" a K-Monitor egyéb (others) címkéiből származnak (klientúra, közbeszerzés, vesztegetés, hűtlen kezelés, csalás stb.).

Az adatbázis forrása: https://adatbazis.k-monitor.hu/ — licenc: CC-BY-SA-4.0. Az elemzés kutatási célú; az egyes címkék és állítások a K-Monitor besorolását tükrözik.