Metodevalg
Hvilke krav stiller god kildekritik til offentlige data?
Kildekritik handler om at forstå, at beskrivelser af både historiske og aktuelle begivenheder er redigerede udlægninger af virkeligheden, som man må forholde sig kritisk til for at få en nuanceret…
Hvorfor offentlige data ikke er hævet over kildekritik
Kildekritik handler om at forstå, at beskrivelser af både historiske og aktuelle begivenheder er redigerede udlægninger af virkeligheden, som man må forholde sig kritisk til for at få en nuanceret forståelse (Faktalink). Redigeringen starter ikke, når journalisten skriver om tallene: Arkivarer i Rigsarkivet beslutter, hvad der skal bevares, og dermed hvilke kilder der skal fortælle vores historie (Faktalink). Udvælgelse, kategorisering og formidling er derfor en del af enhver offentlig datakilde, længe før man regner på den.
Gennem historien har magthavere og andre fordrejet beskrivelser af virkeligheden til egen fordel; i dag sker manipulation blandt andet gennem falske nyheder. Internettet gør det muligt for stort set alle at udgive deres egen version af virkeligheden, og med kunstig intelligens er det blevet lettere end nogensinde at skabe videoer, lydfiler og tekster, der udgiver sig for at være ægte, men er kunstige fremstillinger (Faktalink). En .dk-adresse og et myndighedslogo i sidefoden er ikke i sig selv et kvalitetsstempel.
Kildekritik er et centralt begreb i historievidenskaben. Den danske historiker, professor ved Københavns Universitet og rigsarkivar Kristian Erslev nuancerede begrebet og udarbejdede læresætninger om kildekritik, som i høj grad har formet dansk historieforskning (Faktalink). I praksis arbejder man med fire nøglekriterier fra Københavns Universitetsbibliotek: troværdighed, objektivitet, præcision og relevans (KUB). De fire kriterier kan bruges direkte på registre, statistik og rapporter fra det offentlige.
Fordele og ulemper ved offentlige data
- Fordele
- Fri adgang, tilgængelighed, mulighed for gennemsigtighed og krydsvalidering
- Ulemper
- Manglende relevans trods tilgængelighed, risiko for manipulation, usikker dokumentation, usynlighed af metode
Afsender, formål og uafhængighed
Troværdighedskriteriet handler om, hvem der står bag kilden. Man skal undersøge forfatterens uddannelse, tilhørsforhold, position og kontaktoplysninger, om forfatteren udtaler sig inden for sit eget forskningsfelt, hvilken kildetype der er tale om – primær, sekundær eller fagfællebedømt – og hvor kilden er publiceret, fx om der står et anerkendt forlag bag, og hvis der er en internetkilde, hvem der står bag den (KUB). For en offentlig kilde betyder det: find den ansvarlige styrelse, institut eller enhed, den fagansvarlige bag opgørelsen og en kontaktvej, så udsagnet kan efterprøves hos afsenderen.
Objektivitetskriteriet drejer sig om hensigten: vil afsenderen overbevise eller informere? Man skal undersøge, om informationen er omfattende og saglig, om alle sider af sagen berøres, om den er ensidig, om den er i konflikt med andre anerkendte kilder, og om den er videnskabeligt kontrollerbar og fagfællebedømt. Desuden skal man se på interessekonflikter: forfatterens tilknytningsforhold og hvem der har sponsoreret forskningen (KUB). En myndighed kan have et sagligt formål med at offentliggøre et tal og samtidig en institutionel interesse i, at tallet ser bestemt ud.
Et håndgribeligt holdepunkt er, om afsenderen har en offentliggjort formidlingspolitik. Danmarks Statistiks formidlingspolitik bygger på principperne uafhængighed, tilgængelighed, troværdighed og fortrolighed (Danmarks Statistik). Man kan derfor spørge: Hvilken enhed er ansvarlig for netop dette tal? Findes der en tilsvarende politik, man kan måle kilden op imod? Er det tydeligt, hvem der fagligt står bag?
Begreber som »etisk« og »ansvarlig« dataanvendelse er ikke selvforklarende. Digitaliseringsstyrelsens analyse af dataetik i store danske virksomheder viser, at virksomhederne forstår dataetik forskelligt – mange ser dataetik i sammenhæng med GDPR, mens andre har mere fokus på kunstig intelligens og medarbejderdata (Digitaliseringsstyrelsen). Når en afsender henviser til dataetik eller ansvarlighed, bør man derfor kræve en konkret definition af, hvad der menes, og hvad det betyder for netop de data, man læser.
Præcision, dokumentation og opdatering
Præcision handler om, hvorvidt kilden er opdateret, omfattende, detaljeret og præcis. Man skal undersøge, hvornår kilden blev publiceret, og hvornår den blev revideret – særligt hvis det er bøger eller websites – om argumentationen er saglig, konsistent, detaljeret og nøjagtig, om der er kildehenvisninger, som viser, at forfatteren har forsket i emnet, og om informationen kan bekræftes i andre kilder (KUB).
For offentlige data betyder det, at dokumentationen skal gøre det muligt for en anden at genskabe opgørelsen: definitioner af de anvendte begreber og enheder, beskrivelse af opgørelsesmetode og population, oplysning om hvilken periode og geografi der er dækket, dato for opdatering og – ved reviderede tal – en versionshistorik, så man kan se, hvad der er ændret og hvorfor. Mangler disse oplysninger, kan tallet ikke efterprøves, og så opfylder kilden ikke kravet om at kunne bekræftes i andre kilder.
Et eksempel på en metodebeskrivelse, der kan efterprøves: Digitaliseringsstyrelsens analyse byggede på 3.673 årsrapporter fra 2022 og 2023, resultaterne blev efterfølgende valideret ved manuel stikprøvekontrol af 100 tilfældigt udvalgte afsnit om dataetik, og dataopbevaring og krydsning blev foretaget i et lukket miljø hos Danmarks Statistik (Digitaliseringsstyrelsen). Den type oplysninger – antal enheder, periode, valideringsmetode og hvor behandlingen foregik – er det niveau af dokumentation, man bør kræve, før man citerer en analyse som dokumentation.
Relevans, primære og sekundære kilder
Relevans handler om, hvorvidt kilden passer til det informationsbehov, man har. Man skal undersøge, hvilket emneområde kilden dækker, hvilken kildetype der er tale om – fx en videnskabelig publikation eller en nyhedsartikel – om det er fagfolk eller ikke-fagfolk, der er ophav til kilden, for hvem kilden er skrevet, og hvorfor den er blevet publiceret (KUB). Et registerudtræk, en årsrapport og en pressemeddelelse om samme tal besvarer ikke det samme spørgsmål.
Skellet mellem primære og sekundære kilder er et arbejdsredskab. Primære kilder indeholder ny og ikke før publiceret information, for eksempel artikler, forskningsrapporter og doktordisputatser. Sekundære kilder henviser typisk til de primære kilder og skaber oversigt; de skaber ikke ny original viden, for eksempel review- eller oversigtsartikler, lærebøger og leksika. De to typer litteraturkilder har forskellige opgaver og anvendes forskelligt, og derfor er det vigtigt at kunne identificere dem (KUB). For offentlige data betyder det, at den primære kilde er selve registeret eller den oprindelige opgørelse, mens en rapport eller nyhedsartikel om tallene er sekundær. Skal et udsagn stå til regnskab, må det føres tilbage til den primære datakilde og dens metodebeskrivelse.
Dækningen skal tjekkes konkret: emne, periode, geografi og detaljeringsniveau. Offentlige data stilles til rådighed i forskellige rammer – KL’s publikation »Gode grunddata til alle« beskriver, at en fælles grunddatainfrastruktur skal sikre, at data stilles frit til rådighed og nemt kan anvendes i både den offentlige og den private sektor (KL), og ved lanceringen af Dataforsyningen i 2020 var målet, at offentlige data skal være let forståelige og tilgængelige for både offentlige og private (Klimadatastyrelsen). Fri adgang er dog ikke det samme som relevans: at data er nemme at hente, siger intet om, hvorvidt de dækker den periode, den geografi eller det detaljeringsniveau, man har brug for.
Primære vs. sekundære kilder i offentlig data
- Primære kilderSelve registeret eller den oprindelige opgørelse – ny og ikke før publiceret information
- Sekundære kilderRapporter, nyhedsartikler eller oversigtsartikler – henviser til primære kilder, skaber ikke ny original viden
Krydsvalidering og gennemsigtig metode
Kravet om, at informationen skal kunne bekræftes i andre kilder (KUB), er den centrale test. Et enkelt tal fra én myndighed er ét udsagn, ikke en verifikation. Krydsvalidering betyder, at man finder en uafhængig kilde – et andet register, en anden opgørelse eller den oprindelige indberetning – og undersøger, om den giver samme resultat, og hvis ikke, hvorfor forskellen opstår: forskellige definitioner, forskellige populationer eller forskellige opgørelsestidspunkter.
Den praktiske regel er: Automatiserede analyser af offentligt tilgængelige data bør valideres manuelt eller ved stikprøvekontrol, før resultaterne bruges som dokumentation. Det gælder også, når man selv kører udtræk eller spørger en sprogmodel om et datasæt. Man bør kunne redegøre for, hvordan data er udtrukket, hvilke filtre der er anvendt, hvilken version af data der er brugt, og hvordan resultatet efterfølgende er kontrolleret mod en manuel gennemgang. Er krydsning af flere datakilder en del af analysen, bør det fremgå, hvor behandlingen har fundet sted, og hvem der har haft adgang.
Fortrolighed, personoplysninger og etiske grænser
Kildekritik af offentlige data må indeholde et spørgsmål om personoplysninger. Når man behandler personoplysninger – det vil sige indsamler, registrerer, videregiver eller sletter oplysninger om personer – skal GDPR overholdes, og reglerne gælder også, når man som privatperson bliver registreret af en virksomhed eller myndighed (Datatilsynet). Man skal altså kunne svare på, hvilke personoplysninger der indgår i kilden, til hvilket formål de behandles, og hvor længe det er nødvendigt at gemme dem.
Sundhedsdata skal behandles sikkert og forsvarligt, og Sundhedsdatastyrelsen har ansvar for, at retten til fortrolighed og privatliv sikres, når oplysninger indsamles og behandles. Beskyttelsen består af flere faktorer: krypterede forbindelser og sikre systemer beskytter data mod angreb fra cyberkriminelle, mens logning og begrænsning af adgang sikrer, at det kun er dem, som har lov til det, der får adgang til data. Uddannelse og certificering af medarbejdere sikrer, at de kender reglerne (Sundhedsdatastyrelsen). Konkret betyder det, at medarbejdere kun får adgang til de data, som er nødvendige for en bestemt analyse, at de årligt skal bestå kurser i databeskyttelse og informationssikkerhed, at de bliver logget, og at de har tavshedspligt.
Også ekstern adgang er betinget. Når forskere søger Sundhedsdatastyrelsen om adgang til data, skal de beskrive, hvilke data de ønsker at bruge og hvorfor, de skal dokumentere, at det er til forskning af væsentlig samfundsmæssig betydning, og de får kun adgang til de data, som er nødvendige for deres projekt. Uanset hvem der skal have adgang til data i sundhedsregistrene, kræves særlige godkendelser (Sundhedsdatastyrelsen). Kildekritisk set bør man derfor spørge, om adgangen til de data, man selv anvender eller henviser til, er sikker, begrænset, godkendt og logget.
Etiske grænser falder ikke automatisk med, at data er offentligt tilgængelige. Digitaliseringsstyrelsen fremhæver, at det var afgørende for valget om at bruge generativ kunstig intelligens, at virksomhedernes årsrapporter er offentligt tilgængelig information (Digitaliseringsstyrelsen). Ved offentliggørelse og videreanvendelse bør man derfor vurdere, om små enheder eller fine geografiske niveauer kan gøre enkeltpersoner genkendelige, om der er tale om personoplysninger eller sundhedsdata, og om den konkrete offentliggørelse er etisk forsvarlig – også når adgangen formelt er tilladt.
Praktisk tjekliste til offentlige data
Afsender: Hvem er den ansvarlige myndighed eller enhed, og fremgår det, hvem der fagligt står bag opgørelsen? Er der navn, kontaktoplysninger og en efterprøvelig placering af ansvaret? Hvis kilden er en hjemmeside, hvem står så bag den?
Formål: Skal kilden informere eller overbevise? Er informationen omfattende og saglig, eller ensidig? Er der interessekonflikter, tilknytningsforhold eller sponsorer bag? Findes der en offentliggjort formidlingspolitik, kilden kan måles op imod?
Præcision og opdatering: Fremgår publiceringsdato og revideringsdato? Er definitioner, opgørelsesmetode, population, periode og geografi dokumenteret? Findes der versionshistorik for reviderede tal?
Kildehenvisninger og sporbarhed: Kan udsagnet føres tilbage til den primære datakilde? Er der kildehenvisninger nok til, at en anden kan genskabe opgørelsen?
Relevans og kildetype: Dækker kilden det rigtige emne, den rigtige periode, den rigtige geografi og det rigtige detaljeringsniveau? Er det en primær eller sekundær kilde, og er ophavet fagfolk eller ikke-fagfolk?
Krydsvalidering og metode: Kan tallet bekræftes i en uafhængig kilde? Hvis ikke, hvad forklarer forskellen? Er automatiske udtræk valideret manuelt eller ved stikprøvekontrol, og fremgår det, hvordan data er udtrukket, filtreret og krydset, og hvor behandlingen er foregået?
Fortrolighed og etik: Indeholder kilden personoplysninger eller sundhedsdata? Er adgangen sikker, begrænset, godkendt og logget? Er videreanvendelsen etisk forsvarlig, også hvis offentliggørelsen formelt er tilladt?