Rettigheder og kunstig intelligens

Dansk indhold i AI-træningsdata

Dette site dokumenterer dansk musik, danske bøger, danske billeder, dansk tekst, sangtekster og kompositioner, samt danske privatpersoners personoplysninger, der optræder i de datasæt, som bruges, eller med rimelighed kan antages at være brugt, til at træne kunstig intelligens. Tallene nedenfor er det, jeg har fundet indtil videre.

Har du spørgsmål, rettelser eller indspil, er du meget velkommen til at skrive til mig.

Nøglefund fra de undersøgte træningsdatasæt
Bøger
7.869
danske bogtitler dokumenteret i de datasæt Anthropic, Meta og OpenAI trænede på, efterprøvet mod de præcise udgaver ud fra ISBN og MD5-hash
Opslagsværker og web
354.021
sider beskyttet dansk vidensindhold fanget i Common Crawl, hvoraf 53.602 er bekræftet i træningsdatasættet FineWeb-2
Persondata
545.705
danske telefonnumre, plus 43.228 mails og 342 med CPR-nummer, fundet i åbne træningsdatasæt (HPLT, FineWeb-2)
Sådan er det dokumenteret

Bøger er sammenholdt på ISBN-nummer mod arkiverede, samtidige udgaver af LibGen, PiLiMi og Books3, og forankret med kryptografisk MD5-hash (Bartz v. Anthropic, Kadrey v. Meta, Authors Guild v. OpenAI). Anthropics brug er efterprøvet mod de præcise udgaver.

Opslagsværker er talt i Common Crawl, det webarkiv som træningsdatasæt bygges af. Persondata er fundet i de åbne datasæt HPLT og FineWeb-2.

For web-indhold viser tallene tilstedeværelse i datasættene. At et bestemt selskab har trænet på netop en given side er en rimelig slutning, men ikke retsdokumenteret pr. side som bøgerne.

Slå dig op på tværs af alle datasæt på én gang. Musik, sangtekster, noder, bøger, undertekster, billeder og tekst. Resultaterne er grupperet efter rettighedstype.
0
danske værker dokumenteret i AI-træningsdata
0
danske musiknumre
0
danske bogtitler
0
billeder fra danske domæner
0
danske websider
0
danske film og tv (undertekster)
0
danske sangtekster
0
danske kompositioner
0
danske tale-klip sporet til afsender
0
datasæt gennemgået
Og persondata
Det er ikke kun værker. Helt almindelige danskeres personoplysninger ligger i de samme datasæt.
342 med navn + CPR-nummer
43.228 e-mailadresser
~545.000 telefonnumre
Se hvad jeg fandt →
Opslagsværker og vidensmedier

Beskyttet dansk vidensindhold i træningsdataene

Store danske leksika, opslagsværker, fagmedier og magasiner er ikke bare fanget i Common Crawl. De er bekræftet i FineWeb-2, et faktisk træningsdatasæt der bruges til at træne sprogmodeller. Mange har siden lukket for AI-robotter, men indholdet var allerede høstet.

354.021 sider fanget i Common Crawl, heraf 53.602 dokumenter bekræftet i træningsdatasættet FineWeb-2
KildeI Common Crawl (2019-2022)I FineWeb-2Mønster
Leksika
Den Store Danske (leksikon)20.4114.052Låst for sent
Medicin.dk (monografier)31.131411Låst for sent
Dansk Kvindebiografisk Leksikon1.677351Stadig åben
Dansk Biografisk Leksikon996202Låst for sent
Kulturarv (Weilbach/kunst)13.254197Stadig åben
Bibliotek
Litteratursiden (bibl.)16.7251.805Stadig åben
Forfatterweb (DBC)2.650502Stadig åben
Faktalink (DBC)2.712364Låst for sent
Fagmedier
Ingenioeren11.3863.437Låst for sent
Version2 (tech)14.9943.096Låst for sent
Folkeskolen (fagblad)11.8482.907Stadig åben
videnskab.dk (vidensformidling)9.7442.871Låst for sent
Netdoktor12.1311.416Låst for sent
Illustreret Videnskab2.7601.289Låst for sent
Samvirke (magasin)8.5761.040Stadig åben
Historie-online6.8101.029Stadig åben
Historie (Bonnier)1.411722Låst for sent
Gymnasieskolen1.325716Stadig åben
Uddannelsesguiden5.661687Låst for sent
Religion.dk1.668571Låst for sent
Kristendom.dk2.104472Låst for sent
Danmarkshistorien (AU)8.648286Låst for sent
Kultur og film
Det Danske Filminstitut31.7191.407Stadig åben
Nationalmuseet15.112734Stadig åben
Filmcentralen (DFI)1.768356Stadig åben
Sproget.dk (DSL)3.273346Stadig åben
Magasiner
Se og Hoer (Aller)17.1674.144Låst for sent
Billed-Bladet (Aller)15.7553.833Låst for sent
ALT for damerne (Egmont)13.6622.775Stadig åben
Femina (Aller)11.4901.909Låst for sent
Euroman (Aller)4.8961.183Stadig åben
Bo Bedre (Bonnier)3.6361.159Låst for sent
I Form (Bonnier)5.625946Låst for sent
Sundhed og foreninger
Hjerteforeningen6.238597Stadig åben
Diabetesforeningen3.049436Låst for sent
Kraeftens Bekaempelse6.871352Stadig åben
Gigtforeningen776250Stadig åben
Psykiatrifonden268248Stadig åben
Sport og livsstil
Tipsbladet10.6102.877Stadig åben
Bold.dk (sport)10.6761.033Låst for sent
Valdemarsro (opskrifter)2.808594Stadig åben

Common Crawl-tallene viser unikke sider fanget i råstoffet (status 200) i de angivne perioder. FineWeb-2-tallene viser dokumenter i et faktisk træningsdatasæt, som enhver kan efterprøve på HuggingFace. Antallet er lavere, fordi FineWeb-2 renser og fjerner dubletter, det er netop det der overlever ind i træningen. Offentlige institutioner (fx DFI, Nationalmuseet) indgår fordi deres redaktionelle indhold er ophavsretligt, ikke som påstand om kommercielt misbrug.

Metode

Sådan er tallene fremkommet, og hvordan du efterprøver dem

Metoden er åben. Hvert tal kan genkøres af enhver med de samme kilder. Nedenfor står præcis hvordan, kilde for kilde.

Bøger, ISBN og MD5-hash

Danske ISBN-numre er sammenholdt mod arkiverede, samtidige udgaver af de tre skyggebiblioteker Anthropic, Meta og OpenAI er dokumenteret at have brugt: LibGen (juni 2021, arkiveret på archive.org), PiLiMi og Z-Library (juli 2022, Anna's Archive) samt Books3.

Hver titel er forankret med en kryptografisk MD5-hash, så tilstedeværelsen kan efterprøves fil for fil. Anthropics brug er efterprøvet mod de præcise udgaver (Bartz v. Anthropic). Meta (Kadrey v. Meta) og OpenAI (Authors Guild v. OpenAI) er dokumenteret at have brugt de samme biblioteker.

Web og opslagsværker, Common Crawl og FineWeb-2

For hver kilde er domænet slået op i Common Crawl-indekset for øjebliksbilleder 2019 til 2022 (historisk) og 2026 (nu), filtreret til faktisk hentet indhold (status 200, tekst og html) og talt som unikke URL-adresser.

Tilstedeværelsen er derefter bekræftet i FineWeb-2, et faktisk træningsdatasæt, ved at filtrere på værts-domænet i datasættets url-felt. Denne forespørgsel kan du selv køre på HuggingFace:

datasets-server.huggingface.co/filter?dataset=HuggingFaceFW/fineweb-2
  &config=dan_Latn&split=train&where="url" LIKE '%//denstoredanske.dk/%'

Robots.txt-status er hentet 8. juli 2026 og parset pr. AI-robot (GPTBot, CCBot, ClaudeBot med flere).

Persondata, HPLT og FineWeb-2

Danske personoplysninger er fundet i de åbne træningsdatasæt HPLT og FineWeb-2 ved mønstergenkendelse af navne, CPR-numre, mailadresser og telefonnumre, renset for falske positiver.

Fælles forbehold. Tilstedeværelse i Common Crawl og FineWeb-2 er faktuel og efterprøvbar. At et bestemt kommercielt selskab har trænet på netop en given side er en rimelig slutning, ikke et retsligt bevis pr. side. Den juridiske vurdering ligger hos rettighedshavernes jurister. Data indsamlet juli 2026.

Download kilde-datasættet (JSON)

Musik

Dansk musik i AI-træningsdata

Danske indspilninger i de åbne datasæt, LAION-DISCO-12M, YouTube CC-BY og Free Music Archive.
28.376
danske numre med tydelig dansk tilknytning
Se og søg i musikken
Bøger

Danske bøger i AI-træningsdata

Titler af danske forfattere og bøger udgivet af danske forlag, fundet i Books3, LibGen og Z-Library.
24.792
danske titler fra 376 forlag
Se og søg i bøgerne
Billeder

Danske billeder i AI-træningsdata

Billeder fra danske domæner i LAION og COYO, datasæt bag billed-AI. Søg, og klik ind på et domæne som dr.dk.
4.863.918
danske billeder på 85.732 domæner (LAION og COYO)
Se og søg i billederne
Tekst

Dansk tekst i AI-træningsdata

Danske websider fra nyhedsmedier, forlag og virksomheder i FineWeb-2, et af de største tekstdatasæt til sprogmodeller. Søg dit domæne, fx dr.dk eller din avis.
32.770.791
danske websider på 561.608 domæner (FineWeb-2)
Se og søg i teksten
Undertekster

Danske undertekster i AI-træningsdata

Danske film- og tv-produktioner, hvis danske undertekster ligger i OpenSubtitles, brugt til at træne sprogmodeller. Søg din titel, fx Hævnen.
502
danske film og tv med danske undertekster (OpenSubtitles)
Se og søg i underteksterne
Sangtekster

Danske sangtekster i AI-træningsdata

Sangtekster fra Genius, brugt til at træne sprogmodeller. En anden rettighed end indspilningen, sangskrivere og forlag (Koda). Søg din artist, fx Shu-bi-dua.
25.938
danske sangtekster, heraf 18.507 på dansk (Genius)
Se og søg i sangteksterne
Noder

Danske kompositioner i AI-træningsdata

Danske sange som MIDI-noder i Lakh MIDI Dataset, brugt til AI der selv komponerer. En tredje musikrettighed, kompositionen (Koda). Søg din artist, fx Gasolin.
124
danske kompositioner i 321 MIDI-filer (Lakh MIDI)
Se og søg i kompositionerne
Tale

Danske stemmer i AI-træningsdata

Dansk tale, danske medieklip og kendte danske stemmer i YODAS, VoxLingua107 og VoxCeleb, brugt til talegenkendelse, plus AI-stemmekloner af en dansk artist. Trailere, klip og interviews, ikke hele værker. Søg dit navn eller en sætning.
228
tale-klip sporet til kendt dansk afsender, plus 3 kendte stemmer i VoxCeleb
Se og søg i tale-dataen
Persondata

Danskeres persondata i AI-træningsdata

Navne koblet til CPR-numre, e-mailadresser og telefonnumre, fundet i sprogdatasættet HPLT, der er bygget på Common Crawl.
342
personer med navn og CPR-nummer i samme dokument
Se hvad jeg fandt

Om sitet

Jeg har samlet det i søgbare oversigter for musik, bøger, billeder, tekst, undertekster, sangtekster, noder og tale, hvor du selv kan slå dit navn, dit forlag eller dit selskab op. På hver side står metoden, kilderne og de forbehold, der knytter sig til de enkelte datasæt.

Fælles for samlingerne er, at de i vidt omfang består af ophavsretligt beskyttet materiale, og at rettighedshaverne ikke er blevet spurgt, om deres værker måtte bruges til at træne kunstig intelligens. Om den brug er lovlig, er omstridt og afgøres i øjeblikket i en række retssager. Den præcise vurdering står på hver sektion.

Jeg udvider løbende kortlægningen med flere danske værker, der kan sandsynliggøres eller påvises anvendt i datasæt til træning af kunstig intelligens, og med flere datasæt efterhånden som de bliver tilgængelige og jeg får analyseret dem.