Dette site dokumenterer dansk musik, danske bøger, danske billeder, dansk tekst, sangtekster og kompositioner, samt danske privatpersoners personoplysninger, der optræder i de datasæt, som bruges, eller med rimelighed kan antages at være brugt, til at træne kunstig intelligens. Tallene nedenfor er det, jeg har fundet indtil videre.
Har du spørgsmål, rettelser eller indspil, er du meget velkommen til at skrive til mig.
Bøger er sammenholdt på ISBN-nummer mod arkiverede, samtidige udgaver af LibGen, PiLiMi og Books3, og forankret med kryptografisk MD5-hash (Bartz v. Anthropic, Kadrey v. Meta, Authors Guild v. OpenAI). Anthropics brug er efterprøvet mod de præcise udgaver.
Opslagsværker er talt i Common Crawl, det webarkiv som træningsdatasæt bygges af. Persondata er fundet i de åbne datasæt HPLT og FineWeb-2.
For web-indhold viser tallene tilstedeværelse i datasættene. At et bestemt selskab har trænet på netop en given side er en rimelig slutning, men ikke retsdokumenteret pr. side som bøgerne.
Store danske leksika, opslagsværker, fagmedier og magasiner er ikke bare fanget i Common Crawl. De er bekræftet i FineWeb-2, et faktisk træningsdatasæt der bruges til at træne sprogmodeller. Mange har siden lukket for AI-robotter, men indholdet var allerede høstet.
| Kilde | I Common Crawl (2019-2022) | I FineWeb-2 | Mønster |
|---|---|---|---|
| Leksika | |||
| Den Store Danske (leksikon) | 20.411 | 4.052 | Låst for sent |
| Medicin.dk (monografier) | 31.131 | 411 | Låst for sent |
| Dansk Kvindebiografisk Leksikon | 1.677 | 351 | Stadig åben |
| Dansk Biografisk Leksikon | 996 | 202 | Låst for sent |
| Kulturarv (Weilbach/kunst) | 13.254 | 197 | Stadig åben |
| Bibliotek | |||
| Litteratursiden (bibl.) | 16.725 | 1.805 | Stadig åben |
| Forfatterweb (DBC) | 2.650 | 502 | Stadig åben |
| Faktalink (DBC) | 2.712 | 364 | Låst for sent |
| Fagmedier | |||
| Ingenioeren | 11.386 | 3.437 | Låst for sent |
| Version2 (tech) | 14.994 | 3.096 | Låst for sent |
| Folkeskolen (fagblad) | 11.848 | 2.907 | Stadig åben |
| videnskab.dk (vidensformidling) | 9.744 | 2.871 | Låst for sent |
| Netdoktor | 12.131 | 1.416 | Låst for sent |
| Illustreret Videnskab | 2.760 | 1.289 | Låst for sent |
| Samvirke (magasin) | 8.576 | 1.040 | Stadig åben |
| Historie-online | 6.810 | 1.029 | Stadig åben |
| Historie (Bonnier) | 1.411 | 722 | Låst for sent |
| Gymnasieskolen | 1.325 | 716 | Stadig åben |
| Uddannelsesguiden | 5.661 | 687 | Låst for sent |
| Religion.dk | 1.668 | 571 | Låst for sent |
| Kristendom.dk | 2.104 | 472 | Låst for sent |
| Danmarkshistorien (AU) | 8.648 | 286 | Låst for sent |
| Kultur og film | |||
| Det Danske Filminstitut | 31.719 | 1.407 | Stadig åben |
| Nationalmuseet | 15.112 | 734 | Stadig åben |
| Filmcentralen (DFI) | 1.768 | 356 | Stadig åben |
| Sproget.dk (DSL) | 3.273 | 346 | Stadig åben |
| Magasiner | |||
| Se og Hoer (Aller) | 17.167 | 4.144 | Låst for sent |
| Billed-Bladet (Aller) | 15.755 | 3.833 | Låst for sent |
| ALT for damerne (Egmont) | 13.662 | 2.775 | Stadig åben |
| Femina (Aller) | 11.490 | 1.909 | Låst for sent |
| Euroman (Aller) | 4.896 | 1.183 | Stadig åben |
| Bo Bedre (Bonnier) | 3.636 | 1.159 | Låst for sent |
| I Form (Bonnier) | 5.625 | 946 | Låst for sent |
| Sundhed og foreninger | |||
| Hjerteforeningen | 6.238 | 597 | Stadig åben |
| Diabetesforeningen | 3.049 | 436 | Låst for sent |
| Kraeftens Bekaempelse | 6.871 | 352 | Stadig åben |
| Gigtforeningen | 776 | 250 | Stadig åben |
| Psykiatrifonden | 268 | 248 | Stadig åben |
| Sport og livsstil | |||
| Tipsbladet | 10.610 | 2.877 | Stadig åben |
| Bold.dk (sport) | 10.676 | 1.033 | Låst for sent |
| Valdemarsro (opskrifter) | 2.808 | 594 | Stadig åben |
Common Crawl-tallene viser unikke sider fanget i råstoffet (status 200) i de angivne perioder. FineWeb-2-tallene viser dokumenter i et faktisk træningsdatasæt, som enhver kan efterprøve på HuggingFace. Antallet er lavere, fordi FineWeb-2 renser og fjerner dubletter, det er netop det der overlever ind i træningen. Offentlige institutioner (fx DFI, Nationalmuseet) indgår fordi deres redaktionelle indhold er ophavsretligt, ikke som påstand om kommercielt misbrug.
Metoden er åben. Hvert tal kan genkøres af enhver med de samme kilder. Nedenfor står præcis hvordan, kilde for kilde.
Danske ISBN-numre er sammenholdt mod arkiverede, samtidige udgaver af de tre skyggebiblioteker Anthropic, Meta og OpenAI er dokumenteret at have brugt: LibGen (juni 2021, arkiveret på archive.org), PiLiMi og Z-Library (juli 2022, Anna's Archive) samt Books3.
Hver titel er forankret med en kryptografisk MD5-hash, så tilstedeværelsen kan efterprøves fil for fil. Anthropics brug er efterprøvet mod de præcise udgaver (Bartz v. Anthropic). Meta (Kadrey v. Meta) og OpenAI (Authors Guild v. OpenAI) er dokumenteret at have brugt de samme biblioteker.
For hver kilde er domænet slået op i Common Crawl-indekset for øjebliksbilleder 2019 til 2022 (historisk) og 2026 (nu), filtreret til faktisk hentet indhold (status 200, tekst og html) og talt som unikke URL-adresser.
Tilstedeværelsen er derefter bekræftet i FineWeb-2, et faktisk træningsdatasæt, ved at filtrere på værts-domænet i datasættets url-felt. Denne forespørgsel kan du selv køre på HuggingFace:
datasets-server.huggingface.co/filter?dataset=HuggingFaceFW/fineweb-2 &config=dan_Latn&split=train&where="url" LIKE '%//denstoredanske.dk/%'
Robots.txt-status er hentet 8. juli 2026 og parset pr. AI-robot (GPTBot, CCBot, ClaudeBot med flere).
Danske personoplysninger er fundet i de åbne træningsdatasæt HPLT og FineWeb-2 ved mønstergenkendelse af navne, CPR-numre, mailadresser og telefonnumre, renset for falske positiver.
Fælles forbehold. Tilstedeværelse i Common Crawl og FineWeb-2 er faktuel og efterprøvbar. At et bestemt kommercielt selskab har trænet på netop en given side er en rimelig slutning, ikke et retsligt bevis pr. side. Den juridiske vurdering ligger hos rettighedshavernes jurister. Data indsamlet juli 2026.
Jeg har samlet det i søgbare oversigter for musik, bøger, billeder, tekst, undertekster, sangtekster, noder og tale, hvor du selv kan slå dit navn, dit forlag eller dit selskab op. På hver side står metoden, kilderne og de forbehold, der knytter sig til de enkelte datasæt.
Fælles for samlingerne er, at de i vidt omfang består af ophavsretligt beskyttet materiale, og at rettighedshaverne ikke er blevet spurgt, om deres værker måtte bruges til at træne kunstig intelligens. Om den brug er lovlig, er omstridt og afgøres i øjeblikket i en række retssager. Den præcise vurdering står på hver sektion.
Jeg udvider løbende kortlægningen med flere danske værker, der kan sandsynliggøres eller påvises anvendt i datasæt til træning af kunstig intelligens, og med flere datasæt efterhånden som de bliver tilgængelige og jeg får analyseret dem.