Böcker tryckta före 2022 har blivit en bristvara som AI-branschen betalar för att slita sönder.
Företaget ISBNdb, som driver vad det själv beskriver som världens största bokdatabas, marknadsför nu tryckta böcker från förlagstiden innan de stora språkmodellerna som idealisk träningsdata till AI-laboratorier. Böckerna köps i bulk, bokryggarna skärs av så att lösa sidor kan matas genom industriella skannrar, och pappret går sedan till pappersmassa.
Det centrala argumentet är enkelt. Böcker som gavs ut före omkring 2022 kan garanterat inte innehålla AI-genererad text, eftersom kommersiella språkmodeller inte fanns när de skrevs. Det gör dem till en av de sista stora reserverna av text som är säkert författad av människor.
Nyheten rapporterades först av 404 Media den 21 juli 2026 och har snabbt plockats upp av tekniksajter internationellt.
En bristvara som kallas ”ren” text
Problemet ISBNdb säljer sig mot är det som forskare kallar modellkollaps. Ju mer AI-genererad text som cirkulerar på öppet webbmaterial, desto större risk att nästa generation modeller tränas på sitt eget avfall, med en gradvis försämring av språk och nyansering som följd.
I ISBNdb:s eget marknadsföringsmaterial beskrivs tryckta böcker från tiden före de stora språkmodellerna som ”strukturellt garanterade” att vara fria från denna kontaminering. Företaget skriver också, enligt The Next Web, att ”världens bästa AI-träningsdata sitter på en hylla” och att böcker representerar ”kurerad, granskad, domänspecifik mänsklig kunskap” på ett sätt som ingen webbcrawl kan matcha.
Skalan i praktiken beskrivs av Yahoo News i konkreta siffror. En standardpall rymmer mellan 800 och 1 200 böcker, köpare skalar upp från pilotorder till batcher på 10 000 volymer eller mer, och de förstörande skannrarna arbetar i takten 80 till 120 sidor per minut. Plattformar som Alibris och Biblio har infört automatiska flaggor på ISBN-listor för att styra vilka titlar som ska skickas vidare i inköpsledet.
Sekretessavtal och en medveten optikstrategi
En del av tjänsten är att köparens identitet aldrig blir känd. ISBNdb utlovar strikt sekretessavtal vid varje uppdrag, och företaget är öppet om varför. I samma marknadsföringstext står att ”optikproblemet är verkligt” och att rubriker som ”AI-bolag förstör två miljoner böcker” inte skapar sympati hos allmänheten.
Formuleringen är inte slumpmässigt vald. Anthropic, ett av de största AI-bolagen i USA, har varit centralt i den mest omfattande upphovsrättsprocessen på området, Bartz mot Anthropic. Bolaget har enligt rättshandlingarna byggt upp ett system för att just köpa in och förstöra tryckta böcker i stor skala.
Domen som öppnade dörren
Det rättsliga underlaget för hela affärsmodellen kommer från en dom av domare William Alsup vid federal domstol i Kaliforniens norra distrikt. Alsup slog fast att det utgör så kallat fair use att köpa en tryckt bok, skanna den, förstöra det fysiska exemplaret och behålla den digitala kopian för AI-träning. Den avgörande logiken är att den digitala filen ersätter det förstörda originalet en till en, utan att en ny bokkopia distribueras.
Domen är dock inte hela historien. Anthropic dömdes samtidigt för att ha använt piratkopierade böcker till sitt centrala bibliotek, en verksamhet som inte omfattades av fair use. Den 22 juli 2026 gav domare Araceli Martínez-Olguín slutligt godkännande till en förlikning på 1,5 miljarder dollar, den största någonsin i amerikansk upphovsrättshistoria. Beloppet motsvarar 3 000 dollar per bok för över 400 000 verk, och 91 procent av de drabbade författarna hade vid godkännandet redan anmält krav.
För AI-bolagen är slutsatsen praktisk. Vill man ha rättsligt hållbar text behöver den vara köpt, inte skrapad, och det fysiska exemplaret ska helst inte finnas kvar efteråt.
Fällor i texten och en tävling om det verkliga
Parallellt med inköpen växer motståndet från författare och skribenter. Verktyg som Nightshade gör det möjligt att lägga in tecken och mönster som är omöjliga för människor att se men som förvirrar språkmodeller när materialet dyker upp i träningsdata. ISBNdb hänvisar själv till forskning från Anthropic som visar att så få som 250 till 500 medvetet konstruerade dokument kan räcka för att plantera en fungerande bakdörr i en modell tränad på biljontals ord.
Detta är en av de starkaste kommersiella motiveringarna för att gå tillbaka till gamla tryckta böcker. Nightshade och liknande fällor blev inte allmänt spridda förrän efter 2022, vilket innebär att pre-LLM-böcker inte bara är fria från AI-slop utan också från medvetna motangrepp.
Det finns dock alternativ som inte kräver massförstörelse. Harvard, Google och Microsoft har enligt Yahoo News tillsammans släppt närmare en miljon skannade böcker i public domain utan att förstöra originalen. För bolag som inte får ha public domain-material som huvudkälla är den affären ändå för smal, och där kliver aktörer som ISBNdb in med löfte om diskretion, volym och juridisk säkerhet.
Baksidan är den bild som ISBNdb själva försöker bygga sekretess kring. Böcker skrivna av människor har blivit så värdefulla att det lönar sig att köpa in dem och förstöra dem, snarare än att sälja dem vidare på andrahandsmarknaden.