A 2022 előtti könyvek felkapott árucikké válnak az AI modellek képzéséhez
Címsor: A 2022 előtti könyvek felkapott árucikké válnak az AI modellek képzéséhez
Furcsa, de egyre gyakoribb jelenségre figyeltek fel a használtkönyv-kereskedők világszerte: robbanásszerűen megnőtt a tömeges könyvrendelések száma. Míg korábban egy-egy antikvárium átlagosan heti tucatnyi könyvet adott el, mostanában van, hogy több százat, vagy akár több ezret is eladnak. A tulajdonosok több jellegzetességet is észleltek a vásárlási szokásokban: a vevők elsősorban 2022 előtt kiadott, alacsony példányszámú könyvekre vadásznak, gyakran különleges, régebbi témájú vagy szokatlan címekkel. Sok kereskedő meggyőződése, hogy AI vállalatok állnak a jelenség mögött, akik ezeket a könyveket gyűjtik be, hogy betanítsák velük nagy nyelvi modelljeiket (LLM). Különösen az Anthropic Project Panama nevű kezdeményezése terelte erre a figyelmet, amely a jelek szerint precedenst teremtett a piacon.
A 2025-ös bírósági beadványokból kiderült, hogy az Anthropic, egy vezető AI startup, Project Panama néven belső programot működtetett, melynek keretében könyvek millióit vásárolta meg és digitalizálta LLM-jeinek tréningjéhez. A folyamat során a könyveket beszkennelték, és gyakran meg is semmisítették. A jogi eljárás során egy bíró nemrég úgy ítélte meg, hogy ez a gyakorlat „fair use”-nak minősül a szerzői jogi törvények értelmében, feltéve, hogy a könyveket legálisan szerezték be. Ez a döntés azért különösen fontos, mert az Anthropic korábban 1,5 milliárd dolláros kártérítési egyezséget fizetett azért, mert kalóz másolatú könyvekkel képezte modelljeit. A mostani ítélet jogi precedenst teremtett, ami felpörgetheti a nyomtatott anyagok gyűjtését az AI-cégek körében.
A 404 Media beszámolója szerint most, hogy van egy egyértelmű jogi precedens, a laborok különösen a 2022 előtt megjelent nyomtatott könyveket keresik, melyek garantáltan mentesek az AI által generált szövegtől. Ez a tényező rendkívül értékessé teszi őket az AI modellek pontosságának és minőségének biztosításában. Bár egyelőre nem tisztázott, hogy a mai tömeges vásárlók közül hányan vannak valóban AI laborok vagy azokat képviselő ügynökök, a piac egyértelműen reagált a jelenségre. Ennek egyik jele, hogy a világ legnagyobb könyvadatbázisa nemrégiben eltávolított egy „Printed Books For Your LLM Dataset Needs” című landing oldalt, jelezve, hogy a cég más irányba kíván fordulni.
Ez a tendencia rávilágít az AI fejlődésének egy kevésbé ismert, de annál alapvetőbb aspektusára: a tréningadatok kritikus szerepére. Ahogy az LLM-ek egyre kifinomultabbá válnak, úgy nő az igény a kiváló minőségű, sokszínű és megbízható adatok iránt. A 2022 előtti nyomtatott könyvek egy olyan kimeríthetetlen forrást jelentenek, amely emberi kreativitás és tudás évszázadait tartalmazza, mentesen a modern, potenciálisan „szennyezett” digitális tartalomtól. Ez a jelenség nem csak a használtkönyv-piacot formálja át, hanem hosszú távon hatással lehet az információhoz való hozzáférésre, a szerzői jogi vitákra és az AI technológia jövőjére is. Ahogy az AI egyre mélyebben behatol életünkbe, az adatok gyűjtésének és feldolgozásának etikai, jogi és gazdasági vonatkozásai egyre égetőbb kérdésekké válnak.