MI Történik?

Mesterséges intelligencia hírek magyarul — naponta frissülve

← Vissza a főoldalra

A 2022 előtti könyvek felkapott árucikké válnak az AI modellek képzéséhez

Címsor: A 2022 előtti könyvek felkapott árucikké válnak az AI modellek képzéséhez

Furcsa, de egyre gyakoribb jelenségre figyeltek fel a használtkönyv-kereskedők világszerte: robbanásszerűen megnőtt a tömeges könyvrendelések száma. Míg korábban egy-egy antikvárium átlagosan heti tucatnyi könyvet adott el, mostanában van, hogy több százat, vagy akár több ezret is eladnak. A tulajdonosok több jellegzetességet is észleltek a vásárlási szokásokban: a vevők elsősorban 2022 előtt kiadott, alacsony példányszámú könyvekre vadásznak, gyakran különleges, régebbi témájú vagy szokatlan címekkel. Sok kereskedő meggyőződése, hogy AI vállalatok állnak a jelenség mögött, akik ezeket a könyveket gyűjtik be, hogy betanítsák velük nagy nyelvi modelljeiket (LLM). Különösen az Anthropic Project Panama nevű kezdeményezése terelte erre a figyelmet, amely a jelek szerint precedenst teremtett a piacon.

A 2025-ös bírósági beadványokból kiderült, hogy az Anthropic, egy vezető AI startup, Project Panama néven belső programot működtetett, melynek keretében könyvek millióit vásárolta meg és digitalizálta LLM-jeinek tréningjéhez. A folyamat során a könyveket beszkennelték, és gyakran meg is semmisítették. A jogi eljárás során egy bíró nemrég úgy ítélte meg, hogy ez a gyakorlat „fair use”-nak minősül a szerzői jogi törvények értelmében, feltéve, hogy a könyveket legálisan szerezték be. Ez a döntés azért különösen fontos, mert az Anthropic korábban 1,5 milliárd dolláros kártérítési egyezséget fizetett azért, mert kalóz másolatú könyvekkel képezte modelljeit. A mostani ítélet jogi precedenst teremtett, ami felpörgetheti a nyomtatott anyagok gyűjtését az AI-cégek körében.

A 404 Media beszámolója szerint most, hogy van egy egyértelmű jogi precedens, a laborok különösen a 2022 előtt megjelent nyomtatott könyveket keresik, melyek garantáltan mentesek az AI által generált szövegtől. Ez a tényező rendkívül értékessé teszi őket az AI modellek pontosságának és minőségének biztosításában. Bár egyelőre nem tisztázott, hogy a mai tömeges vásárlók közül hányan vannak valóban AI laborok vagy azokat képviselő ügynökök, a piac egyértelműen reagált a jelenségre. Ennek egyik jele, hogy a világ legnagyobb könyvadatbázisa nemrégiben eltávolított egy „Printed Books For Your LLM Dataset Needs” című landing oldalt, jelezve, hogy a cég más irányba kíván fordulni.

Ez a tendencia rávilágít az AI fejlődésének egy kevésbé ismert, de annál alapvetőbb aspektusára: a tréningadatok kritikus szerepére. Ahogy az LLM-ek egyre kifinomultabbá válnak, úgy nő az igény a kiváló minőségű, sokszínű és megbízható adatok iránt. A 2022 előtti nyomtatott könyvek egy olyan kimeríthetetlen forrást jelentenek, amely emberi kreativitás és tudás évszázadait tartalmazza, mentesen a modern, potenciálisan „szennyezett” digitális tartalomtól. Ez a jelenség nem csak a használtkönyv-piacot formálja át, hanem hosszú távon hatással lehet az információhoz való hozzáférésre, a szerzői jogi vitákra és az AI technológia jövőjére is. Ahogy az AI egyre mélyebben behatol életünkbe, az adatok gyűjtésének és feldolgozásának etikai, jogi és gazdasági vonatkozásai egyre égetőbb kérdésekké válnak.

Eredeti forrás megtekintése (angol) →
Kapcsolódó hírek
Heti cél ellenőrző sablon létrehozása ChatGPT-vel
most
Építsen piros/kék/zöld AI felülvizsgálati hurkot a magas tétű kimenetekhez
3 órája
Ultra-realisztikus luxustermék-reklámképek generálása
19 órája
Tudj meg többet
AI modellek finomhangolása és egyedi fejlesztése: Lépj túl a generikus megoldásokon!
Nagy nyelvi modellek (LLM): Hogyan működnek a ChatGPT-féle rendszerek?