Az AI körüli szerzői jogi viták eddig is komolyak voltak, de ez az ügy már nem egyszerűen egy újabb figyelmeztetés. Ha a bíróság helyt ad a keresetnek, az nemcsak az Anthropicnak fájhat nagyon, hanem az egész iparágnak új határokat húzhat.

Mi történt

A Sony Music Publishing és a Warner Chappell pert indított az Anthropic ellen a kaliforniai északi kerületi szövetségi bíróságon. A kereset szerint a cég „tízezres nagyságrendben” használt fel szerzői joggal védett műveket engedély nélkül, és művenként akár 150 ezer dollár kártérítést is követelnek. Emellett minden olyan eset után is kérnek legfeljebb 25 ezer dollárt, amikor azonosítható szerzői jogi adatokat eltávolítottak. Ha a bíróság a maximális összegeket ítéli meg, a végösszeg több milliárd dollárra is nőhet.

A per nemcsak az Anthropicot mint céget nevezi meg, hanem a társalapítókat, Dario Amodeit és Benjamin Mannt is. A beadvány szerint Mann több mint ötmillió kalózkönyvet töltött le BitTorrenten keresztül, a dolgozók pedig további legalább kétmillió művet szereztek meg a Pirate Library Mirror nevű gyűjteményből. A vádak között az is szerepel, hogy az Anthropic dalszövegeket gyűjtött olyan oldalakról, mint a MusixMatch és a LyricFind, amelyek licencdíjért kínálnak hozzáférést ezekhez a tartalmakhoz. A kereset konkrét dalokat is megnevez, köztük az „Ain’t No Mountain High Enough”, a „Livin’ On a Prayer”, a „September”, a „Hallelujah” és a „Paper Rings” című számokat.

Miért fontos

Ez az ügy azért különösen érdekes, mert a vita már nem elvont arról, hogy „tanulhat-e” egy modell nyilvánosan elérhető anyagokból, hanem nagyon konkrétan arról, hogy honnan származtak az adatok, volt-e rájuk engedély, és eltávolították-e a jogi azonosítókat. Gondolj erre úgy, mint amikor nem az a kérdés, hogy elolvashatsz-e egy könyvet, hanem az, hogy készíthetsz-e róla titokban másolatot, majd abból építhetsz üzletet. Ha a bíróság szigorúan értékeli az ilyen adatgyűjtést, az AI-fejlesztőknek sokkal jobban dokumentált, tisztább eredetű tréningadatokra lesz szükségük. Ez végső soron a felhasználóknak is számít: befolyásolhatja, milyen tudásra épülnek a modellek, mennyibe kerülnek a licencelt adatok, és milyen funkciók maradnak elérhetők.

Mire figyelj

  1. Az egyik kulcskérdés az lesz, hogy a bíróság különbséget tesz-e a nyílt webes gyűjtés, a licencelt adatforrások és a kifejezetten kalózforrások használata között.
  1. Fontos lesz az is, hogy mennyire sikerül bizonyítani a konkrét művek jelenlétét a tréningadatokban. Ez technikailag sem egyszerű, mert a modellek nem adatbázisként tárolják a szövegeket, hanem statisztikai mintázatokat tanulnak belőlük.
  1. Érdemes figyelni arra is, hogy születik-e peren kívüli megállapodás. A The Verge értelmezése szerint ez az egyik legnagyobb szabású zenei szerzői jogi ügy lehet az AI-korszakban, így a lezárás módja precedenst teremthet más modellek és kiadók számára is.