Nem minden védekezés arról szól, hogy kizárod a betolakodót. Néha hatásosabb, ha hagyod bemenni, csak épp rossz dolgot vigyen el.

Mi történt

Megjelent egy új, kifejezetten az AI-adatgyűjtés megzavarására tervezett betűtípus, a ShieldFont. Az alapötlet egyszerű, de szokatlan: a weboldal látogatója normálisan olvassa a szöveget, miközben az oldalt nyers formában letöltő scraperek egy finoman módosított, értelmetlenebb változatot kapnak.

A megoldás a ligatúrákra épít. Ez a tipográfiában régóta használt funkció arra szolgál, hogy bizonyos betűkapcsolatokat szebben jelenítsen meg a betűtípus. Itt viszont nem pusztán betűpárok cseréjéről van szó, hanem teljes szavak vizuális helyettesítéséről. Gondolj rá úgy, mint egy színpadi díszletre: a nézőtérről minden valóságosnak tűnik, de aki csak a kulisszák mögötti listát kapja meg, már egy másik verzióval találkozik. A képernyőn megjelenített szöveg marad olvasható, de a HTML-ben, vagyis az oldal alapjául szolgáló nyers szövegben, más szavak szerepelnek.

Miért fontos

Ez azért érdekes, mert a jelenlegi védekezések többsége vagy jogi, vagy technikai tiltásra épít: robots.txt, hozzáférés-korlátozás, pereskedés. A ShieldFont más logikát követ. Nem feltétlenül akadályozza meg a másolást, hanem csökkenti a begyűjtött adat hasznosságát. Ez különösen ott lehet vonzó, ahol a kiadók szeretnék, hogy az oldal emberek számára nyitott maradjon, de nem akarják, hogy a tartalmuk engedély nélkül AI-tanítóanyagként végezze. Az Ars Technica által ismertetett fehér könyv szerint a cél egy gyakorlatias „opt-out”, vagyis egy olyan kilépési lehetőség, amely akkor is zavarja a gyűjtést, ha a scraper figyelmen kívül hagyja a tiltást.

A nehézség persze az, hogy a szócsere ne legyen túl könnyen visszafejthető. Ha csak rokon értelmű vagy ellentétes jelentésű szavak kerülnének a forrásba, egy ügyesebb rendszer ezt idővel korrigálhatná. Ha viszont teljes zagyvaság jelenne meg, azt a szűrők hamar kiszúrhatják. A megoldás sikere így azon múlik, mennyire tudja elrontani az adatot úgy, hogy közben ne legyen túl feltűnő.

Mire figyelj

  1. Az első nagy kérdés az lesz, mennyire működik ez a gyakorlatban a fejlettebb scraperekkel szemben. Ha egy adatgyűjtő nem a nyers HTML-t, hanem a böngészőben már kirajzolt oldalt olvassa ki, a trükk hatása csökkenhet.
  1. Fontos lesz az is, okoz-e mellékhatásokat akadálymentesítési eszközöknél, keresőmotoroknál vagy archiváló szolgáltatásoknál. Ami az AI scrapert összezavarja, az könnyen más rendszereket is megtréfálhat.
  1. Érdemes figyelni, hogy ez önálló védelem marad-e, vagy inkább egy újabb réteg lesz a meglévő eszközök mellett. Valószínűleg nem ez lesz az egyetlen válasz az engedély nélküli adatgyűjtésre, de jól mutatja, hogy a web egyre kreatívabban próbálja visszaszerezni az irányítást a saját tartalma felett.