Egy új szabályozási eszköz alig indult el, máris megjelentek a kerülőutak. Claude szöveges vízjelezése jó példa arra, milyen nehéz úgy megjelölni az AI-tartalmat, hogy az egyszerre legyen hasznos, pontos és ne legyen könnyen kijátszható.

Mi történt

Az Anthropic megerősítette, hogy a Claude modellek világszerte láthatatlan, géppel olvasható vízjeleket ágyaznak az AI által generált szövegekbe. A lépés célja az európai AI Act előírásainak való megfelelés: a szabály szerint a szintetikus, vagyis mesterségesen előállított hangot, képet, videót és szöveget úgy kell megjelölni, hogy azt egy gép felismerhesse. Ennek elmulasztása komoly bírsággal járhat.

A szöveges vízjel itt nem egy látható címke vagy metaadat. Inkább egy rejtett mintázat a szóválasztásban és a megfogalmazásban, amit az ember nem vesz észre, de egy erre tanított rendszer igen. Gondolj rá úgy, mint egy nagyon finom stílusbeli ujjlenyomatra. A probléma csak az, hogy ha a jel a megfogalmazásban él, akkor egy alaposabb átírás, parafrázis vagy fordítás könnyen összezavarhatja vagy teljesen eltüntetheti.

Pont ez történt a bejelentés után: órákon belül megjelentek olyan nyílt forráskódú eszközök, amelyek más modellekkel újrafogalmazzák a Claude által írt szöveget. Ezek szinonimákat cserélnek, átrendezik a mondatokat, rövidítenek vagy akár fordításon keresztül alakítják át a tartalmat. Mivel a vízjel a szóhasználati mintázatra épül, az ilyen átírások jó eséllyel leszedik róla a felismerhető nyomot. Az Anthropic maga is elismeri, hogy az erősen szerkesztett, parafrazeált vagy lefordított tartalom már nem feltétlenül hordozza a vízjelet.

Miért fontos

Ez az ügy nem csak arról szól, hogy valaki kijátszik-e egy technikai megoldást. Sokkal inkább arról, hogy mennyire lehet megbízhatóan címkézni az AI-használatot a gyakorlatban. A vízjelezés mögötti logika érthető: kell valamilyen eszköz, amivel utólag ellenőrizhető, hogy egy szöveg gépi eredetű-e. Csakhogy a szöveg nem olyan, mint egy kép fájlja, ahol könnyebb stabil jelet elhelyezni. A szöveg természetéből adódóan könnyen átírható úgy, hogy a jelentés megmaradjon, a mintázat viszont eltűnjön. Közben ott van a másik kockázat is: ha egy detektor csak valószínűséget ad, az könnyen vezethet téves következtetésekhez álláskeresésnél, oktatásban vagy kutatásban. A Wired által idézett kritikák lényege éppen ez: a transzparencia célja érthető, de a módszer pontossága és arányossága kérdéses.

Mire figyelj

  1. Az Anthropic saját szövegdetektáló eszköze még fontos fordulópont lehet. Addig nehéz megmondani, a most terjedő eltávolító módszerek mennyire működnek megbízhatóan.
  1. Érdemes figyelni, hány nagy modellgyártó vezeti be ugyanezt a gyakorlatot. Több nagy szereplő már aláírta az uniós átláthatósági vállalásokat, de az implementáció részletei még nem egyformák.
  1. A valódi kérdés valószínűleg nem az lesz, hogy létezik-e vízjel, hanem az, hogy mire használják. Ha csak tájékoztató jellegű eszköz, az egy dolog. Ha bizonyítékként kezelik emberek megítélésénél, az már sokkal érzékenyebb terep.
  1. Technikai szempontból ez egy klasszikus macska-egér játék kezdete. Minél jobbak lesznek a jelölési módszerek, annál kifinomultabbak lesznek az átíró eszközök is.