Mi történt
Az Anthropic megerősítette, hogy a Claude modellek világszerte láthatatlan, géppel olvasható vízjeleket ágyaznak az AI által generált szövegekbe. A lépés célja az európai AI Act előírásainak való megfelelés: a szabály szerint a szintetikus, vagyis mesterségesen előállított hangot, képet, videót és szöveget úgy kell megjelölni, hogy azt egy gép felismerhesse. Ennek elmulasztása komoly bírsággal járhat.A szöveges vízjel itt nem egy látható címke vagy metaadat. Inkább egy rejtett mintázat a szóválasztásban és a megfogalmazásban, amit az ember nem vesz észre, de egy erre tanított rendszer igen. Gondolj rá úgy, mint egy nagyon finom stílusbeli ujjlenyomatra. A probléma csak az, hogy ha a jel a megfogalmazásban él, akkor egy alaposabb átírás, parafrázis vagy fordítás könnyen összezavarhatja vagy teljesen eltüntetheti.
Pont ez történt a bejelentés után: órákon belül megjelentek olyan nyílt forráskódú eszközök, amelyek más modellekkel újrafogalmazzák a Claude által írt szöveget. Ezek szinonimákat cserélnek, átrendezik a mondatokat, rövidítenek vagy akár fordításon keresztül alakítják át a tartalmat. Mivel a vízjel a szóhasználati mintázatra épül, az ilyen átírások jó eséllyel leszedik róla a felismerhető nyomot. Az Anthropic maga is elismeri, hogy az erősen szerkesztett, parafrazeált vagy lefordított tartalom már nem feltétlenül hordozza a vízjelet.
Miért fontos
Ez az ügy nem csak arról szól, hogy valaki kijátszik-e egy technikai megoldást. Sokkal inkább arról, hogy mennyire lehet megbízhatóan címkézni az AI-használatot a gyakorlatban. A vízjelezés mögötti logika érthető: kell valamilyen eszköz, amivel utólag ellenőrizhető, hogy egy szöveg gépi eredetű-e. Csakhogy a szöveg nem olyan, mint egy kép fájlja, ahol könnyebb stabil jelet elhelyezni. A szöveg természetéből adódóan könnyen átírható úgy, hogy a jelentés megmaradjon, a mintázat viszont eltűnjön. Közben ott van a másik kockázat is: ha egy detektor csak valószínűséget ad, az könnyen vezethet téves következtetésekhez álláskeresésnél, oktatásban vagy kutatásban. A Wired által idézett kritikák lényege éppen ez: a transzparencia célja érthető, de a módszer pontossága és arányossága kérdéses.Mire figyelj
- Az Anthropic saját szövegdetektáló eszköze még fontos fordulópont lehet. Addig nehéz megmondani, a most terjedő eltávolító módszerek mennyire működnek megbízhatóan.
- Érdemes figyelni, hány nagy modellgyártó vezeti be ugyanezt a gyakorlatot. Több nagy szereplő már aláírta az uniós átláthatósági vállalásokat, de az implementáció részletei még nem egyformák.
- A valódi kérdés valószínűleg nem az lesz, hogy létezik-e vízjel, hanem az, hogy mire használják. Ha csak tájékoztató jellegű eszköz, az egy dolog. Ha bizonyítékként kezelik emberek megítélésénél, az már sokkal érzékenyebb terep.
- Technikai szempontból ez egy klasszikus macska-egér játék kezdete. Minél jobbak lesznek a jelölési módszerek, annál kifinomultabbak lesznek az átíró eszközök is.
