Nem az a legérdekesebb kérdés, hogy egy új AI-modell okosabb lesz-e, hanem az, hogy közben mennyire marad ellenőrizhető. Az OpenAI közelgő Astra modellje körül most épp azért nő a feszültség, mert egy olyan módszert vethet be, amelyből kevesebb látható nyom marad.

Mi történt

Az Astra egy „recurrent depth” nevű technikát használhat, amit „opaque recurrence”-ként is emlegetnek. Egyszerűbben: a modell nem feltétlenül lépésről lépésre, egy jól követhető sorban dolgozza fel a feladatot, hanem ugyanazt a kérdést több körben, ciklikusan futtatja át magán. Gondolj rá úgy, mint amikor valaki nem hangosan, pontról pontra magyarázza el a megoldást, hanem fejben többször átpörgeti ugyanazt a problémát, és végül csak a kész választ mondja ki.

Ez azért váltott ki aggodalmat, mert a mai „reasoning” modelleknél a chain of thought — vagyis a modell látható gondolatmenete — fontos ellenőrzési eszköz. Bár ez sem tökéletes tükre annak, ami a modellben történik, mégis segít megérteni, miért adott egy választ, vagy miért viselkedett hibásan. Ha a modell egyre több belső lépést végez úgy, hogy abból kevesebb olvasható nyom marad, akkor nehezebb lehet kiszúrni a félrecsúszásokat, a szabálykerülést vagy a nem kívánt viselkedést.

A helyzetet árnyalja, hogy az Astra esetében a technika használata egyelőre korlátozottnak tűnik. A modell gondolatmenete várhatóan továbbra is olvasható marad, és az OpenAI vezető kutatói is azt hangsúlyozták, hogy továbbra is cél a monitorozható, ember számára értelmezhető reasoning fenntartása. A vita így nem arról szól, hogy az Astra már most „fekete dobozzá” vált volna, hanem inkább arról, milyen irányba nyithat ajtót ez a fejlesztési vonal.

Miért fontos

Ez a kérdés túlmutat egyetlen modellen. Az AI-biztonságban az egyik alapvető probléma nem csak az, hogy mit tud egy rendszer, hanem az is, hogy mennyire látunk bele a működésébe. Ha egy modell belső gondolkodása egyre inkább rejtett, úgynevezett látens térben zajlik — vagyis olyan belső reprezentációkban, amelyeket az ember már nem tud könnyen értelmezni —, akkor a felügyelet is gyengülhet. TechCrunch által idézett biztonsági kutatók attól tartanak, hogy ha ez iparági trenddé válik, a laborok könnyen olyan versenybe csúszhatnak, ahol a jobb teljesítményért cserébe egyre kevesebb marad a látható ellenőrzési pontokból.

Mire figyelj

  1. Az egyik kulcskérdés az lesz, hogy az Astra gyakorlatban mennyire őrzi meg az olvasható gondolatmenetet, és ez mennyire ellenőrizhető függetlenül is.
  2. Érdemes figyelni, hogy az OpenAI milyen konkrét monitorozási rendszereket épít a chain of thought köré, nem csak elvi szinten, hanem termék- és kutatási gyakorlatban is.
  3. Fontos jelzés lehet, ha más nagy laborok is szélesebb körben kezdenek hasonló technikákat használni, mert akkor ez már nem egyedi kísérlet, hanem iparági irányváltás lenne.
  4. A következő vita valószínűleg nem technikai, hanem szabályozási lesz: hol húzódik az a határ, ahol a nagyobb teljesítmény már túl sok átláthatóságot áldoz fel.