Mi történt
A londoni Inherent, amelyet korábbi Google DeepMind-kutatók alapítottak, nyilvánosan is beszélni kezdett arról, min dolgozik. A startup néhány héttel azután, hogy előbújt a „stealth” időszakból és 50 millió dolláros seed befektetést jelentett be, azt közölte: Faraday nevű AI-ügynöke sikeresen reprodukált publikált tudományos eredményeket, és ebben felülmúlta az Anthropic Claude Opus 4.8 és az OpenAI GPT-5.5 teljesítményét.A feladat lényege az volt, hogy az ügynök előre megadott megoldás nélkül próbálja újra előállítani egy kutatási cikk következtetéseit. Ez nem új tudományos felfedezés, inkább annak ellenőrzése, hogy egy eredmény tényleg kijön-e, ha valaki végigcsinálja a munkát. Gondolj rá úgy, mint amikor egy diák nem csak elolvassa a matekpéldát, hanem maga is levezeti. Az Inherent szerint Faraday különlegessége nem csak az eredmény, hanem az is, hogy mindezt egy jóval kisebb alaprendszerre építve érte el: a Qwen 3.6 nevű, 27 milliárd paraméteres modellen fut. A paraméterek nagyjából a modell méretének és tanítási költségének mérőszámai, így ez arra utal, hogy nem feltétlenül csak a nyers méret számít.
A cég nem egyszerű pontosságra hajtott. Azt is nézte, hogy az ügynök mutat-e „research taste”-et, vagyis kutatói ízlést: felismeri-e, melyik kísérlet éri meg, és hogyan érdemes azt felépíteni. Ezt részben megerősítéses tanulással próbálják tanítani. Ez egy olyan módszer, ahol az AI nem részletes szabálykönyvet kap, hanem jutalmat a jó döntésekért — mintha nem lépésről lépésre mondanád meg valakinek, hogyan oldjon meg egy problémát, hanem a jó megoldási irányokat erősítenéd.
Miért fontos
Ez a bejelentés azért érdekes, mert jól mutatja, merre mozdul az AI-verseny a puszta chatbot-funkciókon túl. Egyre kevésbé az a kérdés, hogy egy modell mennyire szépen fogalmaz, és egyre inkább az, hogy tud-e önállóan értelmes munkafolyamatot szervezni, eszközöket használni, és jó kísérleti döntéseket hozni. Az Inherent még nem azt állítja, hogy Faraday új tudományos áttöréseket ér el, de a reprodukció jó tesztterep: a kutatásban ez alapgyakorlat, embereknél is. A TechCrunch értelmezésében befektetői szempontból különösen figyelemre méltó, hogy egy kisebb rendszer próbál versenyképes lenni ott, ahol eddig főleg a legnagyobb modellek domináltak.Mire figyelj
- Érdemes nézni, jönnek-e részletesebb eredmények a mérésről. Egy ilyen állítás súlya nagyban azon múlik, mennyire átlátható a tesztkörnyezet és mennyire ismételhető a teljesítmény.
- Fontos lesz, hogy Faraday mennyire működik más tudományterületeken. Egy szűk feladaton elért jó eredmény még nem jelenti automatikusan, hogy általános kutatóügynökről van szó.
- Az is beszédes, hogy a cég nem akar mindent házon belül megépíteni: például kódolási feladatokra külső eszközt használ. Ez arra utal, hogy a jövő AI-rendszerei inkább jó csapattagok és koordinátorok lehetnek, nem feltétlenül mindenben önellátó mindenesek.
- A vállalati oldal sem mellékes: az Inherent létszámbővítésre készül Londonban, miközben a brit „garden leave” szabályok körüli vita továbbra is befolyásolhatja, milyen gyorsan tudnak tehetségeket megszerezni.
