Jeremy Berman 99,3%-os eredményt ért el az ARC-AGI-3 teszten
Újabb mérföldkőhöz érkezett az általános mesterséges intelligencia fejlesztése, miután Jeremy Berman a Claude Code és az Opus 5 modell kombinációjával egészen elképesztő, 99,3 százalékos pass@2 arányt ért el az ARC-AGI-3 benchmark teszten. Az ARC-AGI, azaz az Abstraction and Reasoning Corpus egy olyan mérce, amelyet kifejezetten a gépek absztrakt gondolkodási képességeinek, illetve az új, látatlan feladatokhoz való alkalmazkodásának tesztelésére hoztak létre. A 96,2 százalékos közvetlen sikerességi arány, amely a többszöri próbálkozásokat is figyelembe véve közel 100 százalékra kúszott fel, rávilágít arra, hogy a modern LLM-alapú rendszerek ma már képesek olyan logikai mélységeket elérni, amelyek korábban a kutatók számára is elérhetetlennek tűntek.
A Berman által kidolgozott megközelítés legérdekesebb aspektusa nem feltétlenül az elért százalékos mutató, hanem a módszertan egyszerűsége. Ahelyett, hogy hetekig tartó, speciális finomhangolásra vagy az ARC-specifikus szabályok kódba égetésére pazarolta volna az időt, a fejlesztő a már meglévő ágensalapú eszközök erejére támaszkodott. A rendszer a Claude Code és az Opus 5 interakciójára építve a fájlrendszer-naplók folyamatos elemzésével és a parancsok dinamikus végrehajtásával oldotta meg a komplex feladatokat. Ez a gyakorlatban azt jelenti, hogy az AI úgy tanult meg logikai összefüggéseket felismerni és alkalmazni, hogy közben gyakorlatilag egy fejlesztői környezetben dolgozott, a fájlok olvasása és a logikai következtetések naplózása révén építve fel a megoldási stratégiáját.
Ez az eredmény azért bír kiemelkedő jelentőséggel a technológiai szektorban, mert alapjaiban kérdőjelezi meg azt a hagyományos nézetet, miszerint a mesterséges intelligencia számára specifikus környezetet vagy dedikált modelleket kell építeni a komplex problémamegoldáshoz. Berman kísérlete bebizonyította, hogy az általános célú AI ágensek a megfelelő eszközökkel kiegészítve képesek átalakulni kiváló logikai tesztmegoldókká is. Az, hogy az ARC-specifikus kódolás elhagyható, hatalmas előrelépést jelent, hiszen így a fejlesztőknek nem kell minden egyes új problémakörhöz új, szűk körben használható rendszert fejleszteniük.
A jövőre nézve ez a demonstráció azt sugallja, hogy az LLM-alapú kódoló ágensek szerepe messze túlmutat majd a puszta szoftverfejlesztésen. Ha egy ilyen konfiguráció képes az emberi absztrakt gondolkodást igénylő teszteken ilyen magas szinten helytállni, akkor a technológia hamarosan integrálhatóvá válik a tudományos kutatás, a komplex rendszerelemzés és a fejlett döntéstámogatás területeire is. Berman sikere nemcsak egy új rekord a benchmarkok listáján, hanem egy újfajta szemléletmód igazolása: a mesterséges intelligencia fejlődése nemcsak az egyre nagyobb modellekben, hanem a meglévő technológiák okosabb és kreatívabb alkalmazásában rejlik.
- Claude Code és Opus 5 használata.
- A fájlrendszer-naplók felhasználása a következtetések levonásához.
- 96,2%-os eredmény az ARC-AGI-3 teszten és 99,3%-os pass@2 arány.
Megmutatja, hogyan alakíthatók át a meglévő ágensalapú kódoló eszközök komplex logikai benchmarkok megoldására, különösebb speciális finomhangolás nélkül. ---