MI Történik?

Mesterséges intelligencia hírek magyarul — naponta frissülve

← Vissza a főoldalra

Jeremy Berman 99,3%-os eredményt ért el az ARC-AGI-3 teszten

Újabb mérföldkőhöz érkezett az általános mesterséges intelligencia fejlesztése, miután Jeremy Berman a Claude Code és az Opus 5 modell kombinációjával egészen elképesztő, 99,3 százalékos pass@2 arányt ért el az ARC-AGI-3 benchmark teszten. Az ARC-AGI, azaz az Abstraction and Reasoning Corpus egy olyan mérce, amelyet kifejezetten a gépek absztrakt gondolkodási képességeinek, illetve az új, látatlan feladatokhoz való alkalmazkodásának tesztelésére hoztak létre. A 96,2 százalékos közvetlen sikerességi arány, amely a többszöri próbálkozásokat is figyelembe véve közel 100 százalékra kúszott fel, rávilágít arra, hogy a modern LLM-alapú rendszerek ma már képesek olyan logikai mélységeket elérni, amelyek korábban a kutatók számára is elérhetetlennek tűntek.

A Berman által kidolgozott megközelítés legérdekesebb aspektusa nem feltétlenül az elért százalékos mutató, hanem a módszertan egyszerűsége. Ahelyett, hogy hetekig tartó, speciális finomhangolásra vagy az ARC-specifikus szabályok kódba égetésére pazarolta volna az időt, a fejlesztő a már meglévő ágensalapú eszközök erejére támaszkodott. A rendszer a Claude Code és az Opus 5 interakciójára építve a fájlrendszer-naplók folyamatos elemzésével és a parancsok dinamikus végrehajtásával oldotta meg a komplex feladatokat. Ez a gyakorlatban azt jelenti, hogy az AI úgy tanult meg logikai összefüggéseket felismerni és alkalmazni, hogy közben gyakorlatilag egy fejlesztői környezetben dolgozott, a fájlok olvasása és a logikai következtetések naplózása révén építve fel a megoldási stratégiáját.

Ez az eredmény azért bír kiemelkedő jelentőséggel a technológiai szektorban, mert alapjaiban kérdőjelezi meg azt a hagyományos nézetet, miszerint a mesterséges intelligencia számára specifikus környezetet vagy dedikált modelleket kell építeni a komplex problémamegoldáshoz. Berman kísérlete bebizonyította, hogy az általános célú AI ágensek a megfelelő eszközökkel kiegészítve képesek átalakulni kiváló logikai tesztmegoldókká is. Az, hogy az ARC-specifikus kódolás elhagyható, hatalmas előrelépést jelent, hiszen így a fejlesztőknek nem kell minden egyes új problémakörhöz új, szűk körben használható rendszert fejleszteniük.

A jövőre nézve ez a demonstráció azt sugallja, hogy az LLM-alapú kódoló ágensek szerepe messze túlmutat majd a puszta szoftverfejlesztésen. Ha egy ilyen konfiguráció képes az emberi absztrakt gondolkodást igénylő teszteken ilyen magas szinten helytállni, akkor a technológia hamarosan integrálhatóvá válik a tudományos kutatás, a komplex rendszerelemzés és a fejlett döntéstámogatás területeire is. Berman sikere nemcsak egy új rekord a benchmarkok listáján, hanem egy újfajta szemléletmód igazolása: a mesterséges intelligencia fejlődése nemcsak az egyre nagyobb modellekben, hanem a meglévő technológiák okosabb és kreatívabb alkalmazásában rejlik.

Miért fontos?

Megmutatja, hogyan alakíthatók át a meglévő ágensalapú kódoló eszközök komplex logikai benchmarkok megoldására, különösebb speciális finomhangolás nélkül. ---

Eredeti forrás megtekintése (angol) →
Kapcsolódó hírek
Az OpenAI elindította a LifeSciBench-et az élettudományi AI-kutatásokhoz
2026. június 18.
A Z.ai bemutatta a GLM-5.2-t, 1 millió tokenes kontextusablakkal
2026. június 18.
Bemutatkozik a text-to-lottie nyílt forráskódú animációs eszköz
2026. június 9.