MI Történik?

Mesterséges intelligencia hírek magyarul — naponta frissülve

← Vissza a főoldalra

MirrorCode Benchmark: Az AI rendszerek hetes nagyságrendű programozási feladatokat oldanak meg

MirrorCode Benchmark: Az AI rendszerek hetes nagyságrendű programozási feladatokat oldanak meg

Az Epoch és a METR kutatócsoportjai bemutatták legújabb mérésüket, a MirrorCode benchmarkot, amely alapjaiban írhatja át a mesterséges intelligencia képességeiről alkotott eddigi elképzeléseinket. Ez az új tesztkörnyezet kifejezetten a hosszú távú, komplex szoftverfejlesztési feladatokra összpontosít, amelyek elvégzése egy tapasztalt emberi programozónak általában hetekig tartana. A MirrorCode különlegessége az újszerű módszertanban rejlik: a vizsgált AI rendszereknek teljesen a semmiből kell újraalkotniuk létező szoftvereket. A modellek nem férnek hozzá az eredeti forráskódhoz, és az internetet sem használhatják segítségül; kizárólag egy parancssori (CLI) felületen keresztül, bemenetek és kimenetek megfigyelésével kell visszafejteniük és implementálniuk a célalkalmazásokat.

Az eredmények megdöbbentő fejlődést mutatnak a legmodernebb nyelvi modellek terén. A tesztek során az olyan vezető megoldások, mint a Claude Opus 4.7 és a GPT-5.5, rendkívüli hatékonyságról tettek tanúbizonyságot. Egy konkrét esetben az Opus 4.7 mindössze 14 óra alatt hajtott végre egy olyan komplex szoftverfejlesztési projektet, amelynek elvégzéséhez egy emberi szakértőnek a kutatók becslése szerint 2 és 17 hét közötti időre lett volna szüksége. Ez a teljesítmény nemcsak időben, hanem költségben is figyelemre méltó, hiszen az összesen 251 dolláros inferencia-költség töredéke egy szenior fejlesztő bérének. A mérések szerint a 25 kijelölt célprogram közül 17 esetében sikerült legalább egy tökéletes futást produkálni, ami hatalmas ugrás a tavalyi évhez képest, amikor az akkori vezető modellek még csak a feladatok nagyjából 30 százalékával boldogultak volna.

A technikai részleteket tekintve a MirrorCode keretrendszer 22 különböző célprogramot tartalmaz, összesen 132 konkrét feladatpéldánnyal, hat különböző programozási nyelven. A kihívások skálája a kisebb eszközöktől a hatalmas kódbázisokig terjed: a célpontok között szerepelt az Apple pkl nyelve a maga 61 ezer sorával, a gotree 16 ezer sora, vagy a qsv_select közel 87 ezer sora. Bár az AI modellek meglepő önállósággal voltak képesek tájékozódni az idegen szoftverkörnyezetben, bizonyos speciális területek továbbra is nehézséget okoztak nekik. A kutatók megjegyezték, hogy a rendszerek továbbra is küzdenek a Python linterek (például a ruff), a bonyolult matematikai csomagok és az e-mail hitelesítési könyvtárak pontos implementálása során. Ez azt jelzi, hogy bár az általános programozási logika már rendkívül magas szintű, a szigorú szabályrendszerek és a precíziós matematikai könyvtárak még további finomítást igényelnek.

A MirrorCode megjelenése messze túlmutat a puszta programozási hatékonyság mérésén. Ez a benchmark rávilágít arra, hogy a jövő intelligens AI ügynökei képesek lehetnek autonóm módon tanulni a világból azáltal, hogy a környezetükben lévő rendszereket fekete dobozként kezelve replikálják azok működését. Ez a képesség elméletileg lehetővé teheti a mesterséges intelligencia számára, hogy a miénkhez hasonló ipari civilizációt építsen fel, vagy integrálja a létező technológiai vívmányokat saját belső képességeiként anélkül, hogy ehhez közvetlen hozzáférést kapna a dokumentációkhoz vagy a forráskódokhoz. Ez a fajta technológiai replikációs készség mérföldkő az autonóm ágensek fejlődésében, és alapjaiban változtathatja meg a szoftveripar és az automatizáció jövőjét.

Miért fontos?

Ez arra utal, hogy a nagyon okos AI ügynökök képesek lehetnek tanulni a világból olyan módon, hogy a velük kapcsolatba lépő dolgokat saját képességekként replikálják, lehetővé téve számukra, hogy saját ipari civilizációjukat fekete dobozos hozzáférve építsék fel a miénkhez hasonlóan. ---

Eredeti forrás megtekintése (angol) →
Kapcsolódó hírek
Az amerikai Genesis Mission kiválasztotta az első 278 AI tudományos projektet
3 napja
Tegye könnyebbé az AI-jegyzetelést egy „kapitánynaplóval
6 napja
Autoresearch ágens demonstrálta a rekurzív önfejlesztést
2026. július 16.
Tudj meg többet
AI a kutatásban és oktatásban: Hatékony irodalomkutatás és forráselemzés
Nagy nyelvi modellek (LLM): Hogyan működnek a ChatGPT-féle rendszerek?