MirrorCode Benchmark: Az AI rendszerek hetes nagyságrendű programozási feladatokat oldanak meg
MirrorCode Benchmark: Az AI rendszerek hetes nagyságrendű programozási feladatokat oldanak meg
Az Epoch és a METR kutatócsoportjai bemutatták legújabb mérésüket, a MirrorCode benchmarkot, amely alapjaiban írhatja át a mesterséges intelligencia képességeiről alkotott eddigi elképzeléseinket. Ez az új tesztkörnyezet kifejezetten a hosszú távú, komplex szoftverfejlesztési feladatokra összpontosít, amelyek elvégzése egy tapasztalt emberi programozónak általában hetekig tartana. A MirrorCode különlegessége az újszerű módszertanban rejlik: a vizsgált AI rendszereknek teljesen a semmiből kell újraalkotniuk létező szoftvereket. A modellek nem férnek hozzá az eredeti forráskódhoz, és az internetet sem használhatják segítségül; kizárólag egy parancssori (CLI) felületen keresztül, bemenetek és kimenetek megfigyelésével kell visszafejteniük és implementálniuk a célalkalmazásokat.
Az eredmények megdöbbentő fejlődést mutatnak a legmodernebb nyelvi modellek terén. A tesztek során az olyan vezető megoldások, mint a Claude Opus 4.7 és a GPT-5.5, rendkívüli hatékonyságról tettek tanúbizonyságot. Egy konkrét esetben az Opus 4.7 mindössze 14 óra alatt hajtott végre egy olyan komplex szoftverfejlesztési projektet, amelynek elvégzéséhez egy emberi szakértőnek a kutatók becslése szerint 2 és 17 hét közötti időre lett volna szüksége. Ez a teljesítmény nemcsak időben, hanem költségben is figyelemre méltó, hiszen az összesen 251 dolláros inferencia-költség töredéke egy szenior fejlesztő bérének. A mérések szerint a 25 kijelölt célprogram közül 17 esetében sikerült legalább egy tökéletes futást produkálni, ami hatalmas ugrás a tavalyi évhez képest, amikor az akkori vezető modellek még csak a feladatok nagyjából 30 százalékával boldogultak volna.
A technikai részleteket tekintve a MirrorCode keretrendszer 22 különböző célprogramot tartalmaz, összesen 132 konkrét feladatpéldánnyal, hat különböző programozási nyelven. A kihívások skálája a kisebb eszközöktől a hatalmas kódbázisokig terjed: a célpontok között szerepelt az Apple pkl nyelve a maga 61 ezer sorával, a gotree 16 ezer sora, vagy a qsv_select közel 87 ezer sora. Bár az AI modellek meglepő önállósággal voltak képesek tájékozódni az idegen szoftverkörnyezetben, bizonyos speciális területek továbbra is nehézséget okoztak nekik. A kutatók megjegyezték, hogy a rendszerek továbbra is küzdenek a Python linterek (például a ruff), a bonyolult matematikai csomagok és az e-mail hitelesítési könyvtárak pontos implementálása során. Ez azt jelzi, hogy bár az általános programozási logika már rendkívül magas szintű, a szigorú szabályrendszerek és a precíziós matematikai könyvtárak még további finomítást igényelnek.
A MirrorCode megjelenése messze túlmutat a puszta programozási hatékonyság mérésén. Ez a benchmark rávilágít arra, hogy a jövő intelligens AI ügynökei képesek lehetnek autonóm módon tanulni a világból azáltal, hogy a környezetükben lévő rendszereket fekete dobozként kezelve replikálják azok működését. Ez a képesség elméletileg lehetővé teheti a mesterséges intelligencia számára, hogy a miénkhez hasonló ipari civilizációt építsen fel, vagy integrálja a létező technológiai vívmányokat saját belső képességeiként anélkül, hogy ehhez közvetlen hozzáférést kapna a dokumentációkhoz vagy a forráskódokhoz. Ez a fajta technológiai replikációs készség mérföldkő az autonóm ágensek fejlődésében, és alapjaiban változtathatja meg a szoftveripar és az automatizáció jövőjét.
- A célprogramok között szerepelt az Apple pkl-je (61e sor), a gotree (16e sor) és a qsv_select (87e sor).
- A 25 célpontból 17-nél volt legalább egy tökéletes pontszámú futás.
- Az egy évvel ezelőtti vezető modellek csupán mintegy 30%-ot értek volna el.
- Az AI modellek képesnek bizonyultak arra, hogy önállóan tájékozódjanak egy „idegen” szoftverkörnyezetben, kizárólag a bemeneti-kimeneti hozzáférés alapján.
- A kiadás tartalmaz egy keretrendszert és 22 célprogramot, amelyek összesen 132 feladatpéldányt foglalnak magukban hat nyelven.
Ez arra utal, hogy a nagyon okos AI ügynökök képesek lehetnek tanulni a világból olyan módon, hogy a velük kapcsolatba lépő dolgokat saját képességekként replikálják, lehetővé téve számukra, hogy saját ipari civilizációjukat fekete dobozos hozzáférve építsék fel a miénkhez hasonlóan. ---