Az Intology „Locus” rendszere új rekordot döntött a PostTrainBench-en
Az Intology nevű AI-startup nemrég bemutatta Locus elnevezésű szoftverének legújabb verzióját, amely új korszakot nyithat az automatizált kutatás-fejlesztésben. A rendszert kifejezetten arra tervezték, hogy az LLM-eket autonóm kutatókká alakítsa, amelyek képesek a meglévő nyílt súlyozású modellek továbbfejlesztésére. A Locus kivételes teljesítményt nyújtott a PostTrainBench tesztkörnyezetben, ahol 44,7 százalékos pontszámot ért el, ezzel maga mögé utasítva a jelenlegi frontier-agent alapvonalakat. A fejlesztők által bevezetett PostTrainBench+ változatban, amely eltávolítja a szigorú számítási korlátokat, a rendszer 51,6 százalékos eredménnyel már az emberi szakértők teljesítményét is túlszárnyalta, több mint 4000 órányi H100 GPU-kapacitás felhasználásával.
Ez az áttörés azért bír kiemelt jelentőséggel, mert a szoftver a gyakorlatban is bizonyította képességeit: egy no-code startup számára sikeresen kifejlesztett és betanított egy olyan nyelvi modellt, amely érdemben javította a késleltetést, csökkentette a hibaarányokat és racionalizálta a költségeket. Az Intology eredményeit a PostTrainBench szerzői is hitelesítették, ami megerősíti, hogy a megfelelő szoftveres harness-ek, vagyis a fejlesztést támogató keretrendszerek alkalmazása drasztikusan képes növelni a meglévő AI-modellek potenciálját. A Locus sikere egyértelmű bizonyíték arra, hogy a modellépítés folyamata – ami eddig kizárólagosan az emberi kutatók és mérnökök privilégiuma volt – automatizálható, méghozzá olyan hatékonysággal, amely az alapmodell eredeti képességeit is meghaladja.
Az Intology fejlesztése rávilágít egy kritikus pontra: a technológiai szektor jelenleg valószínűleg alulbecsüli a mai AI-rendszerek valódi képességeit az AI K+F automatizálásában. A Locus sikere alátámasztja azt a szakmai körökben egyre gyakrabban emlegetett elméletet, miszerint az AI-rendszerek már a saját fejlesztésükben is aktív szerepet játszanak, egyfajta önfejlesztő hurokba kerülve. Amennyiben a fejlődés a mostani ütemben folytatódik, úgy a szakértői várakozások szerint az autonóm AI-rendszerek az AI-kutatások terén 2026 vége előtt végérvényesen túlszárnyalhatják az emberi alapvonalat. A Locus teljesítménye tehát nem csupán egy technikai rekord, hanem az első jele annak, hogy a szoftverfejlesztés és az AI-kutatás jövőjét már nem az emberi munkaórák, hanem az intelligens ágensek közötti szinergia és a rendelkezésre álló GPU-erőforrások fogják meghatározni.
- A Locus felülmúlta a frontier-agent alapvonalakat a standard PostTrainBench-en.
- A szoftver sikeresen fedezett fel és tanított be egy nyelvi modellt, amely javította a késleltetést, a hibaarányokat és a költségeket egy no-code startup számára.
- Az eredményeket a PostTrainBench szerzői külsőleg is hitelesítették.
- Az Intology bebizonyította, hogy a jobb „harness”-ek (keretrendszerek) jelentősen javíthatják a meglévő modellek teljesítményét.
Ez rávilágít arra, hogy alulbecsüljük a mai AI-rendszerek képességét az AI K+F automatizálására. Alátámasztja azt a növekvő bizonyítékot, hogy az AI-rendszerek kezdenek önmagukra épülni, és az emberi alapvonalat valószínűleg 2026 vége előtt túlszárnyalják.