Hogyan teszteljük helyesen az AI modelleket a saját feladatainkhoz
A nyilvános benchmarkok félrevezetőek lehetnek; például a GPT-6 Astra pontszáma az ARC-AGI-3 teszten 99,9%-ról 62.7%-ra esett vissza pusztán a modell körüli keretezés (scaffolding) megváltoztatásával. A legjobb megközelítés a felhasználók számára a valós feladatokon alapuló, személyes benchmarkok építése.
- Válassz ki egy valós feladatot (jelentést, táblázatot vagy hibajavítást).
- Futtasd le a feladatot a versengő modelleken egymás mellett.
- Pontozz a helyesség, a szükséges emberi beavatkozás, a sebesség és a költség alapján.
Miért fontos?
Egy olyan modell, amely gyors, de több emberi javítást igényel, kevésbé lehet hatékony, mint egy lassabb modell, amely első próbálkozásra tökéletes eredményt ad.
Kapcsolódó hírek