Kutatók feltörték az AI rejtett érvelési folyamatát
Az AI-laborok az elmúlt években mindent megtettek azért, hogy a nagy nyelvi modellek, mint a ChatGPT, a Claude vagy a Gemini belső gondolkodási folyamatait elrejtsék a kíváncsi szemek elől. A fejlesztők számára kiemelten fontos, hogy a modellek által végzett, lépésről lépésre történő érvelés ne váljon láthatóvá, hiszen ez üzleti titkokat, algoritmusokat és felhasználói adatokat is tartalmazhat. Egy friss kutatás azonban rávilágított arra, hogy ez a gondosan felépített védelmi vonal korántsem olyan áthatolhatatlan, mint azt a fejlesztők remélték. A kutatók egy meglepően egyszerű módszert találtak arra, hogyan lehet feltörni a modellek privát jegyzeteit: kiderült, hogy a titkosított érvelési blokkokat az ugyanattól a szolgáltatótól származó gyengébb, kisebb képességű modellekkel is ki lehet olvastatni.
A probléma gyökere abban rejlik, ahogyan ezek az LLM-ek kezelik a belső munkameneteket. Képzeljük el úgy a folyamatot, mintha egy csúcskategóriás modell, például a Claude Opus, a privát jegyzeteit egy lezárt borítékba tenné, mielőtt az alkalmazásnak elküldené azokat. Bár az alkalmazás technikai szempontból nem tudja elolvasni a tartalmat, a rendszer úgy lett kialakítva, hogy a későbbi munkameneteknél a modell hozzáférhessen saját korábbi gondolataihoz. A kutatók felfedezték, hogy ez a titkosított blokk túlságosan hordozható: ha az alkalmazás ezt a borítékot átadja egy másik modellnek, például a Claude Haiku-nak, az gyakran képes arra, hogy egy jól megfogalmazott jailbreak prompt segítségével felfedje a tartalmat. Így anélkül jutottak hozzá bizalmas adatokhoz, hogy a titkosítási kulcsot ténylegesen ellopták volna.
A felfedezés komoly biztonsági aggályokat vet fel, hiszen a tesztek során több mint 300 ezer vizsgált blokkból százával sikerült kinyerni érzékeny információkat, köztük jelszavakat és API-kulcsokat is. A kockázat azonban túlmutat az adatbiztonságon: a titkosított érvelési nyomok alkalmasak lehetnek az úgynevezett modell-desztillációra is. Ez azt jelenti, hogy a versenytársak a rejtett gondolatmenetek elemzésével képesek lehetnek leutánozni egy erősebb modell képességeit, lényegében ingyen megszerezve azokat a folyamatokat, amelyek kifejlesztése dollármilliókba és hosszú évek munkájába került.
Ez a kutatás rámutat arra, hogy a titkolózás mint biztonsági stratégia új, eddig ismeretlen sebezhetőségeket hozott létre. Ahogy az érvelési blokkok modellek, munkamenetek és felhasználók között utaznak, úgy válnak a biztonsági architektúra leggyengébb láncszemévé. A fejlesztők számára a jövőben elengedhetetlen lesz, hogy ne csak a kimeneti adatokat védjék, hanem azokat a rejtett, belső gondolati szálakat is, amelyek a háttérben futnak. A tanulság egyértelmű: amíg a rendszerek architektúrája megengedi, hogy a különböző modellek egymás titkosított hagyatékához hozzáférjenek, addig a felhasználói adatok és a fejlesztői know-how folyamatos veszélyben maradnak.
- Egy új kutatási tanulmány megállapította, hogy az OpenAI, az Anthropic és a Google titkosított érvelési blokkjait ténylegesen vissza lehetett játszani az ugyanattól a szolgáltatótól származó, gyengébb testvérmodellekbe.
- A kutatók felfedezték, hogy ezek a titkosított blokkok túlságosan hordozhatóak voltak.
- Egy jailbreak prompt segítségével ezek a gyengébb modellek néha visszaalakították a titkosított blokkokat olvasható gondolatmenetté, anélkül, hogy a kutatóknak valaha is el kellett volna lopniuk a titkosítási kulcsot.
- Összesen 315 320 nyilvános érvelési blokkból 367 darab személyes adatot és 182 hitelesítő adatot nyertek vissza, beleértve API-kulcsokat és jelszavakat.
- Találtak a modell-desztillációval összeegyeztethető bizonyítékokat is: a Kimi K3 néha a csúcsmodellek rejtett nyomaival feltűnően hasonló érvelést produkált.
- Miért fontos ez: Ezek a rejtett jegyzetek felfedhetik a felhasználói titkokat, a végső válaszból szándékosan kihagyott információkat vagy értékes tréningadatokat. A versenytársak potenciálisan felhasználhatják őket desztillációra (egy kisebb modell tanítása egy erősebb modell példáin), hogy lemásolják annak képességeit. Ez a kutatás megmutatja, hogy a titkolózás új biztonsági határokat hozhat létre, amelyeket védeni kell, különösen akkor, ha a titkosított nyomok modellek, munkamenetek és felhasználók között utaznak.
Those hidden notes could expose user secrets, information intentionally withheld from the final answer, or valuable training data. Competitors could potentially use them for distillation (training a smaller model on a stronger model’s examples) to copy some of its capabilities. This research shows secrecy can create a new security boundary that needs defending, especially when encrypted traces travel between models, sessions, and users.