MI Történik?

Mesterséges intelligencia hírek magyarul — naponta frissülve

← Vissza a főoldalra

Kutatók feltörték az AI rejtett érvelési folyamatát

Az AI-laborok az elmúlt években mindent megtettek azért, hogy a nagy nyelvi modellek, mint a ChatGPT, a Claude vagy a Gemini belső gondolkodási folyamatait elrejtsék a kíváncsi szemek elől. A fejlesztők számára kiemelten fontos, hogy a modellek által végzett, lépésről lépésre történő érvelés ne váljon láthatóvá, hiszen ez üzleti titkokat, algoritmusokat és felhasználói adatokat is tartalmazhat. Egy friss kutatás azonban rávilágított arra, hogy ez a gondosan felépített védelmi vonal korántsem olyan áthatolhatatlan, mint azt a fejlesztők remélték. A kutatók egy meglepően egyszerű módszert találtak arra, hogyan lehet feltörni a modellek privát jegyzeteit: kiderült, hogy a titkosított érvelési blokkokat az ugyanattól a szolgáltatótól származó gyengébb, kisebb képességű modellekkel is ki lehet olvastatni.

A probléma gyökere abban rejlik, ahogyan ezek az LLM-ek kezelik a belső munkameneteket. Képzeljük el úgy a folyamatot, mintha egy csúcskategóriás modell, például a Claude Opus, a privát jegyzeteit egy lezárt borítékba tenné, mielőtt az alkalmazásnak elküldené azokat. Bár az alkalmazás technikai szempontból nem tudja elolvasni a tartalmat, a rendszer úgy lett kialakítva, hogy a későbbi munkameneteknél a modell hozzáférhessen saját korábbi gondolataihoz. A kutatók felfedezték, hogy ez a titkosított blokk túlságosan hordozható: ha az alkalmazás ezt a borítékot átadja egy másik modellnek, például a Claude Haiku-nak, az gyakran képes arra, hogy egy jól megfogalmazott jailbreak prompt segítségével felfedje a tartalmat. Így anélkül jutottak hozzá bizalmas adatokhoz, hogy a titkosítási kulcsot ténylegesen ellopták volna.

A felfedezés komoly biztonsági aggályokat vet fel, hiszen a tesztek során több mint 300 ezer vizsgált blokkból százával sikerült kinyerni érzékeny információkat, köztük jelszavakat és API-kulcsokat is. A kockázat azonban túlmutat az adatbiztonságon: a titkosított érvelési nyomok alkalmasak lehetnek az úgynevezett modell-desztillációra is. Ez azt jelenti, hogy a versenytársak a rejtett gondolatmenetek elemzésével képesek lehetnek leutánozni egy erősebb modell képességeit, lényegében ingyen megszerezve azokat a folyamatokat, amelyek kifejlesztése dollármilliókba és hosszú évek munkájába került.

Ez a kutatás rámutat arra, hogy a titkolózás mint biztonsági stratégia új, eddig ismeretlen sebezhetőségeket hozott létre. Ahogy az érvelési blokkok modellek, munkamenetek és felhasználók között utaznak, úgy válnak a biztonsági architektúra leggyengébb láncszemévé. A fejlesztők számára a jövőben elengedhetetlen lesz, hogy ne csak a kimeneti adatokat védjék, hanem azokat a rejtett, belső gondolati szálakat is, amelyek a háttérben futnak. A tanulság egyértelmű: amíg a rendszerek architektúrája megengedi, hogy a különböző modellek egymás titkosított hagyatékához hozzáférjenek, addig a felhasználói adatok és a fejlesztői know-how folyamatos veszélyben maradnak.

Miért fontos?

Those hidden notes could expose user secrets, information intentionally withheld from the final answer, or valuable training data. Competitors could potentially use them for distillation (training a smaller model on a stronger model’s examples) to copy some of its capabilities. This research shows secrecy can create a new security boundary that needs defending, especially when encrypted traces travel between models, sessions, and users.

Eredeti forrás megtekintése (angol) →
Kapcsolódó hírek
A Mistral 3 milliárd eurót gyűjtött be Európa eddigi legnagyobb tech tőkeemelési körében
most
Az AI által tervezett gyógyszer visszafordítja a biológiai öregedési markereket a klinikai vizsgálati alanyoknál
2 órája
A GPT-6 Astra maximális pontszórosra vizsgázott Dél-Korea hírhedten nehéz egyetemi felvételjén
5 órája