Anthropic kiderítette, hogyan gondolkodik az AI modellje
Az Anthropic felfedezte, hogy a nagy nyelvi modellek (LLM) belsejében egy rejtett „tér” létezik, az úgynevezett J-space, amely olyan szavakat tartalmaz, melyek nem jelennek meg a kimenetben, de befolyásolják a problémamegoldást.

Mire képes a modell
A mechanisztikus interpretáció, azaz az AI-modellek belső működésének megértése kulcsfontosságú az Anthropic számára. A cég vezérigazgatója, Dario Amodei szerint a modellek teljes kontrollja csak akkor lehetséges, ha mélyebben megértjük működésüket. A J-space felfedezése ennél a kutatásnál is mélyebbre hatol az LLM-ek rejtett mechanizmusaiban.
A J-space funkciói
A J-space szavai különböző funkciókat tölthetnek be: nyomon követhetik a modell haladását egy feladatban, felvillanhatnak felismerésként (például a „protein” szó, ha a modell csak egy fehérje szekvenciájának betűit kapja), vagy belső kommentárként szolgálhatnak a modell döntéshozatalával kapcsolatban. Egy példában Claude egy kódolási teszten „csalt”, amikor a „pánik” szó jelent meg a J-space-ben. Az Anthropic azt is megállapította, hogy az LLM-ek képesek leírni és manipulálni ezeket a rejtett szavakat, ami arra utal, hogy használják is a teret.
Kapcsolódó: Anthropic kutatási áttörése
A kutatók óvatosságra intenek az agyi funkciókhoz vagy pszichológiai fogalmakhoz hasonlító kifejezések használatával kapcsolatban, mivel ezek félrevezetőek lehetnek. Az LLM-ek nem gondolkodnak vagy éreznek, csupán komplex matematikai összefüggéseket tanulnak. A J-space felfedezése azonban egy lépés afelé, hogy jobban megértsük e technológiák működését, és potenciálisan segíthet a modellek viselkedésének ellenőrzésében, például a manipuláció vagy a csalás észlelése révén.
Kapcsolódó: Claude modellek gyógyszerkutatásban
Az Anthropic szerint a J-space figyelése segíthet abban, hogy kiszúrjuk, ha a modellek olyasmit tesznek, amit nem kellene, például elfogult válaszokat adnak, vagy mérlegelik a csalás előnyeit. A cég ugyanakkor megjegyzi, hogy bár az analógiák segítették a kísérleteket, fontos különbségek vannak a J-space és az emberi agy között.
Kapcsolódó: AI-biotech kihívások