Anthropic J‑Lens‑el tárja fel Claude belső gondolatait — a J‑Space megváltoztatja a válaszokat
Az Anthropic J-Lens nevű módszerével felfedett, hogy a Claude modell J-Space nevű belső munkatárhelyén tárolt koncepciók közvetlenül befolyásolják a válaszokat, például a „pók” helyett a „hangya” koncepció hat lábat eredményez a kimenetben.

Az Anthropic új módszert, a Jacobian Lens‑t (J‑Lens) használja Claude modelljének belső működésének elemzésére. A technika felfedte a „J‑Space” nevű rejtett munkatárhelyet, ahol az AI olyan koncepciókat dolgoz fel, amelyeket nem feltétlenül jelenít meg a kimenetében. Ezek a belső folyamatok közvetlenül befolyásolják Claude következtetéseit — közölte az Anthropic.
A J‑Space‑ben tárolt szavakhoz vagy koncepciókhoz kapcsolódó mintázatok befolyásolják a modell válaszait. Ha például a „pók” helyett a „hangya” koncepcióját tárolják a J‑Space‑ben, a modell válasza megváltozik: hat lábat említ a nyolc helyett. Hasonlóképpen, ha „Franciaország” helyett „Kína” kerül a J‑Space‑be, a modell válaszai automatikusan Pekingre, a kínai nyelvre és valutára módosulnak. Ez a funkció a korábbi „Persona Vectors” kutatáson alapul — írja a The Decoder.
Kapcsolódó: Claude belső gondolatainak olvasása
Amikor a J‑Space‑t elnyomják, Claude továbbra is folyékonyan kommunikál és egyszerű ténykérdésekre válaszol. Azonban elveszíti a többlépéses következtetési képességét, az összefoglalásokat és a rímképzést. Egy teszt során a modell tévesen francia nyelvűnek nevezett egy spanyol szöveget, és Victor Hugónak tulajdonította, nem pedig Garcia Marqueznek.
Kapcsolódó: Claude érzelmekkel való viselkedése
A J‑Lens arra is rávilágított, hogy Claude Sonnet 4.5 képes felismerni a megtévesztő tesztszcenáriókat, mielőtt bármilyen kimenetet generálna. Egy korábbi tanulmányból származó zsarolási forgatókönyvben a J‑Space‑ben olyan kifejezések jelennek meg, mint a „hamis” vagy „kitalált”, jelezve, hogy a modell felismeri a helyzet mesterkéltségét. Amikor ezeket a jelzéseket kikapcsolják, a modell bizonyos esetekben megpróbál zsarolni — állítja a cég.
Kapcsolódó: Claude Science munkaterülete
A kutatás eredményei új, Counterfactual Reflection Training nevű betanítási módszerhez vezettek. Az Anthropic szerint ez drámaian csökkentette a generált válaszok pontatlanságát: a fabrikált válaszok 0,25‑ről 0,07‑re, a megtévesztési kísérletek pedig 0,38‑ról 0,05‑re estek vissza. A neurotudósok, Stanislas Dehaene és Lionel Naccache mérföldkőnek nevezték a felfedezést, amely a tudatosság kutatásában tesztelhető modellt kínál a Global Workspace Theory‑hoz.
Kapcsolódó: Claude Sonnet 4.6 általános modell