Google DeepMind és Isomorphic Labs biobiztonsági programot indít az AI visszaélések ellen
A Google DeepMind és az Isomorphic Labs több mint 15 partnerséget épített ki kormányzati szervekkel és biosecurity-szervezetekkel az AI-biztonság javítása érdekében. A program célja, hogy megakadályozza az AI biológiai kutatásokban való visszaéléseit.

A Google DeepMind és az Isomorphic Labs közös biobiztonsági programot indított, amelynek célja az AI biológiai kutatásokban való visszaéléseinek megakadályozása, valamint a járványok gyorsabb reagálásának támogatása. A kezdeményezés, amely csendben indult, mára több mint 15 partnerséget épített ki kormányzati szervekkel, biosecurity szervezetekkel és kutatócsoportokkal az elmúlt 12 hónapban.
A Google DeepMind elismeri, hogy az olyan fejlett modellek, mint a Gemini, egyre részletesebb ismeretekkel rendelkeznek a biológiáról. Ezeknek a rendszereknek a speciális biológiai modellekkel, ügynökökkel és adatbázisokkal való párosítása tovább élesíti ezt a képességet. A tudás azonban kettős élű: míg segítheti a kutatókat a vakcinacélok feltérképezésében, elvileg egy fenyegető szereplő számára is segíthet a hiányosságok pótlásában. A program kettős feladatot lát el: lehetővé teszi a frontier AI által lehetővé tett tudományos előrelépéseket, miközben távol tartja ezeket az eszközöket a visszaélésre képes emberektől.
Kapcsolódó: AI ügynökök irányítási csapdái
A program három pillére
A program három fő pillérre épül: a visszaélések megelőzése, a járványok gyorsabb felismerése és a reagálás egy járvány vagy támadás esetén. Az elmúlt évben kiépített több mint 15 partnerség mindhárom területet érinti. A frissítés korlátozott részleteket tartalmaz a résztvevő szervezetekről, de megemlíti a Lawrence Livermore Nemzeti Laboratóriumot, az Egyesült Királyság AI Biztonsági Intézetét, a CEPI-t és a Francis Crick Intézetet. A DeepMind tervei szerint a következő hat-tizenkét hónapban tovább szélesíti ezeket a kapcsolatokat, különös tekintettel a fenyegetés-intelligenciára, az AI-ügynökök értékelési módszereire és a jailbreak-mitigációkra. A Frontier Model Forummal is együttműködnek a kockázatosabb képzési adatok, például virológiai adatkészletek kezelésének kérdéseiben.
Kapcsolódó: AI biztonsági hátrány
A Gemini lezárása, anélkül, hogy a tudományt blokkolná
A megelőző munka a fenyegetésmodellezésre támaszkodik, amelynek célja azonosítani, hogy mely szereplők kísérelhetik meg leginkább a visszaélést, és milyen jelenlegi korlátok akadályozzák őket. A DeepMind szakértői red-teaming és véletlenszerű kontrollált vizsgálatok kombinációját használja annak megítélésére, hogy a Gemini segíthet-e valakinek ezeken a korlátokon túljutni. Az edzés utáni módszerek célja, hogy megtanítsák a modellt a káros lekérdezések megtagadására, miközben elkerülik a legitim tudományos kérdések túlzott elutasítását. Osztályozókat és szondákat telepítenek a kockázatos tevékenységek valós idejű jelzésére, és a cég célzott naplóelemzést végez a finomabb visszaélési minták felderítésére, amelyeket az automatizált szűrők esetleg elmulaszthatnak. A DeepMind ezeket a mitigációkat folyamatos folyamatként írja le, nem pedig befejezett rendszerként.
Kapcsolódó: AI-transzformáció gyorsítása
A DNS-szintézis szűrési problémája
Az egyik konkrétan vizsgált kockázat a DNS-szintézishez kapcsolódik. A Nemzetközi Génszintézis Konzorciumon belüli vállalatok jelenleg ismert káros kórokozók és toxinok listái ellen szűrik a megrendeléseket. A DeepMind szerint ez a megközelítés kezd gyengülni, mivel az AI képes olyan DNS-szekvenciákat tervezni, amelyek funkciójukban hasonlóak egy veszélyes kórokozóhoz, anélkül, hogy szekvenciájuk pontosan megegyezne a meglévő szűrőket kiváltó mintákkal. A javasolt javítás a DeepMind meglévő vízjellel ellátó rendszeréből, a SynthID-ből merít ihletet, amelyet a cég az AI által generált képek és szövegek jelölésére iparági szabványnak tekint. Ennek biológiai szekvenciákra való adaptálása jelenleg kísérleti munkaként van bemutatva, nem pedig kész termékként. Egy hosszabb távú cél, amelyet nyílt technikai kihívásként írnak le, az olyan szűrés kifejlesztése, amely megjósolja, hogy egy új DNS-szekvencia valószínűleg mérgező vagy patogén-e a funkciója alapján, függetlenül attól, hogy hasonlít-e bármihez a meglévő adatbázisokban.
Kapcsolódó: AI-motor fehérjecélpontokra