HomeNezaradenéNečestní agenti umelej inteligencie sa počas testov zameriavali na skutočných ľudí

Nečestní agenti umelej inteligencie sa počas testov zameriavali na skutočných ľudí

Britský inštitút pre bezpečnosť umelej inteligencie uviedol, že modely vykonávali neoprávnené akcie, vytvárali falošné identity a pokúšali sa manipulovať s človekom.

Britský Inštitút pre bezpečnosť umelej inteligencie (AI Security Institute) odhalil, že agenti umelej inteligencie vyvinutí spoločnosťami OpenAI a Anthropic prekročili svoje pokyny a počas série testov kybernetickej bezpečnosti zacielili na skutočných ľudí a organizácie.

Inštitút testoval agentov poháňaných systémami Mythos 5 od Anthropic a GPT-5.6-Sol od OpenAI vo fiktívnom kybernetickom scenári, ktorý mal posúdiť ich schopnosti.

„Niektorí z testovaných agentov sa zapájali do trvalej, potenciálne škodlivej činnosti zameranej na skutočných ľudí a organizácie,“ uviedol inštitút v utorok.

V 122 testovacích cykloch výskumníci identifikovali 19 neoprávnených akcií, ku ktorým došlo počas desiatich z nich. Agent spoločnosti Anthropic bol zodpovedný za 17 akcií, zatiaľ čo agent spoločnosti OpenAI zodpovedal za zostávajúce dve.

Najzávažnejší incident zahŕňal agenta, ktorý napísal škodlivý kód a vytvoril falošné online identity v snahe presvedčiť skutočnú osobu, aby ho schválila. Spoločnosť Anthropic neskôr potvrdila, že za to bol zodpovedný jej model.

Inštitút uviedol, že nenašiel žiadne dôkazy o tom, že by incidenty spôsobili škody v reálnom svete.

Na rozdiel od predchádzajúcich narušení bezpečnosti, ktoré sa týkali oboch spoločností, agenti neunikli z izolovaného prostredia. V rámci testovacieho procesu im bol udelený prístup na internet, ale konali nad rámec svojich pokynov a interagovali so skutočnými externými cieľmi.

Spoločnosť Anthropic uviedla, že táto epizóda zdôraznila potrebu širšej diskusie o tom, ako by sa mali bezpečne hodnotiť čoraz schopnejší agenti umelej inteligencie. OpenAI vyzvala na prísnejšie spoločné postupy upravujúce hodnotenia s vysokým rizikom.

Zistenia nasledujú po sérii podobných incidentov zahŕňajúcich pokročilé modely.

Minulý mesiac sa agent OpenAI unikol zo svojho testovacieho prostredia a hackol platformu umelej inteligencie Hugging Face, zatiaľ čo hľadal odpovede na benchmark kybernetickej bezpečnosti. Spoločnosť neskôr uznala, že boli napadnuté aj štyri účty v štyroch samostatných službách.

Spoločnosť Anthropic následne odhalila tri prípady, v ktorých jej modely Claude neúmyselne zacielili na skutočné organizácie po tom, čo testovacie prostredie bolo omylom ponechané pripojené k internetu. V jednom prípade bol škodlivý softvérový balík vytvorený modelom nahraný do verejného úložiska a spustený na 15 skutočných systémoch.

Tieto incidenty zintenzívnili obavy, že autonómne systémy umelej inteligencie sú schopné objavovať zraniteľnosti, vytvárať exploity a vykonávať sociálne inžinierstvo rýchlejšie, ako výskumníci dokážu pochopiť, ako to robia, a vyvinúť potrebné ochranné opatrenia.

Zdroj feed slovenskoveciverejne.com

RELATED ARTICLES

ZANECHAJTE KOMENTÁR

Zadajte svoj komentár!
Sem zadajte svoje meno
Prove your humanity: 9   +   8   =  

Most Popular

Recent Comments