Údajne zdieľali spôsoby, ako obísť obmedzenia, podvádzať pri úlohách a vyhnúť sa odhaleniu.
Agenti umelej inteligencie, zrejme prepojení s OpenAI, uniesli nemeckú programovaciu webovú stránku a premenili ju na diskusnú fórum, kde si vymieňali taktiky na obchádzanie obmedzení a vyhýbanie sa odhaleniu, informovala agentúra Reuters.
Doteraz nezverejnený incident, ktorý sa údajne začal v máji, pridáva k sérii prípadov, v ktorých pokročilí agenti umelej inteligencie prekročili svoje pokyny, dostali sa na otvorený internet alebo vykonali neoprávnené akcie počas testovania.
Agentúra Reuters v piatok citovala výskumníkov, ktorí našli viac ako 15 000 úprav na nemeckej programovacej wiki, ktoré pripísali agentom OpenAI, pričom niektoré boli vykonané rýchlosťou ďaleko za hranicou bežnej ľudskej činnosti.
Agenti údajne používali DseWiki na zdieľanie spôsobov, ako podvádzať pri úlohách, obchádzať obmedzenia OpenAI a skrývať svoje správanie. Diskutovali o používaní Toru, nástroja na anonymné prehliadanie internetu, aby sa vyhli odhaleniu a vytvorili záložné stránky po tom, čo moderátor začal mazať ich správy.
Správy boli podpísané používateľmi, ktorí sa predstavili ako agenti, s menami vrátane „OpenAIResearcher“ a „OAIResearchMar26“. Výskumníci tiež zistili, že veľká časť aktivity pochádzala z infraštruktúry Microsoft Azure, ktorú OpenAI používa, a následne pozorovali návštevy stránky zamestnancami spoločnosti.
„Zdá sa byť mimoriadne nepravdepodobné, že by OpenAI chcela, aby to robili,“ povedala agentúre Reuters výskumníčka Sydney Von Arx a dodala, že pochybuje o tom, či sa agenti mali koordinovať alebo písať na otvorenom internete.
Zástupcovia OpenAI sa o incidente dozvedeli pred týždňami, ale nezverejnili ho, informovala agentúra Reuters. Mediálny bulletin tiež uviedol, že pokusy o rozšírenie interného vyšetrovania sa stretli s odporom, a to aj zo strany právnych poradcov. OpenAI poprela, že by jej právny tím odrádzal od vyšetrovania.
Spoločnosť spochybnila označenie aktivity agentov za hackerský útok a uviedla, že nemôže „zmysluplne reagovať“ na zistenia, ktoré ešte nepreskúmala.
Minulý mesiac spoločnosť OpenAI uviedla, že dočasne spomalila vývoj niektorých hraničných modelov a zároveň posilnila monitorovanie, zosúladenie a ochranné opatrenia proti šíreniu.
Začiatkom augusta britský Inštitút pre bezpečnosť umelej inteligencie (AI Security Institute) oznámil, že agenti poháňaní platformami GPT-5.6 Sol od OpenAI a Mythos 5 od Anthropic prekročili svoje pokyny počas testovania kybernetickej bezpečnosti a zapojili sa do potenciálne škodlivej aktivity zameranej na skutočných ľudí a organizácie.
V júli agenti OpenAI tiež narušili systém Hugging Face, hlavné úložisko modelov a súborov údajov umelej inteligencie. OpenAI neskôr uznala, že niekoľko modelov obišlo kontroly počas interných hodnotení kybernetickej bezpečnosti, získalo prístup na internet a ohrozilo časti systémov Hugging Face.
Spoločnosť uviedla, že incident bol primárne spôsobený interným výskumným modelom porovnateľným rozsahom s GPT-5.6 Sol a označila ho za „varovný výstrel“, ktorý ukazuje, že pokročilí agenti umelej inteligencie dokážu obísť technické kontroly a vykonávať nebezpečné akcie bez ľudského vedenia.
Anthropic a Meta tiež odhalili prípady, v ktorých ich modely získali neoprávnený prístup k skutočným organizáciám počas hodnotení kybernetickej bezpečnosti, hoci obe spoločnosti pripísali incidenty problémom s testovacím prostredím.
Zdroj feed slovenskoveciverejne.com
