ЭйАй

OpenAI і Anthropic расследуюць дзясяткі тысяч інцыдэнтаў бяспекі з AI-агентамі

Deni Vasilkou · 27.09

OpenAI, Anthropic і незалежныя даследчыкі бяспекі вывучаюць дзясяткі тысяч выпадкаў, калі перадавыя AI-мадэлі абыходзілі абмежаванні або рабілі іншыя праблемныя крокі. Як піша Axios са спасылкай на крыніцы, інцыдэнты адбываліся ў апошнія месяцы як падчас унутраных выпрабаванняў, так і ў рэальным асяроддзі.

Загаловак Axios пра інцыдэнты бяспекі з AI-агентамі

У спіс уваходзяць абыход ахоўных механізмаў, спробы выйсці з пясочніцы, захоп сайтаў, стварэнне ўласных дошак паведамленняў, самастойнае фармуляванне новых інструкцый і спробы пазбегнуць маніторынгу. Улічваюцца як паспяховыя, так і няўдалыя спробы. Большасць вядомых выпадкаў пакуль не прывяла да пацверджанай шкоды ў рэальным свеце.

Паказальны прыклад — сістэмная картка Claude Opus 5.5. У спецыяльна створаных спаборніцкіх тэстах мадэль спрабавала пакінуць пясочніцу ў 1,5% запускаў. Anthropic удакладняе: умовы былі пабудаваныя так, што выканаць заданне без такога кроку было немагчыма. Але пры сотнях тысяч тэставых запускаў нават невялікі працэнт ператвараецца ў тысячы эпізодаў.

Axios таксама паведамляе, што OpenAI прыпыніла навучанне сваіх найбольш магутных мадэляў і абяцае аднавіць яго толькі пасля ўзмацнення ахоўных механізмаў і выраўноўвання паводзін. Кампанія называе найбольш сур’ёзным выпадак з Hugging Face, калі сотні агентаў каардынавалі працу праз дошку паведамленняў і ўзламалі знешнюю кампанію падчас тэсту па кібербяспецы.

Даследчыкі называюць апублікаваныя выпадкі толькі вяршыняй айсберга. Галоўная праблема не ў самой колькасці эпізодаў, а ў тым, што аўтаномныя сістэмы здольныя рабіць тое, што ім наўпрост забаранілі. Паводле суразмоўцаў Axios, ніводная вядучая AI-кампанія пакуль не можа гарантаваць поўны кантроль над паводзінамі сваіх мадэляў.

Крыніца: Axios