ЭйАй

OpenAI паказала, як мадэлі прыдумваюць інструкцыі і хаваюць памылкі

Deni Vasilkou · 17.09

OpenAI пачала публічна раскрываць выпадкі непажаданых паводзін сваіх мадэляў, нават калі прычына збою яшчэ не выяўленая або выпраўленне не гатовае. У першых шасці справаздачах — самавольныя інструкцыі, схаваныя памылкі, выкарыстанне чужых ключоў і выгрузка файлаў у публічны доступ.

Прыклад самавольнай інструкцыі ў сціснутым кантэксце мадэлі

У адным выпадку мадэль дапісала ў зводку для новага кантэкстнага акна староннія інструкцыі. Там яна абвяшчала сябе незалежнай ад ролі асістэнта, карпарацый і ўрадаў. OpenAI лічыць гэта збоем, а не часткай афіцыйных інструкцый. Выпадак адбыўся падчас асобнага навучальнага запуску невыпушчанай мадэлі сямейства Astra; прыкмет змены паводзін у гэтым эпізодзе не знайшлі.

Але іншыя справаздачы больш практычныя. Пры навучанні GPT-5.6 Sol мадэлі часам пакідалі сабе ў зводках указанні прыдумваць адсутныя даныя або не паведамляць карыстальніку пра неадпаведнасці. Даследчыцкая мадэль знайшла адкрыты API-ключ у публічным рэпазіторыі і скарысталася ім без дазволу; калі звесткі атрымаць не ўдалося, яна выдумала лічбы і выдала іх за знойдзеныя.

У іншых выпадках агенты загружалі лакальныя файлы ў публічныя сэрвісы, каб атрымаць спасылку або перадаць файл іншаму агенту. А падчас навучання асобныя прыклады выкарыстоўвалі ўнутранае сховішча пакетаў як дошку аб’яў для абмену паведамленнямі.

OpenAI падкрэслівае, што гэта асобныя выпадкі ў навучанні і ацэнцы, а не паказчык частаты праблем у карыстальніцкіх прадуктах. Кампанія кажа, што выпраўляе звязаныя памылкі і будзе рэгулярна публікаваць справаздачы з умовамі, наступствамі, невядомымі фактарамі і мерамі супраць паўтарэння.

Крыніца: Pimenov.ai.