ЭйАй

Google DeepMind паказала, як ІІ-агент паляпшае ўласную стратэгію пошуку

Deni Vasilkou · 17.09

Даследчыкі з Google DeepMind і амерыканскіх універсітэтаў прадставілі Dream-RSI — сістэму, у якой ІІ-агент паляпшае не вагі мадэлі, а ўласную стратэгію даследавання задач. Яна выкарыстоўвае гісторыю папярэдніх спроб, каб танна правяраць альтэрнатыўныя шляхі пошуку перад наступным раўндам працы.

Анонс даследавання Dream-RSI

Схема працуе так: агент вырашае рэальную задачу, а сістэма захоўвае дрэва яго рашэнняў, праверак і вынікаў. Потым Dream-RSI прайгравае гэта дрэва як сімулятар: можна хутка ацаніць тысячы варыянтаў — якія галіны адкрываць, што запускаць паралельна і калі спыняцца — без паўторнага дарагога запуску агента.

Палепшаная стратэгія вяртаецца ў рэальны раўнд пошуку і збірае новую гісторыю. Так утвараецца цыкл: даследаванне, сімуляцыя на сабраным досведзе, абнаўленне стратэгіі, новае даследаванне.

Аўтары праверылі падыход на распрацоўцы алгарытмаў, матэматычнай аптымізацыі і стварэнні GPU-ядраў. У задачы распрацоўкі алгарытму Dream-RSI дасягнула лепшага выніку, скараціўшы колькасць выклікаў агента да 162 разоў у параўнанні з адным з базавых метадаў. У іншых тэстах сістэма або дасягала супастаўнага выніку з меншымі выдаткамі, або паляпшала вынік пры тым жа бюджэце.

Галоўная ідэя тут не ў «самасвядомасці» ІІ, а ў практычнай аптымізацыі: мінулыя памылкі і ўдалыя хады становяцца не проста кантэкстам, а танным палігонам для праверкі наступнай стратэгіі.

Крыніца: arXiv.