Google DeepMind паказала, як ІІ-агент паляпшае ўласную стратэгію пошуку
Даследчыкі з Google DeepMind і амерыканскіх універсітэтаў прадставілі Dream-RSI — сістэму, у якой ІІ-агент паляпшае не вагі мадэлі, а ўласную стратэгію даследавання задач. Яна выкарыстоўвае гісторыю папярэдніх спроб, каб танна правяраць альтэрнатыўныя шляхі пошуку перад наступным раўндам працы.

Схема працуе так: агент вырашае рэальную задачу, а сістэма захоўвае дрэва яго рашэнняў, праверак і вынікаў. Потым Dream-RSI прайгравае гэта дрэва як сімулятар: можна хутка ацаніць тысячы варыянтаў — якія галіны адкрываць, што запускаць паралельна і калі спыняцца — без паўторнага дарагога запуску агента.
Палепшаная стратэгія вяртаецца ў рэальны раўнд пошуку і збірае новую гісторыю. Так утвараецца цыкл: даследаванне, сімуляцыя на сабраным досведзе, абнаўленне стратэгіі, новае даследаванне.
Аўтары праверылі падыход на распрацоўцы алгарытмаў, матэматычнай аптымізацыі і стварэнні GPU-ядраў. У задачы распрацоўкі алгарытму Dream-RSI дасягнула лепшага выніку, скараціўшы колькасць выклікаў агента да 162 разоў у параўнанні з адным з базавых метадаў. У іншых тэстах сістэма або дасягала супастаўнага выніку з меншымі выдаткамі, або паляпшала вынік пры тым жа бюджэце.
Галоўная ідэя тут не ў «самасвядомасці» ІІ, а ў практычнай аптымізацыі: мінулыя памылкі і ўдалыя хады становяцца не проста кантэкстам, а танным палігонам для праверкі наступнай стратэгіі.
Крыніца: arXiv.