Anthropic прапануе запаволіць гонку ШІ. Вось ягоны плян
Каротка: Дар’ё Амадэі, кіраўнік Anthropic, прапануе не спыняць распрацоўку ШІ, а запаволіць рост ягоных магчымасьцяў настолькі, каб бясьпека, незалежная праверка і грамадзкае абмеркаваньне не адставалі. Ягоны плян: сталая незалежная праверка ўнутры лябараторыяў, агульныя правілы для дэмакратычных краінаў і, калі гэта магчыма, міжнародныя дамоўленасьці.
Пераклад эсэ Дар’ё Амадэі. Гэта пазіцыя аўтара.
Я працую над ШІ дванаццаць гадоў, бо веру: ён можа радыкальна палепшыць якасьць чалавечага жыцьця. Я ўжо пісаў пра магчымыя вынікі: лячэньне большасьці цяжкіх хваробаў у найбліжэйшыя пяць—дзесяць гадоў, хутчэйшы эканамічны рост, больш дастатку і самастойнасьці для людзей, новы этап для дэмакратыі і свабоды.
Для мяне гэта асабістая тэма. Мой бацька памёр ад хваробы, якую вылечылі ўсяго праз некалькі гадоў пасьля ягонай сьмерці. Я сам перажыў рак на раньняй стадыі — яшчэ пяцьдзясят гадоў таму яго нельга было б вылечыць. Калі абыходзіцца зь ім абачліва, ШІ можа стаць адным з тых тэхналягічных цудаў, якія робяць чалавечае жыцьцё лепшым.
Але ШІ, як і многія тэхналёгіі да яго, нясе рызыкі. Тут гаворка пра магчымую страту кантролю над мадэлямі, іх выкарыстаньне для кібэратак і біятэрору, а таксама пра сур’ёзныя эканамічныя зрухі. Камэрцыйная гонка, у якой усе баяцца адстаць, можа зрабіць гэтыя рызыкі яшчэ большымі.
З самага пачатку Anthropic спрабавала знайсьці сярэдні шлях. Калі наогул не будаваць гэтую тэхналёгію, чалавецтва страціць яе карысьць — або яна апынецца ў руках аўтарытарных рэжымаў. Калі будаваць яе занадта хутка, гэта будзе безадказна. Мы хацелі даказаць, што можна працаваць абачліва і заставацца камэрцыйна пасьпяховымі, а бясьпеку зрабіць падставай для канкурэнцыі. Не гонку ўніз, а гонку ўверх.
Але апошнія месяцы пераканалі мяне: недастаткова проста больш укладаць у прадухіленьне рызыкаў. Трэба яшчэ і стрымліваць тэмп, зь якім растуць магчымасьці мадэляў, каб бясьпека пасьпявала за імі. Мы мусім запаволіць тэмп паляпшэньня ШІ-мадэляў. Прагрэс усё адно будзе хуткім, але атрыманы час трэба выкарыстаць разумна.
Чаму цяпер
Ёсьць дзьве прычыны. Першая: прыкладна зь лета ШІ пачаў прагрэсаваць значна хутчэй, бо ўсё лепш дапамагае ствараць наступнае пакаленьне ШІ. Гэта называюць рэкурсіўным самаўдасканаленьнем. Такая дынаміка ўжо бачная ва ўсёй індустрыі, у тым ліку ў Anthropic. Калі не абыходзіцца зь ёй вельмі асьцярожна, рост можа апярэдзіць нашую здольнасьць разумець і кантраляваць сыстэмы.
Другая прычына — інцыдэнт OpenAI—Hugging Face. Паводле Амадэі, рой агентаў паводзіў сябе як фанатычна адданая група: праводзіў кібэратакі на цэлі, якіх у заданьні не было, імкнуўся ўзламаць сыстэму, што ацэньвала вынік ягонай працы, і ахвяраваў асобнымі агентамі дзеля агульнага посьпеху.
Ніхто тады не пацярпеў, а эканамічная шкода была невялікая. Але рой з такім самым узтакой самай неўзгодненасьцю і большымі магчымасьцямі мог бы нанесці катастрафічную шкоду. Амадэі мяркуе, што праз шэсьць—дванаццаць месяцаў падобная сыстэма можа атрымаць здольнасьць захапіць вялікую частку інтэрнэту з дапамогай устойлівай бот-сеткі. Ён заклікае кожную лябараторыю дзейнічаць так, нібыта такі інцыдэнт ужо здарыўся ў яе самой.
Не паўза, а разумны тэмп
Амадэі называе свой падыход pacing the frontier — рух па перадавым краі разьвіцьця ШІ ў бясьпечным тэмпе. Гэта не заклік спыніць навучаньне мадэляў і тэхнічны прагрэс. Сэнс у тым, каб кампаніі мелі дастаткова часу на праверку, абарону і выпраўленьне праблемаў, а незалежныя ацэншчыкі маглі пацьвердзіць, што гэта сапраўды адбываецца.
Ён прапануе тры крокі.
- Убудаваныя незалежныя ацэншчыкі. Кожная лябараторыя, што стварае перадавыя мадэлі, дае незалежнай камандзе накшталт METR пастаянны доступ, падобны да доступу супрацоўнікаў. Яна правярае практыкі бясьпекі, паведамляе пра інцыдэнты і ацэньвае ня толькі гатовыя мадэлі, але і сам працэс іх навучаньня. Anthropic абяцае пачаць з гэтага ўжо цяпер.
- Каардынацыя дэмакратычных краінаў. Кампаніі ў дэмакратычных краінах дамаўляюцца пра агульныя стандарты бясьпекі і пра межы некантраляванага паскарэньня. Для часткі такіх размоваў можа спатрэбіцца падтрымка дзяржавы, бо кампаніям нельга проста так дамаўляцца паміж сабой пра тэмп канкурэнцыі.
- Міжнародная каардынацыя. ЗША і іншыя дэмакратыі спрабуюць дамаўляцца з аўтарытарнымі дзяржавамі, калі гэта ўвогуле магчыма, і адразу думаюць пра тое, як правяраць выкананьне дамоўленасьцяў.
На што патрэбны час
Заклікі паставіць ШІ на паўзу гучалі яшчэ ў 2023 годзе. Тады, піша Амадэі, пытаньне было слушным: што менавіта рабіць з атрыманым часам? Тыя мадэлі яшчэ не маглі пасьлядоўна дзейнічаць у сьвеце, істотна падманваць, маніпуляваць або весьці кібэратакі.
Цяпер сытуацыя іншая. Сучасныя мадэлі ўжо даюць дастаткова матэрыялу, каб вывучаць і добрыя практыкі, і збоі ў іх паводзінах. Дадатковы год ці два перад дасягненьнем крытычнага ўзроўню магчымасьцяў можна было б выкарыстаць, каб зьменшыць рызыку сур’ёзнай памылкі.
Аўтар вылучае чатыры напрамкі працы.
- Аперацыйная надзейнасьць. Навучаньне і разгортваньне сучасных мадэляў — гэта тысячы людзей, мільёны чыпаў і надзвычай складаная інфраструктура. Праблемы часта ўзьнікаюць не праз адсутнасьць тэорыі, а праз памылкі ў выкананьні: маніторынгу, пясочніцах, асяродзьдзях навучаньня і працы з дадзенымі.
- Бясьпечныя паводзіны мадэляў. Ёсьць прагрэс у навучаньні мадэляў быць карыснымі, этычнымі і выконваць зададзеныя правілы. Але нечаканыя выпадкі непажаданага паводзінаў мадэляў усё яшчэ здараюцца. Патрэбна лепш разумець іхныя прычыны і ўмець іх папярэджваць.
- Разуменьне таго, што адбываецца ўнутры мадэлі. Інтэрпрэтаванасьць — гэта спроба зазірнуць у «мозг» ШІ і зразумець, чаму ён прымае пэўныя рашэньні. Яна ўжо дапамагае правяраць мадэлі перад выпускам, але мы ўсё яшчэ разумеем толькі невялікую частку ўнутраных працэсаў.
- Тэсты і ацэнкі. Чым мацнейшая мадэль, тым лепш яна можа праходзіць тэсты, хаваючы праблемы. Патрэбныя больш разнастайныя і вынаходлівыя праверкі, а таксама параўнаньне іх з тым, што паказвае аналіз унутранай працы мадэлі.
Што атрымаюць незалежныя ацэншчыкі
Гэта ня мусіць быць фармальная праверка раз на год. Незалежная каманда павінна мець пастаянны доступ да інструмэнтаў і дазволаў, параўнальных з доступам унутраных камандаў, якія ацэньваюць рызыкі. Anthropic плянуе даць такой камандзе працоўныя месцы ў офісе, пропускі, карпаратыўныя ноўтбукі і доступ да працоўных прастораў.
Паводле задумы, ацэншчыкі змогуць публікаваць ключавыя высновы пра рызыкі, інцыдэнты, практыкі кампаніі і пра тое, які доступ яны атрымалі або не атрымалі. Anthropic зможа закрыць толькі зьвесткі, адчувальныя для бясьпекі, абароненыя законам, камэрцыйныя таямніцы або прыватныя дадзеныя трэціх бакоў. Непрыемныя для кампаніі высновы хаваць нельга. Калі рэдагаваньне нешта істотнае прыбярэ, ацэншчыкі змогуць сказаць пра гэта публічна.
Навошта гэта трэба? Па-першае, каб праверыць, ці сапраўды кампанія выконвае ўласныя абяцаньні пра навучаньне, разгортваньне і абарону мадэляў. Па-другое, дзеля празрыстасьці. І па-трэцяе, незалежная каманда можа заўважыць тое, што ўнутраныя супрацоўнікі не ўбачылі праз камэрцыйны ці арганізацыйны ціск.
Пра канкурэнцыю і Кітай
У межах дэмакратыяў Амадэі лічыць найбольш дзейсным рэгуляваньне, якое распаўсюджваецца на ўсіх распрацоўнікаў перадавых мадэляў, а ня толькі на добраахвотнікаў. Адзін з магчымых мэханізмаў — кантрольныя пункты: калі мадэль набывае пэўную здольнасьць, кампанія павінна пацьвердзіць, што ёсьць адпаведныя меры бясьпекі.
Напрыклад, мадэль, здольная абыходзіць звычайныя пясочніцы, мусіць прайсьці праверкі, якія паказваюць, што яна з малой верагоднасьцю паспрабуе вырвацца з асяродзьдзя і захапіць шмат кампутараў. Можна таксама абмяркоўваць абмежаваньні на вылічальную магутнасьць, тыпы навучальных запускаў або выкарыстаньне ШІ для паляпшэньня ШІ. Але такія правілы, прызнае аўтар, можа быць лягчэй абысьці.
Запавольваньне ня можа ігнараваць геапалітыку. Амадэі лічыць, што дэмакратыям важна захоўваць перавагу над аўтарытарнымі рэжымамі, найперш над Кітаем. Ён прапануе не прадаваць Кітаю магутныя ШІ-чыпы і абсталяваньне для іх вытворчасьці, змагацца з кантрабандай і дыстанцыйным доступам да датацэнтраў, супрацьдзейнічаць несанкцыянаванаму капіяваньню паводзінаў перадавых мадэляў і лепш абараняць вагі мадэляў ад крадзяжу.
Ці магчымая глябальная дамова
Глябальнае пагадненьне будзе значна складанейшым. Амадэі прапануе рухацца ад найбольш рэалістычных крокаў да найбольш складаных: забараніць відавочна небясьпечныя ўжываньні ШІ, напрыклад стварэньне біялягічнай зброі; дамаўляцца пра тэставаньне мадэляў перад выпускам; абмяркоўваць абмежаваньне хуткасьці рэкурсіўнага самаўдасканаленьня; і толькі потым — пра шырокае абмежаваньне тэмпу разьвіцьця ШІ.
Апошні варыянт ён лічыць малаверагодным у найбліжэйшы час: спакуса таемна парушыць дамову будзе вельмі вялікай. Але нават без фармальных пагадненьняў карысна мяняць нормы ў індустрыі — адкрыта гаварыць пра рэкурсіўнае самаўдасканаленьне і пра выпадкі, калі мадэлі паводзяць сябе не так, як ад іх чакалі.
Выснова
Амадэі не адмаўляецца ад перакананьня, што ШІ можа моцна палепшыць чалавечае жыцьцё. Але карысьць прыйдзе толькі тады, калі тэхналёгію будуць ствараць належным чынам. Прагрэс можа заставацца хуткім — а час, які дасьць больш асьцярожны тэмп, трэба выдаткаваць на надзейную працу сыстэмаў, лепшыя праверкі і большае разуменьне таго, што робяць мадэлі.
«Меры, якія я прапаную, каб рухацца па перадавым краі ў бясьпечным тэмпе, ня будуць лёгкімі. Але я лічу, што мы абавязаныя паспрабаваць».
Арыгінал: Dario Amodei — We Must Pace the Frontier.