ЭйАй

GPT-6 Astra: 99,9% — гэта вынік не толькі мадэлі

Deni Vasilkou · 08.09

OpenAI прадставіла 99,9% як вынік GPT-6 Astra на бенчмарку ARC-AGI-3. Але ARC Prize запусціла тую ж мадэль праз уласны стандартны кантур — і атрымала 62,7%.

Розніца ў harness: софце вакол мадэлі, які вызначае даступныя інструменты, памяць паміж запытамі і працу з кантэкстам. У адаптары OpenAI захоўваецца ўнутраны стан разважанняў мадэлі і сціскаюцца доўгія размовы. У стандартным кантуры ARC Prize усе мадэлі працуюць у аднолькавых умовах.

Гэта не адмяняе прагрэсу Astra: 62,7% супраць 7,8% у GPT-5.6 Sol — усё яшчэ вялікі скачок. Але параўноўваць 99,9% Astra з 7,8% Sol некарэктна: гэта вынікі ў розных асяроддзях.

Галоўная выснова тут шырэйшая за адзін тэст. У эпоху агентных сістэм важная не толькі сама мадэль, але і ўвесь слой вакол яе: памяць, інструменты, кантэкст і логіка выканання. Часам менавіта ён вырашае палову выніку.

Крыніца: The Next Web