GPT-6 Astra: 99,9% — гэта вынік не толькі мадэлі
OpenAI прадставіла 99,9% як вынік GPT-6 Astra на бенчмарку ARC-AGI-3. Але ARC Prize запусціла тую ж мадэль праз уласны стандартны кантур — і атрымала 62,7%.
Розніца ў harness: софце вакол мадэлі, які вызначае даступныя інструменты, памяць паміж запытамі і працу з кантэкстам. У адаптары OpenAI захоўваецца ўнутраны стан разважанняў мадэлі і сціскаюцца доўгія размовы. У стандартным кантуры ARC Prize усе мадэлі працуюць у аднолькавых умовах.
Гэта не адмяняе прагрэсу Astra: 62,7% супраць 7,8% у GPT-5.6 Sol — усё яшчэ вялікі скачок. Але параўноўваць 99,9% Astra з 7,8% Sol некарэктна: гэта вынікі ў розных асяроддзях.
Галоўная выснова тут шырэйшая за адзін тэст. У эпоху агентных сістэм важная не толькі сама мадэль, але і ўвесь слой вакол яе: памяць, інструменты, кантэкст і логіка выканання. Часам менавіта ён вырашае палову выніку.
Крыніца: The Next Web