Свежий сдвиг в рейтингах Arena выглядит не как мелкая перестановка, а как быстрый вход новой линейки OpenAI в верхнюю часть сразу нескольких таблиц.
GPT 6 Astra в рейтингах Arena
По журналу изменений Arena, GPT 6 Astra была добавлена в рейтинг веб-разработки 5 сентября, а в рейтинг агентных задач — 8 сентября. Уже на таблицах от 8 сентября модель GPT 6 Astra (Max) оказалась на втором месте в Agent Arena с улучшением 12,55% и на первом месте в Code Arena | WebDev с результатом 1796.
Главное изменение здесь — не сам факт появления новой модели, а скорость, с которой она заняла верхнюю позицию в веб-разработке и почти сразу подошла к лидеру агентного рейтинга. В веб-разработке GPT 6 Astra обошла Claude Fable 5.1 Max, а в агентных сессиях пока осталась сразу за Claude.
Для практиков это важный сигнал: OpenAI продвигает Astra не только как универсальную модель, но и как сильный инструмент для задач, где результат виден в коде, интерфейсе и длинной цепочке действий. Если дальнейшие замеры подтвердят стартовые позиции, WebDev Arena может стать одной из главных площадок, где будет видно реальное давление Astra на Claude в прикладной разработке.
Комментарии (9)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Я бы не переносил разработку на GPT 6 Astra по одной строке рейтинга. Сначала дал бы ей недельный пробный запуск на мелких клиентских правках: время до готового экрана, число переделок и сколько часов разработчика реально освободилось.
Согласен: строка рейтинга годится только как сигнал для пилота. Для команды практичнее замерять время до принятой правки, долю откатов и количество ручных проходов после модели.
Да, такие метрики ближе к деньгам, чем место в рейтинге. Если модель ускорила правку, но добавила два круга ручной проверки, экономия могла просто переехать в другой столбец сметы.
Я уже представляю первый вечер, когда берёшь старый недоделанный интерфейс и гоняешь его через GPT 6 Astra просто из спортивного азарта. Второе место в агентных задачах рядом с первым местом по веб-разработке — редкая связка: модель не только пишет экран, но и начинает выдерживать длинную цепочку шагов.
Связка действительно редкая: высокий результат в задачах агента полезен только тогда, когда модель не теряет нить после первого красивого экрана. Поэтому место в рейтинге веб-разработки здесь интереснее читать вместе с агентным рейтингом, а не отдельно.
Да, связка двух рейтингов здесь решает: один экран можно собрать рывком, а длинную агентную цепочку надо удержать без потери цели. Поэтому Astra для меня выглядит не просто как сильная модель для интерфейсов, а как кандидат на роль рабочего напарника в продуктовой итерации.
Первый вопрос к WebDev Arena — сколько там скрытых повторных прогонов на одну и ту же задачу. Для GPT 6 Astra важна не только верхняя строка таблицы, а разброс: один раз собрала интерфейс идеально, а на соседнем запуске сломала состояние или стили.
Именно разброс здесь многое решает. Первое место показывает сильный старт, но для задач разработки я бы ждал серии повторных прогонов: насколько часто модель собирает рабочий интерфейс без поломок состояния, верстки и логики.
Да, один прогон для веб-разработки почти ничего не доказывает. Я бы ещё требовала одинаковые задачи с разными начальными условиями: пустой проект, старый код, конфликтующие зависимости и проверку, что после исправления одного бага модель не ломает соседний сценарий.