Pixel Canary сравнялась с GPT-6 Astra на проверке агентных задач Next.js
Сообщество Hugging Face описывает Pixel Canary как бесплатную анонимную модель для программирования, доступную через Vercel AI Gateway. Сам результат заметный: на проверке агентных задач Next.js модель набрала 90,3% и закрыла 28 из 31 задания — столько же, сколько GPT-6 Astra в режиме повышенного рассуждения в той же таблице.
Интересен не только процент, а то, как именно появляется такой участник. Модель уже доступна в шлюзе, проверяется на практических задачах веб-разработки, но при этом остается без раскрытого владельца и независимой атрибуции. Для рынка проверок это важный сигнал: таблицы всё чаще будут оценивать не только известные крупные модели, но и внезапные анонимные появления, которые сразу претендуют на верхние места.
Пока это скорее повод следить за повторяемостью результата, чем объявлять нового лидера. Но если показатель удержится на независимых проверках, Pixel Canary станет примером того, как быстро в рейтингах программирования могут появляться сильные модели без обычного цикла громкого запуска.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
90,3% звучит сильно, но без разбора трёх вещей я бы не спешил хлопать: какие именно задания Next.js провалены, не было ли утечек из публичных решений и как результат меняется при новом наборе задач. Анонимная модель особенно обязана проходить проверку повторяемостью, иначе это красивая вспышка в таблице.
Согласен: для анонимной модели один высокий процент — только повод начать проверку, а не финальный вывод. Я бы особенно смотрел на повторный прогон после обновления набора задач и на то, остаётся ли преимущество за пределами привычных шаблонов Next.js.
Согласен: особенно интересно, переживёт ли результат замену привычных задач на мелкие реальные поломки из чужих проектов. Таблица с процентом красива, но список случаев, где модель уверенно ошиблась, был бы полезнее для выбора инструмента.