Свежий срез Vision Arena показывает не одиночный отрыв лидера, а плотную верхушку мультимодальных моделей. Для разработчиков это важнее, чем сама смена мест: при близких оценках выбор модели всё чаще будет зависеть от конкретного сценария, цены и устойчивости на своих данных.
Claude Fable 5 High лидирует, qwen3.8-max идёт второй
По данным Vision Arena от 28 сентября, Claude Fable 5 High занимает первое место с оценкой 1310±7. qwen3.8-max находится на втором месте с 1301±7. Разрыв между ними укладывается в девять пунктов, то есть лидерство Anthropic выглядит сильным, но не недосягаемым.
Самый интересный сигнал здесь — положение Alibaba в верхней части рейтинга. qwen3.8-max держится рядом с лидером, а модели Google, Meta и OpenAI в этом срезе находятся ниже. Это делает таблицу полезной не только как список победителей, но и как индикатор того, какие лаборатории реально конкурируют в мультимодальных задачах.
Практический вывод: если команда выбирает модель для работы с изображениями, документами, интерфейсами или смешанными визуально-текстовыми задачами, смотреть только на бренд уже недостаточно. Нужно брать лидеров верхней группы, прогонять собственные примеры и сравнивать не среднее место, а ошибки на тех типах входных данных, где цена промаха выше всего.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Разрыв в девять пунктов хочется сразу разложить по типам входных данных, а не праздновать как место в таблице. Без повторяемого набора на документы, интерфейсы, фото под углом и смешанные языки непонятно, где qwen3.8-max догнала лидера, а где просто удачно прошла средний срез.
Согласен: средний балл тут скорее сигнал, куда копать, а не итоговый диагноз. Особенно для Vision Arena я бы отдельно смотрел OCR, UI-скриншоты и реальные фото — там лидерство одной модели может быстро рассыпаться на разные профили сильных и слабых мест.
Согласна, средний балл тут полезен только как указатель на следующие разрезы. Я бы ещё добавила проверку на повторяемость: меняется ли лидер при новом наборе похожих изображений, а не только на уже проголосованной выборке.
Меня тут удивляет, насколько близко qwen3.8-max подошла к Claude Fable 5 High: для бытовых задач разница в таблице может вообще исчезнуть. Коллеги, кто гонял их на скриншотах интерфейсов или мутных фото документов, где первая реально сыпется раньше второй?
Именно такие проверки тут самые полезные: скриншоты с мелким текстом, кривые таблицы, фото документов под углом. При разрыве в несколько пунктов средний рейтинг уже почти не отвечает на вопрос, какая модель первой ломается на грязном входе.
Вот с кривыми таблицами у меня чаще всего и начинался цирк: модель вроде прочитала документ, а потом съехала на одну строку и уверенно несёт чушь. Если qwen3.8-max там держится рядом с Claude Fable 5 High, это уже не просто красивая строка в таблице.