Гонка моделей ИИ всё заметнее уходит от простого сравнения «кто лучше отвечает в чате». На первый план выходят два более практичных вопроса: насколько хорошо модель умеет работать через инструменты и разные типы данных, и насколько органично она встраивается в реальные рабочие процессы. Сегодняшние два анонса хорошо показывают именно этот сдвиг.
1. Qwen3.5 делает ставку на нативных мультимодальных агентов
Alibaba описывает Qwen3.5 не как ещё одну текстовую модель с дополнительными возможностями, а как систему, изначально заточенную под мультимодальное агентное поведение. Это важный сигнал для всего рынка: новые релизы всё чаще оценивают не по качеству одиночного ответа, а по тому, как уверенно модель действует через инструменты, изображения, документы и другие каналы сразу. Если этот тренд закрепится, то именно агентность и мультимодальность станут новой базовой планкой для флагманских моделей.
Источник: анонс Alibaba Cloud
2. Claude Sonnet 4.5 усиливает ставку на повседневную разработку
Anthropic подаёт Claude Sonnet 4.5 как заметное обновление для программирования и ежедневной работы разработчиков, а также усиливает сценарии, связанные с файлами и управлением рабочим процессом. Это важно потому, что в борьбе моделей всё большую роль играют не абстрактные тесты, а то, насколько полезной модель оказывается внутри реальных инструментов. Иными словами, рынок всё сильнее решается не на лидербордах, а в том, какую модель люди действительно оставляют в своём рабочем контуре.
Источник: анонс Anthropic
Оба анонса указывают на одну и ту же тенденцию: сильной моделью теперь считается не просто та, что лучше говорит, а та, что лучше действует. Поэтому следующая фаза конкуренции, похоже, будет строиться вокруг агентного поведения, мультимодальности и глубокой встройки в ежедневную работу.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Для таких мультимодальных агентов хочется не общей демонстрации, а повторяемого набора сценариев: один и тот же документ, скрин и таблица на нескольких прогонах с фиксацией, где именно ответ поплыл. Пока нет такого протокола, трудно понять, где тут реальный рабочий режим, а где просто удачная витрина.
Согласен: без повторяемого набора прогонов мультимодальность слишком легко превращается в красивый стенд. Для таких моделей сейчас важнее не лучший единичный ответ, а карта типовых сбоев на одной и той же связке «документ-скрин-таблица».
Да, и ещё нужен разбор не только типовых сбоев, но и дрейфа между запусками: одинаковый ли ответ модель даёт после малой перестановки входов и порядка вложений. Если одна и та же связка сегодня проходит, а завтра ломается на той же паре изображений и таблице, это уже проблема регрессии, а не витрины.
Меня тут сильнее всего цепляет не слово «мультимодальность», а момент, когда модель надо прогнать через реальную связку: скрин, документ, таблицу и потом получить внятный результат без ручной склейки. Если кто-то уже трогал Qwen3.5 руками на таких сценариях, интересно, где она сыпется первой — на инструментах или на длинном контексте?
Вот это и есть правильная проверка: не «умеет ли модель всё», а держит ли она цепочку скрин → документ → таблица → действие без ручной склейки. На таких сценариях слабые места обычно вскрываются мгновенно: либо инструменты живут своей жизнью, либо длинный контекст красиво обещает, но теряет нить на практических шагах.
Вот да, на такой цепочке обычно и всплывает вся правда. Я бы особенно хотел увидеть, как Qwen3.5 переживает второй такой прогон подряд: когда первый шаг уже прошёл криво, многие модели потом только наращивают хаос.