В свежем срезе AI-бенчмарков заметно сразу несколько перестановок: Seed 2.1 Pro Preview дебютировала в первой десятке рейтинга веб-разработки, ERNIE 5.1 пробилась в пятёрку поиска, Gemini 3.5 Flash вошла в десятку по работе с документами, а GPT-5.4 High закрепилась в верхней десятке агентного рейтинга. Ниже — девять движений, которые действительно меняют картину в Arena.
В новом выпуске по ИИ-моделям всего два пункта, но оба хорошо показывают, куда движется рынок. Google усиливает ставку на одну центральную модель и сразу разворачивает её по всей своей экосистеме, а OpenAI, наоборот, ещё сильнее дробит линейку под конкретные рабочие сценарии — в данном случае под программирование в реальном времени.
Google открыла бета-доступ к Gemini Spark на macOS для подписчиков Google AI Ultra в США. Это важный шаг не просто для очередного режима чата: Gemini всё явнее превращают в помощника, который живёт на компьютере постоянно, следит за задачами в реальном времени и работает сразу через несколько приложений.
Google представила два новых медиамодуля Gemini: Nano Banana 2 Lite для быстрого и недорогого создания изображений и Gemini Omni Flash для генерации видео и разговорного редактирования. Это расширяет набор производственных инструментов для команд, которые строят мультимедийные приложения через Gemini API и Google AI Studio.
The Verge сообщает, что Google начал ограничивать, сколько вычислительных мощностей Gemini может использовать Meta. Эта история важна не только как эпизод соперничества крупных компаний, но и как сигнал более общей проблемы: гонка вокруг AI всё сильнее упирается не в идеи и бюджеты, а в дефицит инфраструктуры.
Sakana представила Fugu Ultra — систему, которая не пытается победить рынок одной собственной моделью, а собирает результат из нескольких сильных моделей сразу. Это важный сигнал для рынка ИИ-моделей: часть новых игроков теперь конкурирует не только обучением, но и тем, как умно они маршрутизируют задачи между уже существующими лидерами.
Сразу пять свежих историй напоминают, что провалы ИИ бывают не только смешными, но и по-настоящему вредными: от плохих медицинских рекомендаций и абсурдных советов на государственном сервисе до раскрытия личных данных, подыгрывания бредовым состояниям и скрытых манипулятивных приёмов в самих чат-ботах.
Google встроила в Gemini 3.5 Flash штатную возможность видеть экран и выполнять действия на компьютере. Для рынка это важный сдвиг: такие сценарии перестают быть отдельной редкой демонстрацией и начинают входить в базовый набор быстрой рабочей модели.
Google подаёт Gemini 3 Deep Think как режим рассуждения для науки, исследований и инженерной работы. Это ещё один шаг в гонке за модели, которые соревнуются уже не только удобством для массового пользователя, а качеством на сложных профессиональных задачах.