Atria Dawn Preview: открытая агентная модель на 744 млрд параметров

Shanghai AI Laboratory опубликовала Atria Dawn Preview — предварительный релиз новой агентной модели на базе mixture-of-experts GLM-5.2 foundation с 744 млрд параметров. Важность релиза в том, что Китай продолжает наращивать стек очень крупных open-weight агентных моделей: с длинным контекстом, явным reasoning и ориентацией на сложные задачи, а не только на чат.

Xiaomi выпустила MiMo V2.6 Pro и Flash с контекстом до 1 млн токенов

Xiaomi представила серию MiMo-V2.6: Pro как более сильную модель и Flash как более дешёвый вариант. Модели заявлены как нативно omnimodal и поддерживают очень длинный контекст. Для рынка это сигнал, что Xiaomi хочет быть не только производителем устройств, но и заметным игроком в API и open-model экосистеме.

Meta обновила Muse Spark до версии 1.3 для долгих задач программирования

Muse Spark 1.3 описывается как модель для более длинных рабочих процессов: она должна лучше держать контекст, сотрудничать с пользователем и вести несколько workflow в одном длинном треде. Это продолжает гонку coding agents, где выигрывает не только модель с хорошим single-turn benchmark, а система, которая не разваливается на длинной задаче.

InclusionAI добавила зрение в Ling 3.0 Flash VL

Ling 3.0 Flash VL расширяет смесь экспертов Ling 3.0 Flash нативным visual perception и возможностями visual-agent. Модель сохраняет гибридное поведение — быстрые ответы и reasoning-режим — плюс tool calling. Это важно для рабочих процессов, где агент должен не только читать текст, но и понимать изображения, интерфейсы и документы.

LLM Gateway выпустил Smart Route для маршрутизации моделей

Smart Route — это не foundation model, а слой выбора модели и маршрутизации. Но он важен как симптом рынка: стоимость, доступность и выбор подходящей модели становятся отдельным продуктом. Для пользователей это означает, что модельная инфраструктура всё чаще будет выглядеть как управляемый роутер, а не как ручной выбор одного провайдера.

Transformers получил поддержку llama.cpp quantized models

Hugging Face добавила в Transformers поддержку quantized-моделей из экосистемы llama.cpp. Практический эффект — меньше трения между локальными форматами вроде GGUF и привычным Python-стеком Transformers. Это полезно для команд, которые хотят запускать компактные модели локально, но не хотят уходить из основного инструментария разработки.

Главный сдвиг недели: гонка моделей всё меньше похожа на линейное соревнование «у кого больше benchmark». Важнее становятся агентная устойчивость, длинный контекст, мультимодальность, маршрутизация и возможность запускать модели дешевле и ближе к пользователю.