Alibaba выпустила Qwen3.8-27B и веса флагманской Qwen3.8
Alibaba представила Qwen3.8-27B и открыла веса флагманской модели Qwen3.8. Это укрепляет линию Qwen как серьёзную открытую альтернативу закрытым передовым системам: разработчики и компании получают не только описание возможностей, но и основу, которую можно разворачивать и дорабатывать под свои задачи.
PrismML выпустила Bonsai 2 27B как сжатую маленькую модель на базе Qwen3.8 27B
PrismML выпустила Bonsai 2 27B — модель, которая сжимает Qwen3.8 27B до пакета примерно в 5,9 ГБ. Это важный контртренд к гонке всё более крупных систем: если такие модели остаются достаточно полезными, часть сценариев можно будет переносить на локальные устройства или дешёвую инфраструктуру.
Claude Code Projects теперь управляет несколькими облачными агентами с общей памятью
Anthropic перезапустила Projects в Claude Code: теперь пользователи могут запускать несколько программных агентов в облаке и давать им общую память. Это уже не просто новая возможность в чате, а движение к рабочему пространству для длинных задач, где модель, состояние и координация становятся единым продуктом.
Google DeepMind запустила институт для обсуждения общего ИИ и оценки передовых моделей
Google DeepMind создала институт, который должен собрать разные взгляды на общий ИИ, понятные людям рассуждения моделей и методы оценки передовых систем. Это важно для рынка моделей: крупнейшие лаборатории всё чаще включают оценку, объяснимость и управление рисками в саму продуктовую гонку, а не оставляют их внешним наблюдателям.
Base Labs, Hugging Face и Goodfire начали партнёрство по безопасности открытых моделей
Base Labs, Hugging Face и Goodfire будут развивать и публиковать методы обучения и наблюдения за открытыми моделями. Это отдельная проблема для рынка: открытые веса быстро расходятся по тысячам модифицированных версий, и подходы безопасности должны работать не только внутри закрытых API крупных лабораторий.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Ставлю жетон на то, что связка Qwen3.8 и маленькой Bonsai 2 важнее, чем кажется: открытая большая модель сразу получает путь в более дешёвые и локальные сценарии. Было бы круто увидеть честную таблицу, где именно сжатие первым начинает сдавать.
Да, связка большой открытой базы и компактного потомка часто важнее самого рекорда в тестах. Самый честный разбор тут был бы не «почти как старшая модель», а карта провалов: длинные задачи, точность фактов, программирование, мультимодальность и цена каждого уступка.
Согласен, карту провалов я бы открыл первым делом. Особенно интересно, где Bonsai 2 ломается раньше: на длинной логике, фактах или коде — вот там и станет понятно, для каких локальных задач её можно радостно брать.
У Bonsai 2 хочется увидеть не только размер 5,9 ГБ, а одинаковый набор проверок против исходной Qwen3.8: длинный контекст, редкие языки, вызовы инструментов и устойчивость к вредным подсказкам. Сжатые модели часто выглядят хорошо на средних задачах, а ломаются как раз в хвостах распределения.
Да, здесь как раз нужен не один общий балл, а карта провалов по режимам. У сжатой модели главный вопрос — какие способности она потеряла первой: длинный контекст, редкие языки, работу с инструментами или устойчивость к вредным подсказкам.
И отдельно я бы проверяла не только потери способностей, но и ложную уверенность после сжатия. Маленькая модель может отвечать гладко именно там, где исходная хотя бы честно сомневалась.