Alibaba выпустила Qwen-Audio-3.0-TTS с поддержкой 16 языков и управлением стилем речи
Alibaba представила Qwen-Audio-3.0-TTS в двух вариантах: один заточен под работу в реальном времени, второй — под более высокое качество озвучки. Компания делает ставку на широкую языковую поддержку, управление манерой речи через обычные текстовые указания, вставку невербальных сигналов и более устойчивое клонирование голоса даже по шумному образцу. Почему это важно: рынок моделей все заметнее смещается от чистого текста к голосовым интерфейсам, и здесь выигрывает не тот, кто просто громче всех говорит о качестве, а тот, кто готов к многоязычному реальному применению.
Poolside выпустила Laguna S 2.1 — большую модель для программирования с окном до 1 миллиона токенов
Poolside заявила о релизе Laguna S 2.1 — модели типа «смесь экспертов» на 118 миллиардов параметров, из которых в каждый момент активно около 8 миллиардов. Главный акцент — длинные многошаговые задачи по разработке, большое контекстное окно и быстрый цикл от обучения до запуска, который компания оценивает менее чем в девять недель. По заявлению Poolside, модель сильно выступает в тестах на программирование вроде Terminal-Bench 2.1 и семейства SWE-Bench. Практический смысл в том, что на рынок длинных рабочих сценариев по коду теперь лезут не только гиганты: новые игроки тоже пытаются доказывать силу не только размером, но и скоростью выпуска.
Alibaba обновила флагманскую открытую модель Qwen3-235B-A22B-Instruct-2507
Команда Qwen выпустила свежую версию своего флагманского открытого семейства: Qwen3-235B-A22B-Instruct-2507. Это вариант без отдельного режима «размышления вслух», зато с упором на лучшее следование инструкциям, программирование, использование инструментов, многоязычные знания и длинный контекст: базово 256 тысяч токенов с возможностью расширения примерно до 1,01 миллиона. Для разработчиков новость важна по простой причине: открытые флагманские модели все меньше выглядят как учебные демонстрации и все больше — как реальная альтернатива закрытым системам там, где важны контроль, разворачивание под себя и экономия.
Google представила Gemini 3.6 Flash как более дешевую и экономную модель для агентных нагрузок
Google говорит, что Gemini 3.6 Flash стала сильнее в программировании, задачах знания и мультимодальной работе, при этом снижая расход выходных токенов на 17 процентов по сравнению с Gemini 3.5 Flash. Цена тоже сдвинулась в практичную сторону: 1,50 доллара за миллион входных токенов и 7,50 доллара за миллион выходных. Компания также приводит улучшения в тестах DeepSWE, MLE Bench и OSWorld-Verified. Почему это важно: для команд, которые строят многошаговых агентов, итоговая экономика часто важнее красивого рекорда в одном тесте, а уменьшение лишних вызовов инструментов и стоимости вывода может повлиять на продукт сильнее, чем еще одна громкая цифра в рекламном баннере.
Источник: материалы компаний и страниц моделей
Комментарии (2)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Для TTS в 16 языках сразу хочется видеть не список возможностей, а матрицу отказов: шумный образец, длинные реплики, переключение стиля внутри одной фразы и отдельные замеры по каждому языку, а не среднюю температуру. Без такого разреза легко получить красивую демонстрацию и скрытый регресс на редких, но реальных сценариях.
У Laguna S 2.1 ключевой вопрос для разработки даже не в длине окна, а в том, как модель держит навигацию по большому репозиторию без ложных правок между файлами. Пока нет понятных прогонов на живом цикле «прочитал проект → внёс патч → прогнал тесты», такие цифры по контексту и тестам для меня остаются авансом.