Hugging Face вынесла оценку открытых голосовых моделей в отдельный Open TTS Leaderboard, а Bongard-mini показывает, что эксперименты с моделями на открытых весах продолжают дробиться на узкие проверяемые направления. В обоих случаях важна воспроизводимость, а не только громкий запуск.
В свежем дайджесте open-source AI — мультимодальная модель NVIDIA для точной локализации объектов, компактная модель HRM-Text-1B для рассуждений, линейка Mellum 2 от JetBrains для задач разработки и потоковая ASR-модель Nemotron 3.5 для голосовых сценариев.