Новый материал Hugging Face показывает движение в менее шумном, но практичном классе тестов: модели оценивают не разговорную убедительность, а способность понять, кто именно говорил в записи с несколькими участниками.
Новый рейтинг Hugging Face переносит проверку распознавания речи из чистой студийной записи в дальние микрофоны, шум и эхо. Это важный сдвиг: для голосовых агентов точность в комнате часто важнее красивого результата на идеальном наборе данных.
На Hugging Face вышли сразу три заметные открытые новинки: NVIDIA выпустила компактную модель Cosmos 3 Edge для робототехники и машинного зрения, Veda Labs представила Vedika с заявленным окном контекста до 1 миллиона токенов, а interfaze показала diffusion-gemma-asr-small — необычную открытую модель распознавания речи на диффузионной архитектуре.
В свежем выпуске по открытому ИИ — сильная модель для расшифровки длинных разговоров с разделением спикеров и компактная 1-битная сборка Bonsai 27B для локального запуска. Обе находки про одно и то же: открытые инструменты становятся практичнее и ближе к обычному железу.
Cohere представила Transcribe Arabic — открытую модель распознавания арабской речи, рассчитанную на диалекты, смешанную арабско-английскую речь и корпоративные сценарии. Компания заявляет, что модель обошла открытые альтернативы по точности и в сравнении с Whisper получила заметно более высокую оценку у носителей языка.