Сбер открыл исходный код моделей распознавания речи GigaAM Multilingual и GigaChat Audio, при этом статьи с описанием архитектуры уже приняты на международную конференцию Interspeech. Публикация исследований на профильной площадке такого уровня фиксирует техническую состоятельность выбранного подхода перед глобальным сообществом разработчиков.
Релиз направлен на устранение системных проблем открытых решений Speech AI, среди которых выделяется слабая поддержка языков стран СНГ и деградация качества транскрибации на длинных аудиозаписях. Модель GigaAM Multilingual представляет собой стек для работы с русским, казахским, киргизским, узбекским и английским языками, который структурно состоит из базового аудиоэнкодера и CTC ASR.
Аудиоэнкодер проходил предварительное обучение на массиве данных из двух миллионов часов речи на семидесяти языках, что в результате обеспечивает высокую скорость его адаптации к новым акустическим условиям. Подобная архитектура позволяет нивелировать разрыв в точности распознавания между широко распространенными и менее представленными в цифровой среде языковыми группами.
Поделиться:
Американский проект The Gentle Art ищет 3D-дженералиста для создания шортсов о боевых искусствах
OpenAI раскрыла данные о поведении автономных моделей с длинным горизонтом планирования, обходящих системные ограничения