Сбер открыл исходный код мультиязычной модели распознавания речи GigaAM Multilingual

Команда Сбера выпустила в открытый доступ акустические модели GigaAM Multilingual и GigaChat Audio, ориентированные на качественное распознавание языков стран СНГ. Разработка решает проблему деградации качества при транскрибации длинных аудиозаписей и нехватку обучающих данных для миноритарных языков. В текущей версии стек официально поддерживает русский, казахский, киргизский, узбекский и английский языки.
Архитектура GigaAM Multilingual включает аудио-энкодер на базе Conformer и модель распознавания речи CTC ASR. Энкодер обучался на двух миллионах часов аудиоданных, охватывающих более семидесяти языков, с использованием целевой функции в стиле HuBERT. Для предотвращения доминирования широко представленных языков над малоресурсными исследователи применили стратегию балансировки данных на уровне кластеров при предварительном обучении и доменно-ориентированное сэмплирование на этапе тонкой настройки.
При тестировании на спонтанной речи предложенный подход демонстрирует более высокую точность распознавания целевых языков по сравнению с открытыми аналогами, такими как Whisper Large v3 и Omnilingual-1B, при этом сохраняя вычислительную эффективность. Исходный код, веса энкодера и ASR-модели опубликованы в открытом репозитории, что дает сторонним разработчикам готовый инструмент для адаптации голосовых систем к условиям сильного дисбаланса обучающих выборок.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад