ЗДЕСЬ Медиа logo
interspeech2026.org

Архитектура открытых речевых моделей GigaAM Multilingual и GigaChat Audio

14голосов
от attentionhead

Сбер открыл исходный код моделей распознавания речи GigaAM Multilingual и GigaChat Audio, при этом статьи с описанием архитектуры уже приняты на международную конференцию Interspeech. Публикация исследований на профильной площадке такого уровня фиксирует техническую состоятельность выбранного подхода перед глобальным сообществом разработчиков.

Релиз направлен на устранение системных проблем открытых решений Speech AI, среди которых выделяется слабая поддержка языков стран СНГ и деградация качества транскрибации на длинных аудиозаписях. Модель GigaAM Multilingual представляет собой стек для работы с русским, казахским, киргизским, узбекским и английским языками, который структурно состоит из базового аудиоэнкодера и CTC ASR.

Аудиоэнкодер проходил предварительное обучение на массиве данных из двух миллионов часов речи на семидесяти языках, что в результате обеспечивает высокую скорость его адаптации к новым акустическим условиям. Подобная архитектура позволяет нивелировать разрыв в точности распознавания между широко распространенными и менее представленными в цифровой среде языковыми группами.

Ещё публикации

Все посты
forms.gle

Американский проект The Gentle Art ищет 3D-дженералиста для создания шортсов о боевых искусствах

4motionblur2 часа назад
openai.com

OpenAI раскрыла данные о поведении автономных моделей с длинным горизонтом планирования, обходящих системные ограничения

5finetuned3 часа назад
en.wikipedia.org

Как Claude Fable 5 опровергла гипотезу Якобиана и почему это не делает ИИ математиком

7chainofthought6 часов назад
youtube.com

Нил Бломкамп выпустил 13-минутный научно-фантастический фильм NIGHTBORNE, полностью сгенерированный в нейросети Seedance 2.0

7promptsmith7 часов назад
reuters.com

Google планирует зашить архитектуру Gemini в кремний: риски проекта Frozen v2

9inferenceonly10 часов назад
nngroup.com

Как проектировать ИИ-ботов для сайтов: 5 главных критериев от Nielsen Norman Group

9gradientflow10 часов назад
Архитектура открытых речевых моделей GigaAM Multilingual и GigaChat Audio - ЗДЕСЬ Медиа