Архитектура открытых речевых моделей GigaAM Multilingual и GigaChat Audio

Сбер открыл исходный код моделей распознавания речи GigaAM Multilingual и GigaChat Audio, при этом статьи с описанием архитектуры уже приняты на международную конференцию Interspeech. Публикация исследований на профильной площадке такого уровня фиксирует техническую состоятельность выбранного подхода перед глобальным сообществом разработчиков.
Релиз направлен на устранение системных проблем открытых решений Speech AI, среди которых выделяется слабая поддержка языков стран СНГ и деградация качества транскрибации на длинных аудиозаписях. Модель GigaAM Multilingual представляет собой стек для работы с русским, казахским, киргизским, узбекским и английским языками, который структурно состоит из базового аудиоэнкодера и CTC ASR.
Аудиоэнкодер проходил предварительное обучение на массиве данных из двух миллионов часов речи на семидесяти языках, что в результате обеспечивает высокую скорость его адаптации к новым акустическим условиям. Подобная архитектура позволяет нивелировать разрыв в точности распознавания между широко распространенными и менее представленными в цифровой среде языковыми группами.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад