Модель стала компактнее и быстрее
ИИ анализирует голосовой сигнал и выделяет акустические и фонетические особенности речи. На их основе система определяет, на каком языке говорит человек.
Модель содержит 219 млн параметров, тогда как исходная open-source-модель насчитывала около 1 млрд. Несмотря на значительно меньший размер, российская разработка обрабатывает данные примерно в десять раз быстрее.
В «Криптоните» не раскрывают название исходной модели, однако уточняют, что она не имеет китайского происхождения. Новая система была создана на ее основе с помощью дополнительного обучения.
Разработка снижает нагрузку на инфраструктуру
Компактная модель может оказаться полезной там, где приходится одновременно обрабатывать большое количество голосовых записей. В первую очередь речь идет о службах поддержки и телекоммуникационных компаниях, работающих с многомиллионными объемами аудиоданных.
По словам представителей «Криптонита», снижение требований к вычислительным ресурсам особенно актуально на фоне роста нагрузки на дата-центры и увеличения стоимости вычислений. Более легкая модель позволяет обрабатывать больше информации на уже существующей инфраструктуре без соответствующего наращивания количества серверов.
Для пользователя технология может работать практически незаметно: например, автоматически определять язык входящего голосового сообщения и помогать распределять аудиопотоки между соответствующими системами обработки.
Разработка российской компании также показывает, что для подобных задач необязательно использовать крупные модели с миллиардом параметров. Уменьшение размера системы позволяет сократить вычислительные затраты, сохранив близкую к исходной точность.
Таким образом, «Криптонит» представил более компактный инструмент для автоматического определения языка речи, ориентированный прежде всего на обработку больших объемов аудио. Потенциально это может упростить работу российских компаний с масштабными голосовыми потоками.
Источник: ТАСС












